Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Comment fonctionne la normalisation quantile?
Dans les études d'expression génique utilisant des puces à ADN, les données d'intensité doivent être normalisées afin que les intensités puissent être comparées entre les individus, entre les gènes. Sur le plan conceptuel et algorithmique, comment fonctionne la «normalisation quantile» et comment expliqueriez-vous cela à un non-statisticien?

8
Comment NE PAS utiliser les statistiques
C'est en quelque sorte une question ouverte mais je veux être clair. Étant donné une population suffisante, vous pourriez être en mesure d'apprendre quelque chose (c'est la partie ouverte), mais quoi que vous appreniez sur votre population, quand est-il jamais applicable à un membre de la population? D'après ce que …




3
Est-il acceptable d'utiliser la distance de Manhattan avec la liaison inter-cluster de Ward dans le clustering hiérarchique?
J'utilise le clustering hiérarchique pour analyser les données de séries chronologiques. Mon code est implémenté à l'aide de la fonction MathematicaDirectAgglomerate[...] , qui génère des clusters hiérarchiques compte tenu des entrées suivantes: une matrice de distance D le nom de la méthode utilisée pour déterminer la liaison inter-cluster. J'ai calculé …




2
Le lien entre les statistiques bayésiennes et la modélisation générative
Quelqu'un peut-il me renvoyer à une bonne référence qui explique le lien entre les statistiques bayésiennes et les techniques de modélisation générative? Pourquoi utilisons-nous habituellement des modèles génératifs avec des techniques bayésiennes? Pourquoi est-il particulièrement intéressant d'utiliser les statistiques bayésiennes en l'absence de données complètes, voire pas du tout? Notez …


5
Différence entre les termes «distribution conjointe» et «distribution multivariée»?
J'écris sur l'utilisation d'une «distribution de probabilité conjointe» pour un public qui serait plus susceptible de comprendre la «distribution multivariée», donc j'envisage d'utiliser la dernière. Cependant, je ne veux pas perdre de sens en faisant cela. Wikipédia semble indiquer qu'il s'agit de synonymes. Sont-ils? Sinon, pourquoi pas?

2
Asymétrie / kurtosis mobile pondéré exponentiel
Il existe des formules en ligne bien connues pour calculer des moyennes mobiles pondérées exponentiellement et des écarts-types d'un processus . Pour la moyenne,(xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots} μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n et pour la variance σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) à partir de laquelle vous …

3
Comment optimiser mon script R pour utiliser le «multicœur»
J'utilise GNU R sur un PC Ubuntu-Lucid qui dispose de 4 processeurs. Afin d'utiliser les 4 CPU, j'ai installé le package "r-cran-multicore". Comme le manuel du paquet manque d'exemples pratiques que je comprends, j'ai besoin de conseils pour optimiser mon script afin d'utiliser les 4 CPU. Mon jeu de données …
15 r 

3
Bonnes introductions aux séries chronologiques (avec R)
Je recueille actuellement des données pour une expérience sur les caractéristiques psychosociales associées à l'expérience de la douleur. Dans le cadre de cela, je recueille électroniquement les mesures GSR et BP de mes participants, ainsi que diverses mesures autodéclarées et implicites. J'ai une formation psychologique et je suis à l'aise …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.