Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




3
Besoin d'un algorithme pour calculer la probabilité relative que les données proviennent de la distribution normale vs lognormale
Disons que vous avez un ensemble de valeurs et que vous voulez savoir s'il est plus probable qu'elles aient été échantillonnées à partir d'une distribution gaussienne (normale) ou échantillonnées à partir d'une distribution lognormale? Bien sûr, idéalement, vous devriez savoir quelque chose sur la population ou sur les sources d'erreur …

3
Quand la transformation z de Fisher est-elle appropriée?
Je veux tester la corrélation d'un échantillon pour la signification, en utilisant des valeurs de p, c'est-à-direrrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. J'ai compris que je peux utiliser la transformée en z de Fisher pour calculer cela en zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) et trouver la valeur de p …



4
Équivalent boxplot pour les distributions à queue lourde?
Pour les données distribuées approximativement normalement, les boîtes à moustaches sont un excellent moyen de visualiser rapidement la médiane et la répartition des données, ainsi que la présence de valeurs aberrantes. Cependant, pour les distributions plus lourdes, de nombreux points sont indiqués comme des valeurs aberrantes, car les valeurs aberrantes …


1
Lors de la construction d'un modèle de régression à l'aide d'ensembles de modélisation / validation distincts, est-il approprié de «recirculer» les données de validation?
Supposons que j'ai un partage 80/20 entre les observations de modélisation / validation. J'ai ajusté un modèle à l'ensemble de données de modélisation et je suis à l'aise avec l'erreur que je vois sur l'ensemble de données de validation. Avant de déployer mon modèle pour noter les observations futures, est-il …


1
Forêt aléatoire et prédiction
J'essaie de comprendre comment fonctionne Random Forest. J'ai une compréhension de la façon dont les arbres sont construits, mais je ne comprends pas comment Random Forest fait des prédictions sur l'échantillon hors du sac. Quelqu'un pourrait-il me donner une explication simple, s'il vous plaît? :)



1
Variable dépendante normalisée au sein d'un groupe dans les modèles de données de panel?
La normalisation d'une variable dépendante au sein du groupe d'identification est-elle logique? Le document de travail suivant (Ralentissement de la déforestation en Amazonie légale; prix ou politiques?, Pdf ) utilise une variable dépendante standardisée pour analyser l'effet du changement de politique générale au Brésil sur la déforestation. La normalisation se …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.