Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Évaluer les performances d'un modèle de régression en utilisant des ensembles de formation et de test?
J'entends souvent parler de l'évaluation des performances d'un modèle de classification en présentant l'ensemble de test et en entraînant un modèle sur l'ensemble de formation. Puis création de 2 vecteurs, un pour les valeurs prédites et un pour les vraies valeurs. Évidemment, faire une comparaison permet de juger des performances …

1
Comment signalez-vous un test de Mann – Whitney?
Je fais ma thèse, et je fais un certain nombre de tests. Après avoir utilisé un test de Kruskal – Wallis, je rapporte généralement le résultat comme ceci: Il y a une différence significative entre les moyennes de ...(χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) Mais maintenant, j'ai effectué un test de Mann – Whitney, …

4
Comment un test t peut-il être statistiquement significatif si la différence moyenne est proche de 0?
J'essaie de comparer les données de 2 populations pour savoir si la différence entre les traitements est statistiquement significative. Les ensembles de données semblent être normalement distribués avec très peu de différence entre les deux ensembles. La différence moyenne est de 0,00017. J'ai effectué un test t par paires, en …

2
Pourquoi utiliser Bonferroni sur Holm-Bonferroni?
Je peux voir pourquoi vous ne pouvez pas utiliser une méthode plus puissante, telle que la méthode Hochberg, sur la correction de Bonferroni, car ils peuvent avoir des hypothèses supplémentaires, telles que l'indépendance des hypothèses dans ce cas, mais je ne comprends pas pourquoi vous le feriez jamais utiliser la …


1
Pourquoi ( est censuré)
Dans un ensemble de problèmes, j'ai prouvé ce «lemme», dont le résultat n'est pas intuitif pour moi. est une distribution normale standard dans un modèle censuré.ZZZ Formellement, et . Ensuite, Il existe donc une sorte de connexion entre la formule d'attente sur un domaine tronqué et la densité au point …

2
Quelle est une bonne analogie pour illustrer les points forts des modèles bayésiens hiérarchiques?
Je suis relativement nouveau dans les statistiques bayésiennes et j'ai récemment utilisé JAGS pour construire des modèles hiérarchiques bayésiens sur différents ensembles de données. Bien que je sois très satisfait des résultats (par rapport aux modèles GLM standard), je dois expliquer aux non-statisticiens quelle est la différence avec les modèles …

3
Le concept de «prouvé statistiquement»
Lorsque les informations parlent de choses «prouvées statistiquement», utilisent-elles correctement un concept bien défini de statistiques, l'utilisent-elles mal ou utilisent-elles simplement un oxymore? J'imagine qu'une «preuve statistique» n'est pas en fait quelque chose qui est effectué pour prouver une hypothèse, ni une preuve mathématique, mais plutôt un «test statistique».
10 inference  proof 


2
Dans un test t à un échantillon, que se passe-t-il si dans l'estimateur de variance la moyenne de l'échantillon est remplacée par
Supposons un test t à un échantillon, où l'hypothèse nulle est . La statistique est alors utilisant l'écart type d'échantillon . Pour estimer , on compare les observations à la moyenne de l'échantillon : t = ¯ x - μ 0μ = μ0μ=μ0\mu=\mu_0 ss¯xt = x¯¯¯- μ0s / n√t=x¯−μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}}ssssssX¯¯¯x¯\overline{x} s …

1
Quelle est la différence fondamentale entre ces deux modèles de régression?
Supposons que j'ai une réponse bivariée avec une corrélation significative. J'essaie de comparer les deux façons de modéliser ces résultats. Une façon consiste à modéliser la différence entre les deux résultats: Une autre façon consiste à les utiliser ou à les modéliser: (yi2−yi1=β0+X′β)(yi2−yi1=β0+X′β)(y_{i2}-y_{i1}=\beta_0+X'\beta)glsgee(yij=β0+time+X′β)(yij=β0+time+X′β)(y_{ij}=\beta_0+\text{time}+X'\beta) Voici un exemple foo: #create foo data …



1
Comparaison de la CPH, du modèle de temps de défaillance accéléré ou des réseaux de neurones pour l'analyse de survie
Je suis nouveau dans l'analyse de survie et j'ai récemment appris qu'il existe différentes façons de le faire en fonction d'un certain objectif. Je suis intéressé par la mise en œuvre réelle et la pertinence de ces méthodes. On m'a présenté les traditionnels risques proportionnels de Cox , les modèles …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.