Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



2
Les valeurs de p pour le test de corrélation de Pearson peuvent-elles être calculées uniquement à partir du coefficient de corrélation et de la taille de l'échantillon?
Contexte: J'ai lu un article dans lequel les auteurs rapportent une corrélation de Pearson de 0,754 à partir de la taille de l'échantillon 878. La valeur de p résultante pour le test de corrélation est significative "deux étoiles" (c'est-à-dire p <0,01). Cependant, je pense qu'avec une taille d'échantillon aussi grande, …


2
Quelles statistiques descriptives ne sont pas des tailles d'effet?
Wikipédia dit la taille de l'effet est une mesure de la force d'un phénomène ou une estimation basée sur un échantillon de cette quantité. Une taille d'effet calculée à partir des données est une statistique descriptive qui transmet l'ampleur estimée d'une relation sans indiquer si la relation apparente dans les …

1
Premiers pas pour apprendre à prédire la série financière à l'aide de l'apprentissage automatique
J'essaie de comprendre comment utiliser l'apprentissage automatique pour prédire la série financière 1 étape ou plus dans le futur. J'ai une série temporelle financière avec des données descriptives et je voudrais former un modèle et ensuite utiliser le modèle pour prédire n étapes à venir. Ce que j'ai fait jusqu'à …


2
Nom du «paradoxe» rapporté par Gelman
Dans le livre d'Andrew Gelman "Red State, Blue State", il analyse le fait que les riches dans certains États ont tendance à voter plus républicains que les pauvres, mais que les États riches ont tendance à voter plus démocratiques que les États pauvres. Y a-t-il un nom pour ce paradoxe? …
12 paradox 

2
Comment tester la surdispersion dans Poisson GLMM avec lmer () dans R?
J'ai le modèle suivant: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... et voici la sortie récapitulative. > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 …

2
Lorsque les données ont une distribution gaussienne, combien d'échantillons la caractériseront?
Les données gaussiennes distribuées dans une seule dimension nécessitent deux paramètres pour la caractériser (moyenne, variance), et la rumeur veut qu'une trentaine d'échantillons sélectionnés au hasard est généralement suffisant pour estimer ces paramètres avec une confiance raisonnablement élevée. Mais que se passe-t-il lorsque le nombre de dimensions augmente? En deux …




5
Le chiffre 20 est-il magique?
J'ai des références qui ont conseillé d'envisager une taille d'échantillon d'au moins 20 pour la distribution de l'ajustement des données. Y a-t-il un sens à cela? Merci

3
La procédure à effets fixes de Mundlak est-elle applicable pour la régression logistique avec des variables muettes?
J'ai un ensemble de données avec 8000 grappes et 4 millions d'observations. Malheureusement, mon logiciel statistique, Stata, fonctionne assez lentement lorsque j'utilise sa fonction de données de panel pour la régression logistique: xtlogitmême avec un sous-échantillon de 10%. Cependant, lorsque vous utilisez la logitfonction non- panneau , les résultats apparaissent …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.