Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Résidus dans la régression du poisson
Zuur 2013 Beginners Guide to GLM & GLMM suggère de valider une régression de Poisson en traçant les résidus de Pearsons par rapport aux valeurs ajustées. Zuur déclare que nous ne devrions pas voir les résidus se dissiper à mesure que les valeurs ajustées augmentent, comme le tracé attaché (dessiné …

2
Régression multiple dans les statistiques directionnelles / circulaires?
J'essaie de développer un modèle prédictif pour une variable dépendante angulaire (sur utilisant plusieurs mesures indépendantes - également des variables angulaires, sur - comme prédicteurs. Chaque prédicteur est significativement mais pas extrêmement fortement corrélé avec la variable dépendante. Comment puis-je combiner les prédicteurs pour déterminer un modèle prédictif pour la …



2
Divergence contrastée persistante pour les RBM
Lorsque nous utilisons l'algorithme d'apprentissage de CD persistant pour les machines Bolzmann restreintes, nous commençons notre chaîne d'échantillonnage Gibbs dans la première itération à un point de données, mais contrairement au CD normal, dans les itérations suivantes, nous ne recommençons pas sur notre chaîne. Au lieu de cela, nous commençons …

2
Dans une méta-analyse, comment gérer des études non significatives ne contenant pas de données brutes?
Disons que je mène une méta-analyse, en examinant la performance du groupe A et du groupe B par rapport à une certaine construction. Maintenant, certaines des études que je vais rencontrer rapporteront qu'aucune différence statistique n'a pu être trouvée entre les deux groupes mais aucune statistique de test exacte et …

1
Test de surdispersion dans la régression logistique
R in Action (Kabacoff, 2011) suggère la routine suivante pour tester la surdispersion dans une régression logistique: Ajuster la régression logistique en utilisant la distribution binomiale: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Ajuster la régression logistique en utilisant la distribution quasibinomiale: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Utilisez …




2
Signification de l'erreur de test conditionnelle par rapport à l'erreur de test attendue dans la validation croisée
Mon manuel sur la validation croisée est Les éléments de l'apprentissage statistique par Hastie et al. (2e éd.). Dans les sections 7.10.1 et 7.12, ils parlent de la différence entre l'erreur de test conditionnelleE(X∗,Y∗)[L(Y,f^(X))|τ]E(X∗,Y∗)[L(Y,f^(X))|τ]E_{(X^*,Y^*)}[L(Y, \hat{f}(X))|\tau] et erreur de test attendue Eτ[E(X∗,Y∗)[L(Y,f^(X))|τ]].Eτ[E(X∗,Y∗)[L(Y,f^(X))|τ]].E_\tau [E_{(X^*,Y^*)}[L(Y, \hat{f}(X))|\tau]]. Ici ττ\tau est l'ensemble de données de …


1
Quel est le sens intuitif derrière le but et la mécanique des statistiques suffisantes?
La définition d'une statistique suffisante est: Soit X1, . . . ,XnX1,...,XnX_1,...,X_n être un échantillon aléatoire d'une distribution indexée par un paramètre θθ\theta. LaisserTTTêtre une statistique. Supposons que, pour chaqueθθ\theta et toutes les valeurs possibles ttt de TTT, la distribution conjointe conditionnelle de X1, . .. ,XnX1,...,XnX_1,...,X_n étant donné que …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.