Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Supposons que nous ayons un test d' ensemble de données : 1 8 12 14 . . 19 Le . dénote des valeurs manquantes. Quand serait-il préférable d'utiliser la moyenne des valeurs non manquantes pour imputer les valeurs manquantes plutôt que de supposer que les données proviennent d'une distribution normale?
Zuur 2013 Beginners Guide to GLM & GLMM suggère de valider une régression de Poisson en traçant les résidus de Pearsons par rapport aux valeurs ajustées. Zuur déclare que nous ne devrions pas voir les résidus se dissiper à mesure que les valeurs ajustées augmentent, comme le tracé attaché (dessiné …
J'essaie de développer un modèle prédictif pour une variable dépendante angulaire (sur utilisant plusieurs mesures indépendantes - également des variables angulaires, sur - comme prédicteurs. Chaque prédicteur est significativement mais pas extrêmement fortement corrélé avec la variable dépendante. Comment puis-je combiner les prédicteurs pour déterminer un modèle prédictif pour la …
J'ai vu une quantité raisonnable de documentation sur la façon de choisir les noyaux et les bandes passantes lors du calcul d'une estimation de la densité du noyau, mais je suis actuellement intéressé par la façon d'améliorer le temps nécessaire pour évaluer le KDE résultant à un nombre arbitraire de …
Lorsque nous utilisons l'algorithme d'apprentissage de CD persistant pour les machines Bolzmann restreintes, nous commençons notre chaîne d'échantillonnage Gibbs dans la première itération à un point de données, mais contrairement au CD normal, dans les itérations suivantes, nous ne recommençons pas sur notre chaîne. Au lieu de cela, nous commençons …
Disons que je mène une méta-analyse, en examinant la performance du groupe A et du groupe B par rapport à une certaine construction. Maintenant, certaines des études que je vais rencontrer rapporteront qu'aucune différence statistique n'a pu être trouvée entre les deux groupes mais aucune statistique de test exacte et …
R in Action (Kabacoff, 2011) suggère la routine suivante pour tester la surdispersion dans une régression logistique: Ajuster la régression logistique en utilisant la distribution binomiale: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Ajuster la régression logistique en utilisant la distribution quasibinomiale: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Utilisez …
Dans cette page Wikipédia dans la sous-section pour la validation croisée de pli en K, il est dit "Dans la validation croisée de pli en K, l'échantillon d'origine est divisé de manière aléatoire en k sous-échantillons de taille égale. Parmi les k sous-échantillons, un seul sous-échantillon est conservé comme données …
Pour les problèmes de classification, j'ai utilisé des réseaux de neurones et mesuré les erreurs de type I et II en utilisant la matrice de confusion et ses mesures selon cette ressource ( miroir ), ce qui est assez simple. Face à un problème d'estimation, comment évaluer les performances du …
Je prends un cours sur les méthodes de Monte Carlo et nous avons appris la méthode d'échantillonnage par rejet (ou Accept-Reject Sampling) lors de la dernière conférence. Il y a beaucoup de ressources sur le web qui montrent la preuve de cette méthode mais je ne suis pas convaincu avec …
Mon manuel sur la validation croisée est Les éléments de l'apprentissage statistique par Hastie et al. (2e éd.). Dans les sections 7.10.1 et 7.12, ils parlent de la différence entre l'erreur de test conditionnelleE(X∗,Y∗)[L(Y,f^(X))|τ]E(X∗,Y∗)[L(Y,f^(X))|τ]E_{(X^*,Y^*)}[L(Y, \hat{f}(X))|\tau] et erreur de test attendue Eτ[E(X∗,Y∗)[L(Y,f^(X))|τ]].Eτ[E(X∗,Y∗)[L(Y,f^(X))|τ]].E_\tau [E_{(X^*,Y^*)}[L(Y, \hat{f}(X))|\tau]]. Ici ττ\tau est l'ensemble de données de …
J'ai un bloc intuitif avec ça. Pour un problème binomial, l'écart type d'un nombre est . Inversement, l'écart type de la proportion d'échantillon diminue avec l'augmentation de et est . Je peux faire la division par mais je ne comprends pas pourquoi les écarts-types se déplacent dans des directions opposées.n …
La définition d'une statistique suffisante est: Soit X1, . . . ,XnX1,...,XnX_1,...,X_n être un échantillon aléatoire d'une distribution indexée par un paramètre θθ\theta. LaisserTTTêtre une statistique. Supposons que, pour chaqueθθ\theta et toutes les valeurs possibles ttt de TTT, la distribution conjointe conditionnelle de X1, . .. ,XnX1,...,XnX_1,...,X_n étant donné que …
Pourquoi voudrait-on contrôler un certain nombre de covariables de référence dans une situation où l'affectation au groupe de traitement est aléatoire? Je crois comprendre que l'attribution aléatoire d'un traitement devrait rendre la variable de traitement strictement exogène, créant ainsi un groupe témoin qui peut être considéré comme un contrefactuel. La …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.