Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Pourquoi l'efficacité relative asymptotique du test de Wilcoxon est-elle de
Il est bien connu que l'efficacité relative asymptotique (ARE) du test de rang signé de Wilcoxon est de 3π≈0.9553π≈0.955\frac{3}{\pi} \approx 0.955par rapport autestt deStudent, si les données sont tirées d'une population normalement distribuée. Cela est vrai à la fois pour le test de base à un échantillon et pour la …



5
Comment puis-je gérer au mieux les effets des marqueurs avec différents niveaux de générosité dans la notation des articles des étudiants?
Environ 600 étudiants ont obtenu un score sur une évaluation approfondie, qui peut être considérée comme ayant une bonne fiabilité / validité. L'évaluation est notée sur 100, et c'est un test à choix multiple marqué par ordinateur. Ces 600 élèves ont également obtenu des notes sur une deuxième évaluation mineure. …




1
Pourquoi ne pas toujours utiliser l'apprentissage d'ensemble?
Il me semble que l'apprentissage d'ensemble donnera toujours de meilleures performances prédictives qu'avec une seule hypothèse d'apprentissage. Alors, pourquoi ne les utilisons-nous pas tout le temps? Je suppose que c'est peut-être à cause de limitations informatiques? (même alors, nous utilisons des prédicteurs faibles, donc je ne sais pas).

2
L'utilisation du package caret est-il possible d'obtenir des matrices de confusion pour des valeurs de seuil spécifiques?
J'ai obtenu un modèle de régression logistique (via train) pour une réponse binaire, et j'ai obtenu la matrice de confusion logistique via confusionMatrixin caret. Cela me donne la matrice de confusion du modèle logistique, même si je ne sais pas quel seuil est utilisé pour l'obtenir. Comment obtenir la matrice …


2
Dériver la distribution bivariée de Poisson
J'ai récemment rencontré la distribution bivariée de Poisson, mais je suis un peu confus quant à la façon de la dériver. La distribution est donnée par: P(X=x,Y=y)=e−(θ1+θ2+θ0)θx1x!θy2y!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X=x,Y=y)=e−(θ1+θ2+θ0)θ1xx!θ2yy!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X = x, Y = y) = e^{-(\theta_{1}+\theta_{2}+\theta_{0})} \displaystyle\frac{\theta_{1}^{x}}{x!}\frac{\theta_{2}^{y}}{y!} \sum_{i=0}^{min(x,y)}\binom{x}{i}\binom{y}{i}i!\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)^{i} D'après ce que je peux comprendre, le terme θ0θ0\theta_{0} est une mesure de corrélation …



4
En quoi la validation croisée est-elle différente de l'espionnage des données?
Je viens de terminer "Une introduction à l'apprentissage statistique" . Je me demandais si l'utilisation de la validation croisée pour trouver les meilleurs paramètres de réglage pour diverses techniques d'apprentissage automatique était différente de l'espionnage des données? Nous vérifions à plusieurs reprises quelle valeur du paramètre de réglage donne un …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.