Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données





1
Compléter une statistique suffisante
J'ai récemment commencé à étudier l'inférence statistique. J'ai travaillé sur divers problèmes et celui-ci m'a complètement déconcerté. Laisser X1,…,XnX1,…,XnX_1,\dots,X_n être un échantillon aléatoire d'une distribution discrète qui attribue avec probabilité 1313\frac{1}{3} les valeurs θ−1, θ, or θ+1θ−1, θ, or θ+1\theta-1,\space\theta,\space\text{or}\space\theta+1, où θθ\thetaest un entier. Montrer qu'il n'existe pas de statistique …



1
Quelle est la signification de l'exposant dans
Dans le contexte de l'inférence basée sur la vraisemblance, j'ai vu une notation concernant le ou les paramètres d'intérêt que j'ai trouvé un peu déroutante. Par exemple, une notation telle que pθ(x)pθ(x)p_{\theta}(x) et Eθ[S(θ)]Eθ[S(θ)]{\mathbb E}_{\theta}\left[S(\theta)\right]. Quelle est la signification du paramètre (θθ\theta) en notation indice ci-dessus? En d'autres termes, comment …

3
Pourquoi svm n'est-il pas aussi bon que l'arbre de décision sur les mêmes données?
Je suis nouveau dans l'apprentissage automatique et j'essaie d'utiliser scikit-learn (sklearn) pour résoudre un problème de classification. Les deux DecisionTree et SVM peuvent former un classificateur à ce problème. J'utilise sklearn.ensemble.RandomForestClassifieret sklearn.svm.SVCpour ajuster les mêmes données de formation (environ 500 000 entrées avec 50 fonctionnalités par entrée). Le RandomForestClassifier sort …

2
Ensemble de données de test très déséquilibré et données d'entraînement équilibrées dans la classification
J'ai un ensemble de formation avec environ 3000 instances positives et 3000 instances négatives. Mais mon ensemble de données de test est à peu près déséquilibré. L'ensemble positif n'a que 50 instances et le négatif a 1500 instances, ce qui entraîne une précision très faible. Existe-t-il des approches pour résoudre …

1
Signification de corrélation partielle
De Wikipédia Formellement, la corrélation partielle entre et étant donné un ensemble de variables de contrôle , écrite ρ_ {XY · Z} , est la corrélation entre les résidus RX et RY résultant de la régression linéaire de X avec Z et de Y avec Z , respectivement.XXXYYYnnnZ={Z1,Z2,…,Zn}Z={Z1,Z2,…,Zn}Z = \{Z_1, …


1
Le rasoir d'Occam obsolète?
J'ai vu les livres de Vapnik sur l'apprentissage statistique ... J'ai lu les premiers chapitres. Quoi qu'il en soit, ce qui m'a le plus surpris, c'est qu'il pensait que le rasoir de l'Occam était obsolète. Je pensais que c'était lié à la situation dans laquelle le fait de supposer une …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.