Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Disons que nous avons les données suivantes: set.seed(123) data <- data.frame(x = c(rnorm(50, 1, 1), rnorm(50, 5, 2)), y = c(rep('A', 50), rep('B', 50))) Ce qui donne le boxplot suivant ( boxplot(data$x ~ data$y)): Supposons maintenant que je souhaite tester si les deux échantillons ont les mêmes paramètres de localisation …
Je pose cette question pour des éclaircissements sur les termes entre "distribution nulle" et "distribution d'échantillonnage". Je trouve que lorsque quelqu'un dit distribution nulle , cela signifie en fait la même chose que lorsque d'autres disent distribution d'échantillonnage . Dans cet article de test d'hypothèse [1], vous pouvez voir la …
Je ne suis pas un expert, alors pardonnez-moi si une partie de la terminologie est un peu maladroite. Heureux de fournir plus d'informations si nécessaire. J'ai deux vecteurs de 50 valeurs numériques appariées dans R. Je veux effectuer un test de randomisation ou de permutation bilatéral pour déterminer si leurs …
J'ai une série de points de données sous cette forme (horodatage, lat, long) pour un ensemble d'utilisateurs. Chaque utilisateur a une trajectoire lorsqu'il se déplace d'un point A à un point B. Il peut y avoir un nombre quelconque de points de A à B. Ils sont ordonnés des points …
J'ai récemment commencé à étudier l'inférence statistique. J'ai travaillé sur divers problèmes et celui-ci m'a complètement déconcerté. Laisser X1,…,XnX1,…,XnX_1,\dots,X_n être un échantillon aléatoire d'une distribution discrète qui attribue avec probabilité 1313\frac{1}{3} les valeurs θ−1, θ, or θ+1θ−1, θ, or θ+1\theta-1,\space\theta,\space\text{or}\space\theta+1, où θθ\thetaest un entier. Montrer qu'il n'existe pas de statistique …
Je m'intéresse à la prévision Yet j'étudie deux techniques de mesure X1et X2. Il se pourrait, par exemple, que je veuille prédire la saveur d'une banane, soit en mesurant depuis combien de temps elle repose sur la table, soit en mesurant le nombre de taches brunes sur la banane. Je …
Je cherche l'équation correcte pour calculer la covariance sans biais pondérée de l'échantillon. Les sources Internet sont assez rares sur ce thème et elles utilisent toutes des équations différentes. L'équation la plus probable que j'ai trouvée est celle-ci: qj k=∑Ni = 1wje(∑Ni = 1wje)2-∑Ni = 1w2je∑Ni = 1wje(Xje j-X¯j) (Xje …
Dans le contexte de l'inférence basée sur la vraisemblance, j'ai vu une notation concernant le ou les paramètres d'intérêt que j'ai trouvé un peu déroutante. Par exemple, une notation telle que pθ(x)pθ(x)p_{\theta}(x) et Eθ[S(θ)]Eθ[S(θ)]{\mathbb E}_{\theta}\left[S(\theta)\right]. Quelle est la signification du paramètre (θθ\theta) en notation indice ci-dessus? En d'autres termes, comment …
Je suis nouveau dans l'apprentissage automatique et j'essaie d'utiliser scikit-learn (sklearn) pour résoudre un problème de classification. Les deux DecisionTree et SVM peuvent former un classificateur à ce problème. J'utilise sklearn.ensemble.RandomForestClassifieret sklearn.svm.SVCpour ajuster les mêmes données de formation (environ 500 000 entrées avec 50 fonctionnalités par entrée). Le RandomForestClassifier sort …
J'ai un ensemble de formation avec environ 3000 instances positives et 3000 instances négatives. Mais mon ensemble de données de test est à peu près déséquilibré. L'ensemble positif n'a que 50 instances et le négatif a 1500 instances, ce qui entraîne une précision très faible. Existe-t-il des approches pour résoudre …
De Wikipédia Formellement, la corrélation partielle entre et étant donné un ensemble de variables de contrôle , écrite ρ_ {XY · Z} , est la corrélation entre les résidus RX et RY résultant de la régression linéaire de X avec Z et de Y avec Z , respectivement.XXXYYYnnnZ={Z1,Z2,…,Zn}Z={Z1,Z2,…,Zn}Z = \{Z_1, …
J'ai près d'un million d'ensembles de données et chaque fois que je lance un test de comparaison moyenne, soit ANOVA ou un test t, j'obtiens un niveau de signification inférieur à 0,0001 sur SPSS. Je crains que mon échantillon soit si grand que, bien sûr, lorsque je compare les moyens, …
J'ai vu les livres de Vapnik sur l'apprentissage statistique ... J'ai lu les premiers chapitres. Quoi qu'il en soit, ce qui m'a le plus surpris, c'est qu'il pensait que le rasoir de l'Occam était obsolète. Je pensais que c'était lié à la situation dans laquelle le fait de supposer une …
Pour un classifieur multi-classes probabiliste, nous pouvons obtenir des probabilités d'appartenance d'un nouveau point à chaque classe ; dans le cas de 3 classes supposons que nous obtenons , donc la classe la plus probable de x est . Supposons maintenant que nous ayons un svm multi-classes où nous pouvons …
Je me demande s'il existe un bon moyen de calculer le critère de clustering basé sur la formule BIC, pour une sortie k-means dans R? Je suis un peu confus quant à la façon de calculer ce BIC afin de pouvoir le comparer avec d'autres modèles de clustering. Actuellement, j'utilise …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.