Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans les conférences vidéo de Harvard's Statistics 110: Probability course que l'on peut trouver sur iTunes et YouTube, j'ai rencontré ce problème. J'ai essayé de le résumer ici: Supposons que l'on nous donne une main aléatoire de deux cartes d'un paquet standard. Quelle est la probabilité que les deux cartes …
J'ai des échantillons d'un ensemble de données très asymétrique (ressemblant à une distribution exponentielle) sur la participation des utilisateurs (par exemple: nombre de publications), qui ont des tailles différentes (mais pas moins de 200) et je veux comparer leur moyenne. Pour cela, j'utilise des tests t non appariés à deux …
J'ai deux variables - X et Y et je dois faire un cluster maximum (et optimal) = 5. Disons que le tracé idéal des variables est comme suit: Je voudrais en faire 5 clusters. Quelque chose comme ça: Je pense donc que c'est un modèle de mélange avec 5 grappes. …
\newcommand{\E}{\mathbb{E}} Comment est la transformation de normalisation pour la famille exponentielle dérivé? A ( ⋅ ) = ∫ d uV une / 3 ( μ )A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} Plus précisément : j'ai essayé de suivre le croquis d'extension de Taylor à la page 3, diapositive 1 ici, mais j'ai plusieurs …
J'ai deux jeux de données et je voudrais savoir s'ils sont significativement différents ou non (cela vient de " Deux groupes sont significativement différents? Test à utiliser "). J'ai décidé d'utiliser un test de permutation, en procédant comme suit dans R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # …
Question originale (25/07/14): Cette citation des médias est-elle logique, ou existe-t-il une meilleure façon statistique de visualiser la série d'accidents d'avion récents? Cependant, Barnett attire également l'attention sur la théorie de la distribution de Poisson, ce qui implique que les intervalles courts entre les accidents sont en fait plus probables …
Est-il significatif et possible d'effectuer un test KS unilatéral? Quelle serait l'hypothèse nulle d'un tel test? Ou le test KS est-il intrinsèquement un test bilatéral? Je bénéficierais d'une réponse qui m'a aidé à comprendre la distribution de D (je travaille à travers l'article de Massey de 1951 et je trouve …
J'essaie de voir s'il faut opter pour la régression de crête , LASSO , la régression en composantes principales (PCR) ou les moindres carrés partiels (PLS) dans une situation où il y a un grand nombre de variables / caractéristiques ( ) et un plus petit nombre d'échantillons ( n …
J'ai un problème avec la normalité de certaines données: j'ai fait un test de Kolmogorov qui dit que ce n'est pas normal avec p = .0000, je ne comprends pas: l'asymétrie de ma distribution = -. 497, et le kurtosis = -0,024 Voici l'intrigue de ma distribution qui semble tout …
J'essaie de faire une régression sur des données hétéroscédastiques où j'essaie de prédire les variances d'erreur ainsi que les valeurs moyennes en termes de modèle linéaire. Quelque chose comme ça: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(X,t)=σ0+cX+rét.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} En d'autres termes, les données consistent …
J'ai un ensemble de données avec quelques millions de lignes et ~ 100 colonnes. Je voudrais détecter environ 1% des exemples dans l'ensemble de données, qui appartiennent à une classe commune. J'ai une contrainte de précision minimale, mais en raison d'un coût très asymétrique, je ne suis pas trop intéressé …
Existe-t-il un thésaurus de référence pour les termes statistiques et d'apprentissage automatique? Je sais que les articles de Wikipédia contiennent souvent des synonymes, mais j'aimerais avoir un simple thésaurus que je pourrais parcourir facilement (par rapport à une encyclopédie complète) pour m'assurer de connaître tout le jargon.
J'ai entendu dire que la régression des crêtes peut être dérivée comme la moyenne d'une distribution postérieure, si l'a priori est adéquatement choisi. L'intuition est-elle que les contraintes définies sur les coefficients de régression par les a priori (par exemple, les distributions normales standard autour de 0) sont identiques / …
Je souhaite essayer d'utiliser les machines à vecteurs de support (SVM) sur mon jeu de données. Avant d'essayer le problème, j'ai été averti que les SVM ne fonctionnaient pas bien sur des données extrêmement déséquilibrées. Dans mon cas, je peux avoir jusqu'à 95-98% 0 et 2-5% 1. J'ai essayé de …
Si j'ai un système de classement par étoiles où les utilisateurs peuvent exprimer leur préférence pour un produit ou un article, comment puis-je détecter statistiquement si les votes sont très "divisés". Cela signifie, même si la moyenne est de 3 sur 5, pour un produit donné, comment puis-je détecter s'il …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.