Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Dois-je utiliser le test t sur des données très asymétriques? Preuve scientifique, s'il vous plaît?
J'ai des échantillons d'un ensemble de données très asymétrique (ressemblant à une distribution exponentielle) sur la participation des utilisateurs (par exemple: nombre de publications), qui ont des tailles différentes (mais pas moins de 200) et je veux comparer leur moyenne. Pour cela, j'utilise des tests t non appariés à deux …



2
Valeurs de p égales à 0 dans le test de permutation
J'ai deux jeux de données et je voudrais savoir s'ils sont significativement différents ou non (cela vient de " Deux groupes sont significativement différents? Test à utiliser "). J'ai décidé d'utiliser un test de permutation, en procédant comme suit dans R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # …

4
À quel point un groupe d'accidents d'avion est-il étrange?
Question originale (25/07/14): Cette citation des médias est-elle logique, ou existe-t-il une meilleure façon statistique de visualiser la série d'accidents d'avion récents? Cependant, Barnett attire également l'attention sur la théorie de la distribution de Poisson, ce qui implique que les intervalles courts entre les accidents sont en fait plus probables …


1
Régression en
J'essaie de voir s'il faut opter pour la régression de crête , LASSO , la régression en composantes principales (PCR) ou les moindres carrés partiels (PLS) dans une situation où il y a un grand nombre de variables / caractéristiques ( ) et un plus petit nombre d'échantillons ( n …


3
Prédire la variance des données hétéroscédastiques
J'essaie de faire une régression sur des données hétéroscédastiques où j'essaie de prédire les variances d'erreur ainsi que les valeurs moyennes en termes de modèle linéaire. Quelque chose comme ça: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(X,t)=σ0+cX+rét.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} En d'autres termes, les données consistent …

3
Suggestions pour un apprentissage sensible aux coûts dans un environnement très déséquilibré
J'ai un ensemble de données avec quelques millions de lignes et ~ 100 colonnes. Je voudrais détecter environ 1% des exemples dans l'ensemble de données, qui appartiennent à une classe commune. J'ai une contrainte de précision minimale, mais en raison d'un coût très asymétrique, je ne suis pas trop intéressé …


2
Régression des crêtes - interprétation bayésienne
J'ai entendu dire que la régression des crêtes peut être dérivée comme la moyenne d'une distribution postérieure, si l'a priori est adéquatement choisi. L'intuition est-elle que les contraintes définies sur les coefficients de régression par les a priori (par exemple, les distributions normales standard autour de 0) sont identiques / …

3
SVM pour les données asymétriques
Je souhaite essayer d'utiliser les machines à vecteurs de support (SVM) sur mon jeu de données. Avant d'essayer le problème, j'ai été averti que les SVM ne fonctionnaient pas bien sur des données extrêmement déséquilibrées. Dans mon cas, je peux avoir jusqu'à 95-98% 0 et 2-5% 1. J'ai essayé de …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.