Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Références statistiques fréquentistes pour quelqu'un qui connaît bien la théorie moderne des probabilités
Issu d'une formation rigoureuse en analyse et en théorie des probabilités moderne, je trouve les statistiques bayésiennes simples et faciles à comprendre, et les statistiques fréquentistes incroyablement déroutantes et peu intuitives. Il semble que les fréquentistes fassent vraiment des statistiques bayésiennes, sauf avec des "prieurs secrets" qui ne sont pas …


2
Déterminer le plus grand contributeur d'un groupe
Je ne connais pas grand-chose aux statistiques, alors restez avec moi. Disons que j'ai un ensemble de 1000 travailleurs. Je veux savoir qui est le travailleur le plus acharné, mais je ne peux mesurer que la quantité de travail effectuée en groupes de 1 à 100 personnes sur une heure …

1
Intervalles de confiance et de prédiction du modèle de régression linéaire
D'accord, j'essaie donc de comprendre la régression linéaire. J'ai un ensemble de données et tout semble assez bien, mais je suis confus. Voici mon modèle de résumé linéaire: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: …
9 r  regression 

2
Problème de calcul, d'interprétation des sous-ensembles de regs et questions générales sur la procédure de sélection de modèle
Je souhaite sélectionner des modèles à l'aide de regsubsets(). J'ai une trame de données appelée olympiadaten (données téléchargées: http://www.sendspace.com/file/8e27d0 ). J'attache d'abord ce dataframe puis commence à analyser, mon code est: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty …



2
Utilisation du paramètre Gamma avec des machines à vecteurs de support
Lors de l'utilisation libsvm, le paramètre est un paramètre de la fonction noyau. Sa valeur par défaut est configurée comme γ = 1γγ\gammaγ= 1nombre de fonctionnalités.γ=1nombre de fonctionnalités.\gamma = \frac{1}{\text{number of features.}} Existe-t-il des directives théoriques pour la configuration de ce paramètre en plus des méthodes existantes, par exemple, la …


3
Affectation aléatoire: pourquoi s'embêter?
L'attribution aléatoire est précieuse car elle garantit l'indépendance du traitement par rapport aux résultats potentiels. C'est ainsi que cela conduit à des estimations non biaisées de l'effet moyen du traitement. Mais d'autres schémas d'affectation peuvent également garantir systématiquement l'indépendance du traitement par rapport aux résultats potentiels. Alors pourquoi avons-nous besoin …

2
Pourquoi la quantité de variance expliquée par mon 1er PC est-elle si proche de la corrélation moyenne par paire?
Quelle est la relation entre la ou les premières composantes principales et la corrélation moyenne dans la matrice de corrélation? Par exemple, dans une application empirique, j'observe que la corrélation moyenne est presque la même que le rapport de la variance de la première composante principale (première valeur propre) à …


3
Comment utiliser R gbm avec distribution = “adaboost”?
La documentation indique que R gbm avec distribution = "adaboost" peut être utilisé pour un problème de classification 0-1. Considérez le fragment de code suivant: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Il peut être trouvé …
9 r  gbm 

1
Comment comparer les événements observés aux événements attendus?
Supposons que j'ai un échantillon de fréquences de 4 événements possibles: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 et j'ai les probabilités attendues que mes événements se produisent: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Avec la somme des fréquences …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

1
«Puisque est presque gaussien, son PDF peut être écrit comme…»
Petite question: pourquoi est-ce vrai ?? Longue question: Très simplement, j'essaie de comprendre ce qui justifie cette première équation. L'auteur du livre que je lis, (contexte ici si vous le souhaitez, mais pas nécessaire), affirme ce qui suit: En raison de l'hypothèse de quasi-gaussianité, nous pouvons écrire: p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ))p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ)) p_0(\xi) = …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.