Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




1
Noyau de transition de Gibbs Sampler
Soit la distribution cible sur qui est absolument continue par rapport à la mesure de Lebesgue dimensionnelle, c'est-à-dire:ππ\pi(Rd,B(Rd))(Rd,B(Rd))(\mathbb{R}^d,\mathcal{B}(\mathbb{R^d}))ddd ππ\pi admet une densité wrt à avec π(x1,...,xd)π(x1,...,xd)\pi(x_1,...,x_d)λdλd\lambda^dλd(dx1,...,dxd)=λ(dx1)⋅⋅⋅λ(dxd)λd(dx1,...,dxd)=λ(dx1)⋅⋅⋅λ(dxd)\lambda^d(dx_1,...,dx_d) = \lambda(dx_1) \cdot \cdot \cdot \lambda (dx_d) Supposons que les conditions complètes de sont connues. Le noyau de transition du Gibbs-Sampler est donc clairement …

2
Problèmes avec la détection des valeurs aberrantes
Dans un article de blog, Andrew Gelman écrit : La régression pas à pas est l'une de ces choses, comme la détection des valeurs aberrantes et les graphiques circulaires, qui semblent être populaires parmi les non-statisticiens mais qui sont considérés par les statisticiens comme une plaisanterie. Je comprends la référence …

3
Trouvez la distribution et passez à la distribution normale
J'ai des données qui décrivent la fréquence à laquelle un événement se produit pendant une heure ("nombre par heure", nph) et la durée des événements ("durée en secondes par heure", dph). Ce sont les données d'origine: nph <- c(2.50000000003638, 3.78947368414551, 1.51456310682008, 5.84686774940732, 4.58823529414907, 5.59999999993481, 5.06666666666667, 11.6470588233699, 1.99999999998209, NA, 4.46153846149851, 18, …
8 normal-distribution  data-transformation  logistic  generalized-linear-model  ridge-regression  t-test  wilcoxon-signed-rank  paired-data  naive-bayes  distributions  logistic  goodness-of-fit  time-series  eviews  ecm  panel-data  reliability  psychometrics  validity  cronbachs-alpha  self-study  random-variable  expected-value  median  regression  self-study  multiple-regression  linear-model  forecasting  prediction-interval  normal-distribution  excel  bayesian  multivariate-analysis  modeling  predictive-models  canonical-correlation  rbm  time-series  machine-learning  neural-networks  fishers-exact  factorisation-theorem  svm  prediction  linear  reinforcement-learning  cdf  probability-inequalities  ecdf  time-series  kalman-filter  state-space-models  dynamic-regression  index-decomposition  sampling  stratification  cluster-sample  survey-sampling  distributions  maximum-likelihood  gamma-distribution 

2
Le modèle de prédiction électorale de Nate Silver
Nate Silver a réussi à prédire les résultats des élections américaines dans le passé, ce qui est décrit dans son livre The Signal and the Noise . Le livre contient quelques descriptions du modèle utilisé, et un article de son blog décrit le modèle utilisé pour les élections de mi-mandat …

1
Sur les valeurs AIC négatives
Ma question est liée au thread Valeurs négatives pour AIC dans General Mixed Model . J'obtiens souvent des valeurs AIC négatives du logiciel que j'utilise. Je le remarque le plus lorsque je fais des séries chronologiques. Mais voici ce que je ne comprends pas. Lors de la définition de l'AIC …
8 aic 




2
Quelle déviance glmnet utilise-t-il pour comparer les valeurs de
Un critère de sélection de la valeur optimale de avec un filet élastique ou une régression pénalisée similaire consiste à examiner un tracé de la déviance par rapport à la plage de et à sélectionner lorsque la déviance est minimisée (ou dans une erreur standard de la le minimum).λλ\lambdaλλ\lambdaλλ\lambdaλλ\lambda Cependant, …
8 r  glmnet 

1
Comparaisons multiples avec de nombreux groupes
Je voudrais déterminer si l'utilisation d'un test de comparaisons multiples serait appropriée pour mes données. J'ai utilisé le test de Kruskal-Wallis pour déterminer s'il y avait des différences d'inhibition moyenne entre groupes différents. L'analyse a révélé qu'il y avait des différences significatives et maintenant j'aimerais utiliser une procédure de comparaison …

5
Pourquoi les régresseurs non pertinents deviennent-ils statistiquement significatifs dans de grands échantillons?
J'essaie de mieux comprendre la signification statistique, la taille des effets, etc. J'ai l'impression (peut-être que c'est faux) que même les régresseurs non pertinents deviennent souvent statistiquement significatifs dans les grands échantillons . Par non pertinent, je veux dire qu'il n'y a aucune explication de la raison pour laquelle le …

3
Comment obtenir la fonction quantile lorsqu'une forme analytique de la distribution n'est pas connue
Le problème vient de la page 377-379 de ce document [0] . Étant donné une distribution continue et un fixe , considérons:FFFz∈ Rz∈Rz\in\mathbb{R} Lz( t ) =PF( | z- Z| ≤t)Lz(t)=PF(|z−Z|≤t)L_z(t)=P_F(|z-Z|\leq t) et H( z) =L- 1z( 0,5 ) =medZ∼ F| z- Z|H(z)=Lz−1(0.5)=medZ∼F|z−Z|H(z)=L^{-1}_z(0.5)=\underset{Z\sim F}{\mbox{med}}|z-Z| où est l'inverse continu droit. Donc, …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.