Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Résolution analytique de l'échantillonnage avec ou sans remplacement après binôme Poisson / Négatif
Version courte J'essaie de résoudre / approximer analytiquement la probabilité composite qui résulte de tirages de Poisson indépendants et d'un échantillonnage supplémentaire avec ou sans remplacement (je ne me soucie pas vraiment lequel). Je veux utiliser la vraisemblance avec MCMC (Stan), donc je n'ai besoin de la solution que jusqu'à …


1
Intuition (géométrique ou autre) de
Dans une autre tranche d'intuitions pour les identités en probabilité, considérons la loi d' identité élémentaire de la variance totale Var(X)=E[Var(X|Y)]+Var(E[X|Y])Var(X)=E[Var(X|Y)]+Var(E[X|Y]) \begin{eqnarray} \rm{Var}(X) &=&\rm{E}[\rm{Var}(X|Y)] + \rm{Var}(E[X|Y]) \end{eqnarray} Il s'agit d'une simple manipulation algébrique directe de la définition des moments en sommation, ou, comme dans le lien wikipedia, via la manipulation …

2
Exemple lorsque l'utilisation de la précision comme mesure de résultat entraînera une conclusion erronée
J'examine différentes mesures de performance pour les modèles prédictifs. Beaucoup a été écrit sur les problèmes d'utilisation de la précision, au lieu de quelque chose de plus continu pour évaluer les performances du modèle. Frank Harrell http://www.fharrell.com/post/class-damage/ fournit un exemple lorsque l'ajout d'une variable informative à un modèle entraînera une …

1
Comment la famille de distributions avec PDF est-elle proportionnelle à
Considérons une famille de distributions avec PDF (jusqu'à une constante de proportionnalité) donnée par Comment ça s'appelle? S'il n'a pas de nom, comment l'appelleriez-vous?p ( x ) ∼1( 1 + αX2)1 / α.p(x)∼1(1+αX2)1/α.p(x)\sim \frac{1}{(1+\alpha x^2)^{1/\alpha}}. Il ressemble assez à la famille des distributions avec PDF proportionnel à p (x) \ …

1
Optimisation bayésienne pour le bruit non gaussien
Une fonction boîte noire F:Rn→ RF:Rn→Rf: \mathbb{R}^n \rightarrow \mathbb{R}, qui est évalué ponctuellement soumis au bruit gaussien, à savoir, F( x ) + N( μ ( x ) , σ( x)2)F(X)+N(μ(X),σ(X)2)f(x) + \mathcal{N}(\mu(x),\sigma(x)^2), peut être minimisé en utilisant l'optimisation bayésienne où un processus gaussien est utilisé comme modèle de fonction …


2
Quels sont les travaux récents et la portée de la recherche en inférence asymptotique (théorie des grands échantillons)?
Quels sont les travaux théoriques significatifs actuels qui ont été effectués dans le domaine de l'inférence asymptotique / théorie des grands échantillons? Quelle est la portée de la recherche dans ce domaine actuellement? Y a-t-il un problème ouvert ou des domaines spécifiques où la théorie se développe ces derniers temps? …


1
comparaison de groupes dans des modèles FE à mesures répétées, avec une composante d'erreur imbriquée, estimée à l'aide de plm
J'ai estimé des modèles à effets fixes de mesures répétées, avec une composante d'erreur imbriquée, en me basant sur des variables de regroupement, c'est-à-dire des modèles non imbriqués, en utilisant plm. Je suis maintenant intéressé à tester si les modèles complets sont significativement différents, c'est-à-dire où est le modèle complet …

4
Prouve-le
Les problèmes statistiques impliquant des intervalles de confiance pour une moyenne de population peuvent être formulés en fonction de la fonction de pondération suivante : w(α,n)≡tn−1,α/2n−−√for 0&lt;α&lt;1 and n&gt;1.w(α,n)≡tn−1,α/2nfor 0&lt;α&lt;1 and n&gt;1.w(\alpha, n) \equiv \frac{t_{n-1,\alpha/2}}{\sqrt{n}} \quad \quad \quad \quad \text{for } 0<\alpha<1 \text{ and } n > 1. Par exemple, …


1
Forêt aléatoire dans un cadre Big Data
J'ai un ensemble de données avec 5 818 446 lignes et 51 colonnes, dont 50 sont des prédicteurs. Ma réponse est quantitative, je suis donc intéressé par un modèle de régression. J'essaie d'adapter une forêt aléatoire à mes données en utilisant le package caret. Cependant, je n'ai pas assez de …

1
Des inconvénients du filet élastique par rapport au lasso?
Quels sont les inconvénients de l'utilisation d'un filet élastique par rapport au lasso. Je sais que le filet élastique est capable de sélectionner des groupes de variables lorsqu'ils sont fortement corrélés. Il n'a pas le problème de sélectionner plus de nnnprédicteurs lorsque . Alors que le lasso sature lorsque .p≫np≫np …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.