Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données




1
Correction pour plusieurs tests sur un nombre modeste de tests (10-20) avec FDR?
Le taux de fausses découvertes (Benjamini-Hochberg) est généralement utilisé sur les «Big Data», comme les études génétiques utilisant des centaines de tests. Mais peut-il également être utilisé sur un plus petit nombre de tests? Par exemple, en examinant les résultats de deux groupes (hommes vs femmes) sur, disons, 10-20 questionnaires …

1
Interprétation des résultats du modèle gam
J'ajuste quelques modèles additifs généralisés en utilisant le mgcvpackage en R, et je veux tester entre deux modèles; si je peux supprimer un terme ou non. Cependant, j'obtiens des résultats contradictoires (pour autant que je sache). Un modèle, m1avec un terme lisse pour xajouté, semble donner un meilleur ajustement en …
8 r  regression  gam 


1
Le théorème de Basu nécessite-t-il une suffisance minimale?
Casella & Berger énonce le théorème de Basu (Th 6.2.24) comme suit: Si est une statistique complète et minimale suffisante, alors est indépendante de toute statistique auxiliaire.T(X)T(X)T(X)T(X)T(X)T(X) Cependant, en conférence, j'ai vu une preuve du théorème qui n'utilisait que la suffisance, pas la suffisance minimale. La preuve était essentiellement une …

1
Quelle est la différence entre l'optimisation bayésienne (processus gaussiens) et le recuit simulé dans la pratique
Les deux processus semblent être utilisés pour estimer la valeur maximale d'une fonction inconnue, et les deux ont évidemment des façons différentes de le faire. Mais dans la pratique, l'une ou l'autre méthode est-elle essentiellement interchangeable? Où voudrais-je utiliser l'un sur l'autre? https://en.wikipedia.org/wiki/Simulated_annealing http://www.iro.umontreal.ca/~bengioy/cifar/NCAP2014-summerschool/slides/Ryan_adams_140814_bayesopt_ncap.pdf Question similaire Optimisation bayésienne ou descente …

1
Arbre de décision avec variable d'entrée continue
Il est connu que lors de la construction d'un arbre de décision, nous divisons la variable d'entrée de manière exhaustive et trouvons la «meilleure» répartition par approche de test statistique ou approche par fonction d'impureté. Ma question est quand nous utilisons une variable continue comme variable d'entrée (seulement quelques valeurs …
8 cart 


3
Séries chronologiques binaires
J'ai une série chronologique binaire: nous avons 2160 données (0 = ne s'est pas produit, 1 = s'est produit) pour une période d'une heure en 90 jours. Je veux prévoir après ces 90 jours, où le prochain 1 se produira, et également étendre cette disposition pour un mois prochain.

1
Covariance pour trois variables
J'essaie de comprendre comment fonctionne la matrice de covariance . Supposons donc que nous ayons deux variables:X, YX,YX, Y, où Cov ( X, Y) = E [ ( x - E [ X] ) ( y- E [ Y] ) ]Cov(X,Y)=E[(x−E[X])(y−E[Y])]\text{Cov}(X,Y) = \mathbb{E}[(x -\mathbb{E}[X])(y-\mathbb{E}[Y])] donne la relation entre les variables, …

3
Probabilité gaussienne + quel a priori = Marginal gaussien?
Étant donné une probabilité gaussienne pour un échantillon comme avec étant l'espace des paramètres et , paramétrisations arbitraires du vecteur moyen et de la matrice de covariance.yyyp(y|θ)=N(y;μ(θ),Σ(θ))p(y|θ)=N(y;μ(θ),Σ(θ))p(y|\theta) = \mathcal{N}(y;\mu(\theta),\Sigma(\theta))ΘΘ\Thetaμ(θ)μ(θ)\mu(\theta)Σ(θ)Σ(θ)\Sigma(\theta) Est-il possible de spécifier une densité antérieure et un paramétrage du vecteur moyen et de la matrice de covariance tels que …

1
Une interaction statistique est importante, mais l'auteur la nie. Pourquoi?
J'évalue un article de journal concernant ses interactions statistiques. L'article tente d'établir une relation entre un contrôle moins strict de la pression artérielle et la progression vers une hypertension sévère. Il soupçonne que l'hypertension préexistante est un facteur pronostique (étant donnép = 0,048 &lt; 0,05p=0,048&lt;0,05p=0.048<0.05). Sa défense est que le …

1
Comment comprendre l'intuition géométrique du fonctionnement interne des réseaux de neurones?
J'ai récemment étudié la théorie derrière les ANN et je voulais comprendre la «magie» derrière leur capacité de classification multi-classe non linéaire. Cela m'a conduit à ce site Web qui explique bien comment géométriquement cette approximation est réalisée. Voici comment je l'ai compris (en 3D): Les couches cachées peuvent être …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.