Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Le pdf de
Supposons que X1,X2,...,XnX1,X2,...,XnX_1, X_2,...,X_n soit iid de N(μ,σ2)N(μ,σ2)N(\mu,\sigma^2) avec inconnu μ∈Rμ∈R\mu \in \mathcal Ret σ2>0σ2>0\sigma^2>0 Soit Z=X1−X¯S,Z=X1−X¯S,Z=\frac{X_1-\bar{X}}{S},S est ici l'écart type. On peut montrer que ZZZ a le pdf de Lebesgue f(z)=n−−√Γ(n−12)π−−√(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n√)(|Z|)f(z)=nΓ(n−12)π(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n)(|Z|)f(z)=\frac{\sqrt{n} \Gamma\left(\frac{n-1}{2}\right)}{\sqrt{\pi}(n-1)\Gamma\left(\frac{n-2}{2}\right)}\left[1-\frac{nz^2}{(n-1)^2}\right]^{n/2-2}I_{(0,(n-1)/\sqrt{n})}(|Z|) Ma question est alors comment obtenir ce pdf? La question est d' ici dans l'exemple 3.3.4 de …
15 self-study  umvue 

2
Si «l'erreur standard» et les «intervalles de confiance» mesurent la précision de la mesure, alors quelles sont les mesures de la précision?
Dans le livre "Biostatistique pour les nuls" à la page 40, je lis: L'erreur standard (abrégée SE) est un moyen d'indiquer la précision de votre estimation ou mesure de quelque chose. et Les intervalles de confiance fournissent une autre façon d'indiquer la précision d'une estimation ou d'une mesure de quelque …

2
Quand arrêter d'affiner un modèle?
J'étudie les statistiques de nombreux livres depuis 3 ans et grâce à ce site j'ai beaucoup appris. Néanmoins, une question fondamentale reste pour moi sans réponse. Il peut avoir une réponse très simple ou très difficile, mais je sais que cela nécessite une compréhension approfondie des statistiques. Lors de l'ajustement …




1
Comprendre la décomposition QR
J'ai un exemple travaillé (en R), que j'essaie de mieux comprendre. J'utilise Limma pour créer un modèle linéaire et j'essaie de comprendre ce qui se passe pas à pas dans les calculs de changement de pli. J'essaie surtout de comprendre ce qui se passe pour calculer les coefficients. D'après ce …

7
Que fais / as-tu fait pour te souvenir de la règle de Bayes?
Je pense qu'un bon moyen de se souvenir de la formule est de penser à la formule comme ceci: La probabilité qu'un événement A ait un résultat particulier étant donné le résultat d'un événement indépendant B = la probabilité que les deux résultats se produisent simultanément / quoi que nous …
15 bayesian  bayes 

4
Text Mining: comment regrouper des textes (par exemple des articles de presse) avec l'intelligence artificielle?
J'ai construit des réseaux de neurones (MLP (entièrement connecté), Elman (récurrent)) pour différentes tâches, comme jouer au Pong, classer les chiffres manuscrits et tout ça ... De plus, j'ai essayé de construire certains premiers réseaux de neurones convolutifs, par exemple pour classer des notes manuscrites à plusieurs chiffres, mais je …

1
Régularisation pour les modèles ARIMA
Je connais LASSO, la régularisation de type crête et filet élastique dans les modèles de régression linéaire. Question: Ce type d'estimation pénalisée (ou similaire) peut-il être appliqué à la modélisation ARIMA (avec une partie MA non vide)? Dans la construction de modèles ARIMA, il semble habituel de considérer un ordre …

1
Autres estimateurs non biaisés que le BLEU (solution OLS) pour les modèles linéaires
Pour un modèle linéaire, la solution OLS fournit le meilleur estimateur linéaire sans biais pour les paramètres. Bien sûr, nous pouvons échanger un biais pour une variance plus faible, par exemple la régression des crêtes. Mais ma question concerne l'absence de parti pris. Existe-t-il d'autres estimateurs quelque peu couramment utilisés, …

2
Question sur le compromis biais-variance
J'essaie de comprendre le compromis biais-variance, la relation entre le biais de l'estimateur et le biais du modèle, et la relation entre la variance de l'estimateur et la variance du modèle. Je suis arrivé à ces conclusions: Nous avons tendance à surajuster les données lorsque nous négligeons le biais de …



1
La forêt aléatoire de Breiman utilise-t-elle un gain d'informations ou un indice de Gini?
Je voudrais savoir si la forêt aléatoire de Breiman (forêt aléatoire dans le package R randomForest) utilise comme critère de fractionnement (critère de sélection d'attribut) le gain d'informations ou l'indice de Gini? J'ai essayé de le découvrir sur http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm et dans la documentation du paquet randomForest dans R. Mais la …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.