Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Ce qui est plus élevé,
J'ai donc eu un test de probabilité et je ne pouvais pas vraiment répondre à cette question. Il a juste demandé quelque chose comme ceci: "En considérant que est une variable aléatoire, 0 , utilisez l'inégalité correcte pour prouver ce qui est supérieur ou égal, E (X ^ 2) ^ …

2
Attente de la racine carrée de la somme des variables aléatoires uniformes carrées indépendantes
Soit X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1) des variables aléatoires uniformes standard indépendantes et distribuées de manière identique. Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] L'attente de YnYnY_n est simple: E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} Maintenant pour la partie …

1
T implique l'indépendance de et ?
T implique l'indépendance de et ?Cov(f(X),Y)=0∀f(.)Cov(f(X),Y)=0∀f(.)\mathbb{Cov} \left(f(X),Y\right) = 0 \; \forall \; f(.)XXXYYY Je ne suis au courant de la définition suivante de l' indépendance entre et .XXXYYY fx,y(x,y)=fx(x)fy(y)fx,y(x,y)=fx(x)fy(y) f_{x,y}(x,y) = f_x(x)f_y(y)

1
Terme de variance dans la décomposition biais-variance de la régression linéaire
Dans «Les éléments de l'apprentissage statistique», l'expression de la décomposition biais-variance du modèle linéaire est donnée par où est la fonction cible réelle, est la variance de l'erreur aléatoire dans le modèle et est l'estimateur linéaire de .Err(x0)=σ2ϵ+E[f(x0)−Ef^(x0)]2+||h(x0)||2σ2ϵ,Err(x0)=σϵ2+E[f(x0)−Ef^(x0)]2+||h(x0)||2σϵ2,Err(x_0)=\sigma_\epsilon^2+E[f(x_0)-E\hat f(x_0)]^2+||h(x_0)||^2\sigma_\epsilon^2,f(x0)f(x0)f(x_0)σ2ϵσϵ2 \sigma_\epsilon^2y=f(x)+ϵy=f(x)+ϵy=f(x)+\epsilonf^(x)f^(x)\hat f(x)f(x)f(x)f(x) Le terme de variance me trouble ici parce que …




1
Données corrélées de grande dimension et principales caractéristiques / covariables découvertes; test d'hypothèses multiples?
J'ai un ensemble de données avec environ 5 000 caractéristiques / covariables souvent corrélées et une réponse binaire. Les données m'ont été données, je ne les ai pas collectées. J'utilise Lasso et boosting de gradient pour construire des modèles. J'utilise la validation croisée imbriquée itérée. Je rapporte les 40 coefficients …

4
Est-il possible de décomposer les résidus ajustés en biais et variance, après avoir ajusté un modèle linéaire?
Je voudrais classer les points de données comme ayant besoin d'un modèle plus complexe ou n'ayant pas besoin d'un modèle plus complexe. Ma pensée actuelle est d'adapter toutes les données à un modèle linéaire simple et d'observer la taille des résidus pour faire cette classification. J'ai ensuite fait quelques lectures …

1
Aide à l'interprétation des données de comptage GLMM à l'aide de lme4 glmer et glmer.nb - Binôme négatif contre Poisson
J'ai des questions concernant la spécification et l'interprétation des GLMM. 3 questions sont définitivement statistiques et 2 sont plus spécifiquement sur R. Je poste ici parce que finalement je pense que le problème est l'interprétation des résultats GLMM. J'essaie actuellement d'installer un GLMM. J'utilise les données du recensement américain de …



1
Pourquoi l'intervalle crédible bayésien dans cette régression polynomiale est-il biaisé alors que l'intervalle de confiance est correct?
Considérez le graphique ci-dessous dans lequel j'ai simulé des données comme suit. Nous regardons un résultat binaire pour lequel la vraie probabilité d'être 1 est indiquée par la ligne noire. La relation fonctionnelle entre une covariable x et est un polynôme de troisième ordre avec lien logistique (il est donc …

1
GAM adaptatif lisse en mgcv
Le livre de Simon Wood sur les GAM et son package R associé mgcv sont à la fois très détaillés et informatifs en ce qui concerne la théorie GAM et l'ajustement du modèle aux données réelles et simulées. Pour les lissages 1D, il n'y a vraiment pas grand-chose à craindre, …
9 r  mgcv 


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.