Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Couverture plus faible que prévu pour l'échantillonnage d'importance avec simulation
Je suis en train de répondre à la question Évaluer une seule pièce avec méthode d' échantillonnage importance dans R . Fondamentalement, l'utilisateur doit calculer ∫π0f(x)dx=∫π01cos(x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx utiliser la distribution exponentielle comme distribution d'importance q(x)=λ exp−λxq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} et trouver la valeur de qui donne la meilleure approximation de l'intégrale …

2
Quelle est la meilleure façon d'estimer l'effet moyen du traitement dans une étude longitudinale?
Dans une étude longitudinale, les résultats des unités sont mesurés à plusieurs reprises aux points temporels avec un total de occasions de mesure fixes (fixe = les mesures sur les unités sont prises en même temps). i t mYitYitY_{it}iiitttmmm Les unités sont assignées au hasard soit à un traitement, , …

1
Comprendre la topologie LSTM
Comme beaucoup d'autres, j'ai trouvé les ressources ici et ici extrêmement utiles pour comprendre les cellules LSTM. Je suis convaincu que je comprends comment les valeurs circulent et sont mises à jour, et je suis assez confiant pour ajouter les "connexions judas" mentionnées, etc. également. Dans mon exemple, j'ai à …


1
Chance que l'échantillon de bootstrap soit exactement le même que l'échantillon d'origine
Je veux juste vérifier un raisonnement. Si mon échantillon d'origine est de taille et que je l'amorce, alors mon processus de réflexion est le suivant:nnn 1n1n\frac{1}{n} est la chance de toute observation tirée de l'échantillon d'origine. Pour nous assurer que le prochain tirage n'est pas l'observation précédemment échantillonnée, nous limitons …


1
Générer des nombres aléatoires à partir de la «distribution uniforme inclinée» de la théorie mathématique
Dans un certain but, j'ai besoin de générer des nombres aléatoires (données) à partir de la distribution "uniforme en pente". La "pente" de cette distribution peut varier dans un intervalle raisonnable, et alors ma distribution devrait changer d'uniforme à triangulaire en fonction de la pente. Voici ma dérivation: Rendons les …


2
Pourquoi ne puis-je pas obtenir un SVD valide de X via la décomposition de valeurs propres de XX 'et X'X?
J'essaie de faire SVD à la main: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) Mais la dernière ligne ne revient pas m. Pourquoi? Cela semble avoir quelque chose à voir avec les signes de ces vecteurs propres ... Ou ai-je mal compris la procédure?
9 r  svd  eigenvalues 


1
Dégradés pour skipgram word2vec
Je passe en revue les problèmes liés aux problèmes d'affectation écrits de la classe d'apprentissage profond de Stanford NLP http://cs224d.stanford.edu/assignment1/assignment1_soln J'essaie de comprendre la réponse pour 3a où ils recherchent la dérivée du vecteur pour le mot central. Supposons que l'on vous donne un vecteur de mot prédit correspondant au …

1
Modèle d'effets mixtes avec splines
J'adapte un modèle d'effets mixtes avec un terme spline dans une application où la tendance dans le temps est connue pour être curvi-linéaire. Cependant, ce que je voudrais évaluer, c'est si la tendance curvilinéaire se produit en raison de la déviation individuelle de la linéarité, ou est-ce un effet au …
9 r  splines  lme4-nlme 

1
Quelle est la différence entre un apprentissage multiple et une réduction de dimensionnalité non linéaire?
Quelle est la différence entre un apprentissage multiple et une réduction de dimensionnalité non linéaire ? J'ai vu ces deux termes être utilisés de manière interchangeable. Par exemple: http://www.cs.cornell.edu/~kilian/research/manifold/manifold.html : L'apprentissage multiple (souvent également appelé réduction de dimensionnalité non linéaire) poursuit l'objectif d'incorporer des données qui se trouvent à l'origine …

1
Régression linéaire multivariée avec lasso en r
J'essaie de créer un modèle réduit pour prédire de nombreuses variables dépendantes (DV) (~ 450) qui sont hautement corrélées. Mes variables indépendantes (IV) sont également nombreuses (~ 2000) et fortement corrélées. Si j'utilise le lasso pour sélectionner un modèle réduit pour chaque sortie individuellement, je ne suis pas assuré d'obtenir …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.