Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

5
Quelle est la raison pour laquelle la transformation du journal est utilisée avec des distributions asymétriques à droite?
J'ai entendu une fois la transformation logarithmique est la plus populaire pour les distributions asymétriques à droite dans la régression linéaire ou la régression quantile Je voudrais savoir s'il y a une raison qui sous-tend cette déclaration? Pourquoi la transformation du journal convient-elle à une distribution asymétrique à droite? Que …



5
Variabilité dans les résultats cv.glmnet
J'utilise cv.glmnetpour trouver des prédicteurs. La configuration que j'utilise est la suivante: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Pour vous assurer que les résultats sont reproductibles I set.seed(1). Les résultats sont très variables. J'ai exécuté exactement le même code 100 pour voir à quel point les résultats étaient variables. Dans les …


4
Comment visualiser au mieux les différences dans de nombreuses proportions entre trois groupes?
J'essaie de comparer visuellement comment trois publications d'actualités différentes couvrent différents sujets (déterminées par un modèle de sujet LDA). J'ai deux méthodes connexes pour le faire, mais j'ai reçu beaucoup de commentaires de collègues que ce n'est pas très intuitif. J'espère que quelqu'un là-bas aura une meilleure idée pour visualiser …


1
MCMC sur un espace de paramètres borné?
J'essaie d'appliquer MCMC sur un problème, mais mes priors (dans mon cas, ils sont )) sont limités à une zone? Puis-je utiliser une MCMC normale et ignorer les échantillons qui se trouvent en dehors de la zone restreinte (qui dans mon cas est [0,1] ^ 2), c'est-à-dire réutiliser la fonction …

3
Que signifie «normalisation» et comment vérifier qu'un échantillon ou une distribution est normalisé?
J'ai une question dans laquelle il demande de vérifier si la distribution uniforme ( Uniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ) est normalisée. D'une part, que signifie la normalisation d'une distribution? Et deuxièmement, comment procéder pour vérifier si une distribution est normalisée ou non? Je comprends en calculant X−meansdX−meansd \frac{X-\text{mean}}{\text{sd}} nous obtenons desdonnéesnormalisées, mais …

2
Quels sont les quatre axes du biplot PCA?
Lorsque vous construisez un biplot pour une analyse PCA, vous avez les scores PC1 de la composante principale sur l'axe x et les scores PC2 sur l'axe y. Mais quels sont les deux autres axes à droite et en haut de l'écran?
18 r  pca  biplot 

2
Détection d'anomalies avec des fonctions factices (et d'autres fonctions discrètes / catégorielles)
tl; dr Quelle est la méthode recommandée pour traiter les discretedonnées lors de la détection d'anomalies? Quelle est la méthode recommandée pour traiter les categoricaldonnées lors de la détection d'anomalies? Cette réponse suggère d'utiliser des données discrètes pour filtrer simplement les résultats. Peut-être remplacer la valeur de la catégorie par …

2
utilisation des poids dans svyglm vs glm
Je voudrais savoir en quoi le traitement des poids diffère entre svyglmetglm J'utilise le twangpackage dans R pour créer des scores de propension qui sont ensuite utilisés comme poids, comme suit (ce code provient de la twangdocumentation): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black …
18 r  survey 




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.