Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai entendu une fois la transformation logarithmique est la plus populaire pour les distributions asymétriques à droite dans la régression linéaire ou la régression quantile Je voudrais savoir s'il y a une raison qui sous-tend cette déclaration? Pourquoi la transformation du journal convient-elle à une distribution asymétrique à droite? Que …
J'ai un ensemble de données avec N ~ 5000 et environ 1/2 manquant sur au moins une variable importante. La principale méthode d'analyse sera les risques proportionnels de Cox. Je prévois d'utiliser l'imputation multiple. Je vais également me séparer en train et en test. Dois-je diviser les données puis imputer …
J'ai eu du mal à comprendre la signification de "échantillon aléatoire" ainsi que de "variable aléatoire iid". J'ai essayé de trouver le sens à partir de plusieurs sources, mais je suis devenu de plus en plus confus. Je poste ici ce que j'ai essayé et appris à connaître: Probabilité et …
J'utilise cv.glmnetpour trouver des prédicteurs. La configuration que j'utilise est la suivante: lassoResults<-cv.glmnet(x=countDiffs,y=responseDiffs,alpha=1,nfolds=cvfold) bestlambda<-lassoResults$lambda.min results<-predict(lassoResults,s=bestlambda,type="coefficients") choicePred<-rownames(results)[which(results !=0)] Pour vous assurer que les résultats sont reproductibles I set.seed(1). Les résultats sont très variables. J'ai exécuté exactement le même code 100 pour voir à quel point les résultats étaient variables. Dans les …
Quelle est la différence entre la régression primitive , double et Kernel Ridge? Les gens utilisent les trois, et à cause de la notation différente que tout le monde utilise à différentes sources, il m'est difficile de suivre. Alors, quelqu'un peut-il me dire en termes simples quelle est la différence …
J'essaie de comparer visuellement comment trois publications d'actualités différentes couvrent différents sujets (déterminées par un modèle de sujet LDA). J'ai deux méthodes connexes pour le faire, mais j'ai reçu beaucoup de commentaires de collègues que ce n'est pas très intuitif. J'espère que quelqu'un là-bas aura une meilleure idée pour visualiser …
Dans une régression linéaire multiple, il est possible de trouver le coefficient avec la formule suivante. b=(X′X)−1(X′)Yb=(X′X)−1(X′)Ouib = (X'X)^{-1}(X')Y beta = solve(t(X) %*% X) %*% (t(X) %*% Y) ; beta Par exemple: > y <- c(9.3, 4.8, 8.9, 6.5, 4.2, 6.2, 7.4, 6, 7.6, 6.1) > x0 <- c(1,1,1,1,1,1,1,1,1,1) > …
J'essaie d'appliquer MCMC sur un problème, mais mes priors (dans mon cas, ils sont )) sont limités à une zone? Puis-je utiliser une MCMC normale et ignorer les échantillons qui se trouvent en dehors de la zone restreinte (qui dans mon cas est [0,1] ^ 2), c'est-à-dire réutiliser la fonction …
J'ai une question dans laquelle il demande de vérifier si la distribution uniforme ( Uniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ) est normalisée. D'une part, que signifie la normalisation d'une distribution? Et deuxièmement, comment procéder pour vérifier si une distribution est normalisée ou non? Je comprends en calculant X−meansdX−meansd \frac{X-\text{mean}}{\text{sd}} nous obtenons desdonnéesnormalisées, mais …
Lorsque vous construisez un biplot pour une analyse PCA, vous avez les scores PC1 de la composante principale sur l'axe x et les scores PC2 sur l'axe y. Mais quels sont les deux autres axes à droite et en haut de l'écran?
tl; dr Quelle est la méthode recommandée pour traiter les discretedonnées lors de la détection d'anomalies? Quelle est la méthode recommandée pour traiter les categoricaldonnées lors de la détection d'anomalies? Cette réponse suggère d'utiliser des données discrètes pour filtrer simplement les résultats. Peut-être remplacer la valeur de la catégorie par …
Je voudrais savoir en quoi le traitement des poids diffère entre svyglmetglm J'utilise le twangpackage dans R pour créer des scores de propension qui sont ensuite utilisés comme poids, comme suit (ce code provient de la twangdocumentation): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black …
J'essaie de réaliser une analyse de survie en temps discret à l'aide d'un modèle de régression logistique, et je ne suis pas sûr de bien comprendre le processus. J'apprécierais grandement l'aide pour quelques questions de base. Voici la configuration: J'examine l'appartenance à un groupe dans un délai de cinq ans. …
Une idée pourquoi nous n'utilisons pas de chiffres significatifs dans les statistiques? Quelque chose dans le sens où nous utilisons des estimations afin que les règles de précision ne s'appliquent pas;)?
J'ai un ensemble de données sur les essais agricoles. Ma variable de réponse est un rapport de réponse: log (traitement / contrôle). Je m'intéresse à ce qui intervient dans la différence, donc je lance des méta-régressions RE (non pondérées, car il semble assez clair que la taille de l'effet n'est …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.