Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai une distribution d'échantillons avec un petit nombre de valeurs dans chacun (moins de ). J'ai calculé la médiane de chaque échantillon, que je veux comparer avec un modèle et obtenir la différence entre le modèle et la médiane de chaque échantillon. Pour avoir un résultat cohérent, j'ai besoin d'une …
Je veux calculer les taux d'incidence à présenter le long des ratios de risque afin de présenter des mesures de risque relatives et absolues. J'ai vu dans d'autres études que de tels taux d'incidence peuvent être calculés en utilisant des modèles de poisson avec un temps de suivi dans le …
Dois-je inclure des effets aléatoires dans un modèle même s'ils ne sont pas statistiquement significatifs? J'ai un plan expérimental de mesures répétées, dans lequel chaque individu expérimente trois traitements différents dans un ordre aléatoire. Je voudrais contrôler les effets de l'individu et de l'ordre, mais aucun ne semble statistiquement significatif …
J'ai une question méthodologique et, par conséquent, aucun échantillon de jeu de données n'est joint. Je prévois de faire une régression de Cox ajustée au score de propension qui vise à examiner si un certain médicament réduira le risque de résultat. L'étude est observationnelle, comprenant 10 000 individus. L'ensemble de …
J'ai un ensemble de points de données qui sont censés s'asseoir sur un locus et suivre un modèle, mais il y a quelques points de dispersion du locus principal qui causent de l'incertitude dans mon analyse finale. Je voudrais obtenir un locus soigné pour l'appliquer plus tard pour mon analyse. …
D'après ce que je comprends, l'argument cp de la rpartfonction aide à pré-élaguer l'arbre de la même manière que les arguments minsplit ou minbucket. Ce que je ne comprends pas, c'est comment les valeurs CP sont calculées. Par exemple df<-data.frame(x=c(1,2,3,3,3,4), y=as.factor(c(TRUE, TRUE, FALSE, TRUE, FALSE, FALSE)), method="class") mytree<-rpart(y ~ x, …
Supposons que vous vouliez estimer un modèle linéaire: ( observations de la réponse et prédicteurs) nnnp+1p+1p+1E(yi)=β0+∑j=1pβjxijE(yi)=β0+∑j=1pβjxij\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Pour ce faire, vous pouvez utiliser la solution OLS, c'est-à-dire choisir les coefficients de sorte que la somme des erreurs carrées soit minimale: (β0,β1,⋯,βp)T=argminβ0,β1,⋯,βp∑i=1n(yi−β0−∑j=1pβjxij)2(β0,β1,⋯,βp)T=argminβ0,β1,⋯,βp∑i=1n(yi−β0−∑j=1pβjxij)2(\beta_0,\beta_1,\cdots,\beta_p)^T = \underset{\beta_0,\beta_1,\cdots,\beta_p}{\arg \min} \sum_{i=1}^{n} …
J'ai deux questions concernant les effets fixes dans le modèle DD. J'ai un traitement qui se produit à différents moments (par exemple, 2001, 2005, etc.). Je souhaite adapter un modèle DD, je standardise donc les années de traitement à l'année "0" comme durée de traitement. Pour contrôler l'hétérogénéité de l'année …
J'ai du mal avec les points de projection dans l'analyse discriminante linéaire (LDA). De nombreux livres sur les méthodes statistiques multivariées illustrent l'idée de la LDA avec la figure ci-dessous. La description du problème est la suivante. Nous devons d'abord dessiner une frontière de décision, ajouter une ligne perpendiculaire et …
J'essaie de quantifier le degré d'inflation (c.-à-d. La meilleure façon dont les points de données observés correspondent aux attentes). Une façon est aussi de regarder le tracé QQ. Mais je voudrais calculer un indicateur numérique de l'inflation - signifie que l'adéquation de l'observé correspond à la distribution uniforme théorique. Exemples …
J'ai 2 matrices de corrélation et (en utilisant le coefficient de corrélation linéaire de Pearson via corrcoef () de Matlab ). Je voudrais quantifier combien « plus de corrélation » contient par rapport à . Existe-t-il une métrique standard ou un test pour cela?AAABBBAAABBB Par exemple, la matrice de corrélation …
Il est généralement simple de faire un Power Analysispour calculer le minimum sample size, en particulier dans R qui est mon environnement informatique statistique préféré. Cependant, on me demande de mener une analyse de puissance qui est un peu différente de tout ce que j'ai fait ou auquel je peux …
La distribution lognormale appartient au domaine d'attraction maximal de Gumbel , où: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(lnx−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right) , FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Ma question : avons-nous et ?μ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta La distribution de valeur extrême généralisée utilise également la notation (Gumbel est le cas limite ), et la comparaison des CDF pour Standard-Lognormal …
Quelle est la meilleure façon de préparer les interactions des caractéristiques catégorielles avant de les adapter à scikit-learn? Avec statsmodelsje pourrais facilement dire en style R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(même chose avec Stata avec regress depvar i.var1##i.var2). Peut-on sklearn.preprocessing.PolynomialFeatures(dans la v0.15, actuellement dev) être utilisé avec des variables …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.