Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Intervalles de confiance pour la médiane
J'ai une distribution d'échantillons avec un petit nombre de valeurs dans chacun (moins de ). J'ai calculé la médiane de chaque échantillon, que je veux comparer avec un modèle et obtenir la différence entre le modèle et la médiane de chaque échantillon. Pour avoir un résultat cohérent, j'ai besoin d'une …


1
Dois-je exclure les effets aléatoires d'un modèle s'ils ne sont pas statistiquement significatifs?
Dois-je inclure des effets aléatoires dans un modèle même s'ils ne sont pas statistiquement significatifs? J'ai un plan expérimental de mesures répétées, dans lequel chaque individu expérimente trois traitements différents dans un ordre aléatoire. Je voudrais contrôler les effets de l'individu et de l'ordre, mais aucun ne semble statistiquement significatif …



1
Recherche de valeurs aberrantes sur un nuage de points
J'ai un ensemble de points de données qui sont censés s'asseoir sur un locus et suivre un modèle, mais il y a quelques points de dispersion du locus principal qui causent de l'incertitude dans mon analyse finale. Je voudrais obtenir un locus soigné pour l'appliquer plus tard pour mon analyse. …

2
Comment les valeurs de CP (complexité des coûts) sont-elles calculées dans RPART (ou les arbres de décision en général)
D'après ce que je comprends, l'argument cp de la rpartfonction aide à pré-élaguer l'arbre de la même manière que les arguments minsplit ou minbucket. Ce que je ne comprends pas, c'est comment les valeurs CP sont calculées. Par exemple df<-data.frame(x=c(1,2,3,3,3,4), y=as.factor(c(TRUE, TRUE, FALSE, TRUE, FALSE, FALSE)), method="class") mytree<-rpart(y ~ x, …
9 r  cart  rpart 

1
Comparaison des résidus entre régressions OLS et non OLS
Supposons que vous vouliez estimer un modèle linéaire: ( observations de la réponse et prédicteurs) nnnp+1p+1p+1E(yi)=β0+∑j=1pβjxijE(yi)=β0+∑j=1pβjxij\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Pour ce faire, vous pouvez utiliser la solution OLS, c'est-à-dire choisir les coefficients de sorte que la somme des erreurs carrées soit minimale: (β0,β1,⋯,βp)T=argminβ0,β1,⋯,βp∑i=1n(yi−β0−∑j=1pβjxij)2(β0,β1,⋯,βp)T=arg⁡minβ0,β1,⋯,βp∑i=1n(yi−β0−∑j=1pβjxij)2(\beta_0,\beta_1,\cdots,\beta_p)^T = \underset{\beta_0,\beta_1,\cdots,\beta_p}{\arg \min} \sum_{i=1}^{n} …



1
Calculer l'inflation observée et les valeurs p attendues à partir d'une distribution uniforme dans le graphique QQ
J'essaie de quantifier le degré d'inflation (c.-à-d. La meilleure façon dont les points de données observés correspondent aux attentes). Une façon est aussi de regarder le tracé QQ. Mais je voudrais calculer un indicateur numérique de l'inflation - signifie que l'adéquation de l'observé correspond à la distribution uniforme théorique. Exemples …

1
Quantifier la quantité de «plus de corrélation» qu'une matrice de corrélation A contient par rapport à une matrice de corrélation B
J'ai 2 matrices de corrélation et (en utilisant le coefficient de corrélation linéaire de Pearson via corrcoef () de Matlab ). Je voudrais quantifier combien « plus de corrélation » contient par rapport à . Existe-t-il une métrique standard ou un test pour cela?AAABBBAAABBB Par exemple, la matrice de corrélation …


1
Théorie des valeurs extrêmes: paramètres GEV log-normaux
La distribution lognormale appartient au domaine d'attraction maximal de Gumbel , où: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right) , FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Ma question : avons-nous et ?μ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta La distribution de valeur extrême généralisée utilise également la notation (Gumbel est le cas limite ), et la comparaison des CDF pour Standard-Lognormal …

2
Comment préparer les interactions des variables catégorielles dans scikit-learn?
Quelle est la meilleure façon de préparer les interactions des caractéristiques catégorielles avant de les adapter à scikit-learn? Avec statsmodelsje pourrais facilement dire en style R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(même chose avec Stata avec regress depvar i.var1##i.var2). Peut-on sklearn.preprocessing.PolynomialFeatures(dans la v0.15, actuellement dev) être utilisé avec des variables …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.