Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Tests de permutation à deux échantillons de Kolmogorov-Smirnov
Bien qu'il soit plus facile d'utiliser le test de type chi carré Pearson / Cressie-Read, je voudrais tester l'égalité des proportions dans les catégories dans deux groupes en utilisant un test de type Kolmogorov-Smirnov de la forme proposée par Pettitt & Stephens (1977 ) (voir aussi ici ).kkk En particulier, …



2
L'échantillonnage kurtosis est-il désespérément biaisé?
Je regarde l'échantillon kurtosis d'une variable aléatoire assez asymétrique, et les résultats semblent incohérents. Pour illustrer simplement le problème, j'ai regardé l'échantillon kurtosis d'un VR log-normal. En R (que j'apprends lentement): library(moments); samp_size = 2048; n_trial = 4096; kvals <- rep(NA,1,n_trial); #preallocate for (iii in 1:n_trial) { kvals[iii] <- kurtosis(exp(rnorm(samp_size))); …

2
Boxplots sous forme de tableaux
Nous préparons un manuscrit et l'éditeur nous a demandé de convertir une figure avec un boxplot en tableau "à cause du contenu des données plus exact". Bien que je pense que les boxplots sont assez décents pour révéler quelque chose sur les données, je me demandais ce que vous en …

2
Comment calculer la taille de l'échantillon pour la simulation afin d'affirmer un certain niveau de qualité dans mes résultats?
Je suis un débutant en statistiques, donc je m'excuse à l'avance si je pose une question braindead. J'ai cherché des réponses à ma question, mais je trouve que beaucoup de sujets sont soit trop spécifiques, soit dépassent rapidement ce que je comprends actuellement. J'ai quelques travaux de simulation qui incluent …

3
Test des fréquences appariées pour l'indépendance
J'espère que ce n'est ni trop basique ni redondant. J'ai cherché des conseils mais jusqu'à présent, je ne sais toujours pas comment procéder. Mes données consistent en des dénombrements d'une structure particulière utilisée dans les conversations entre paires d'interlocuteurs. L'hypothèse que je veux tester est la suivante: une utilisation plus …

4
Vous recherchez une distribution, peut-être peu commune, cohérente avec deux points de données et des contraintes expertes?
J'essaie d'indiquer une distribution antérieure pour une méta-analyse bayésienne. J'ai les informations suivantes sur une variable aléatoire: Deux observations: 3.0, 3.6 un scientifique qui étudie la variable m'a dit que P( X&lt; 2 ) = P( X&gt; 8 ) = 0P(X&lt;2)=P(X&gt;8)=0P(X<2)=P(X>8)=0, et que des valeurs aussi élevées que 6 ont …

1
Biais pour l'estimateur de densité du noyau (cas périodique)
L'estimateur de densité du noyau est donné par où iid avec une densité inconnue , - bande passante,f^(x,h)=1nh∑i=1nK(x−Xih)f^(x,h)=1nh∑i=1nK(x−Xih)\hat{f}(x,h)=\frac{1}{nh}\sum_{i=1}^{n}K(\frac{x-X_{i}}{h})X1,...XnX1,...XnX_1,...X_nfffhhh KKK - fonction du noyau ( , , ). Le biais peut être calculé en utilisant l'expansion de Taylor: ∫∞−∞K(x)dx=1∫−∞∞K(x)dx=1\int_{-\infty}^{\infty}K(x)dx=1∫∞−∞K(x)xdx=0∫−∞∞K(x)xdx=0\int_{-\infty}^{\infty}K(x)xdx=0∫∞−∞K(x)x2dx&lt;∞∫−∞∞K(x)x2dx&lt;∞\int_{-\infty}^{\infty}K(x)x^2dx<\infty∫∞−∞1hK(x−yh)f(y)dy−f(x)=∫∞−∞K(y)(f(x−hy)−f(x))dy∫−∞∞1hK(x−yh)f(y)dy−f(x)=∫−∞∞K(y)(f(x−hy)−f(x))dy\int_{-\infty}^{\infty}\frac{1}{h}K(\frac{x-y}{h})f(y)dy-f(x)=\int_{-\infty}^{\infty}K(y)\left(f(x-hy)-f(x)\right)dy =∫∞−∞K(y)(f′(x)hy+12f′′(x)(hy)2+o(h2))dy=12f′′(x)h2+o(h2)=∫−∞∞K(y)(f′(x)hy+12f″(x)(hy)2+o(h2))dy=12f″(x)h2+o(h2)=\int_{-\infty}^{\infty}K(y)\left(f'(x)hy+\frac{1}{2}f''(x)(hy)^{2}+o(h^{2})\right)dy=\frac{1}{2}f''(x)h^{2}+o(h^{2}) Comment gérer le noyau périodique et fff ( ∫10K(x)dx=1∫01K(x)dx=1\int_{0}^{1}K(x)dx=1 , ∫10K(x)xdx=0∫01K(x)xdx=0\int_{0}^{1}K(x)xdx=0 …

1
Quels sont les avantages de l'ANOVA par rapport à un modèle linéaire normal?
J'expérimente avec R et j'ai découvert qu'un anova () a besoin d'un objet de type lm. Mais pourquoi devrais-je continuer avec une anova après cela: &gt; x &lt;- data.frame(rand=rnorm(100), factor=sample(c("A","B","C"),100,replace=TRUE)) &gt; head(x) rand factor 1 0.9640502 B 2 -0.5038238 C 3 -1.5699734 A 4 -0.8422324 B 5 0.2489113 B 6 …
8 r  anova 





4
Rpart utilise-t-il des divisions multivariées par défaut?
Je sais que la rpartfonction de R conserve les données dont elle aurait besoin pour implémenter la division multivariée, mais je ne sais pas si elle effectue réellement des divisions multivariées. J'ai essayé de le rechercher en ligne en consultant les rpartdocuments, mais je ne vois aucune information indiquant qu'il …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.