Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Obtenir des vecteurs de cointégration en utilisant la méthode Johansen
J'essaie de mieux comprendre la méthode Johansen, j'ai donc développé un exemple 3.1 donné par le livre Likelihood-Based-Inference-Cointegrated-Autoregressive-Econometrics où nous avons trois processus: X1 t=∑i = 1tϵ1 i+ϵ2 tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2 t= α∑i = 1tϵ1 i+ϵ3 tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3 t=ϵ4 …

4
Le test de Mann-Whitney peut-il être utilisé pour des comparaisons post-hoc après Kruskal-Wallis?
J'ai une simulation où un animal est placé dans un environnement hostile et chronométré pour voir combien de temps il peut survivre en utilisant une approche de survie. Il existe trois approches qu'il peut utiliser pour survivre. J'ai effectué 300 simulations de l'animal en utilisant chaque approche de survie. Toutes …

1
Pourquoi devez-vous fournir un modèle de variogramme lorsque vous faites du krigeage?
Je suis très nouveau dans les statistiques spatiales et je regarde beaucoup de tutoriels, Mais je ne comprends pas vraiment pourquoi vous devez fournir un modèle de variogramme lorsque vous krige. J'utilise le paquet gstat dans R, et voici l'exemple qu'ils donnent: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) …
9 spatial 


2
Regroupement d'une donnée bruyante ou avec des valeurs aberrantes
J'ai des données bruyantes de deux variables comme celle-ci. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, …

1
Comment générer des données de survie avec des covariables dépendantes du temps en utilisant R
Je veux générer le temps de survie à partir d'un modèle de risques proportionnels de Cox qui contient une covariable dépendante du temps. Le modèle est h(t|Xi)=h0(t)exp(γXi+αmi(t))h(t|Xi)=h0(t)exp⁡(γXi+αmi(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) où est généré à partir de Binomial (1,0,5) et .m i ( t ) = β 0 …

1
Comprendre la décomposition en valeurs singulières dans le contexte de LSI
Ma question porte généralement sur la décomposition en valeurs singulières (SVD), et en particulier sur l'indexation sémantique latente (LSI). Dis, j'ai qui contient des fréquences de 5 mots pour 7 documents.Aword×documentAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') J'obtenir la matrice factorisation …

1
Standardisation des fonctionnalités lors de l'utilisation de LDA comme étape de prétraitement
Si une analyse discriminante linéaire multi-classes (ou je lis parfois plusieurs analyses discriminantes) est utilisée pour la réduction de dimensionnalité (ou la transformation après réduction de dimensionnalité via PCA), je comprends qu'en général une "normalisation du score Z" (ou standardisation) de les fonctionnalités ne seront pas nécessaires, même si elles …

1
Pourquoi l'algorithme EM doit-il être itératif?
Supposons que vous ayez une population avec unités, chacune avec une variable aléatoire . Vous observez valeurs pour toute unité pour laquelle . Nous voulons une estimation de .NNNn = N - n 0 X i > 0 λXje∼ Poisson ( λ )Xi∼Poisson(λ)X_i \sim \text{Poisson}(\lambda)n = N- n0n=N−n0n = N-n_0Xje> …

2
Histoire: le rôle des statistiques en astronomie
J'ai récemment affirmé avec audace devant un groupe d'élèves de huitième année assez intelligents que l'astronomie contribuait grandement aux fondements des statistiques et que de nombreux concepts statistiques ont été inventés pour être utilisés en astronomie. Cependant, en cherchant à appuyer cela, j'ai été assez déçu. Des erreurs, la moyenne …

1
Quel est le CDF à deux échantillons de
J'essaie de comprendre comment obtenir des valeurs de pour le test unilatéral de Kolmogorov-Smirnov , et j'ai du mal à trouver des CDF pour et dans le cas à deux échantillons. Ce qui suit est cité à quelques endroits comme le CDF pour dans un cas à un échantillon:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) …



2
Estimation des ratios de risque ajustés dans les données binaires à l'aide de la régression de Poisson
Je m'intéresse à l'estimation d'un rapport de risque ajusté, analogue à la façon dont on estime un rapport de cotes ajusté en utilisant la régression logistique. Certaines publications (par exemple, ceci ) indiquent que l'utilisation de la régression de Poisson avec les erreurs standard de Huber-White est une façon basée …

1
Simuler la convergence des probabilités à une constante
Les résultats asymptotiques ne peuvent pas être prouvés par simulation informatique, car ce sont des déclarations impliquant le concept de l'infini. Mais nous devrions être capables de sentir que les choses marchent effectivement comme le dit la théorie. Considérons le résultat théorique limn→∞P(|Xn|>ϵ)=0,ϵ>0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 où XnXnX_n …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.