Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Quel est l'avantage d'utiliser des tests de permutation?
Lors du test d'hypothèses nulles ou alternatives par une statistique de test , où , appliquez le test de permutation avec l'ensemble de permutations sur et nous avons une nouvelle statistique U(X)U(X)U(X)X={xi,...,xn}X={xi,...,xn}X = \{ x_i, ..., x_n\}GGGXXXT(X):=#{π∈G:U(πX)≥U(X)}|G|.T(X):=#{π∈G:U(πX)≥U(X)}|G|. T(X) := \frac{\# \{\pi \in G: U(\pi X) \geq U(X)\}}{|G|}. Quel est l'avantage …


1
Méthodes pénalisées pour les données catégorielles: combiner les niveaux dans un facteur
Les modèles pénalisés peuvent être utilisés pour estimer les modèles où le nombre de paramètres est égal ou même supérieur à la taille de l'échantillon. Cette situation peut se produire dans les modèles log-linéaires de grandes tables clairsemées de données catégorielles ou de dénombrement. Dans ces paramètres, il est souvent …


1
Biais des estimateurs du maximum de vraisemblance pour la régression logistique
J'aimerais comprendre quelques faits sur les estimateurs du maximum de vraisemblance (MLE) pour les régressions logistiques. Est-il vrai qu'en général, le MLE pour la régression logistique est biaisé? Je dirais "oui". Je sais, par exemple, que la dimension de l'échantillon est liée au biais asymptotique des MLE. Connaissez-vous des exemples …

3
Mesurer certains patients plus d'une fois
Je mène une étude clinique où je détermine une mesure anthropométrique des patients. Je sais comment gérer la situation où j'ai une mesure par patient: je fais un modèle, où j'ai un échantillon aléatoire d'une certaine densité , et je fais le truc habituel: écrire la probabilité de l'échantillon, estimer …
10 inference 


4
Modèle d'historique d'événement à temps discret (survie) dans R
J'essaie d'adapter un modèle à temps discret dans R, mais je ne sais pas comment le faire. J'ai lu que vous pouvez organiser la variable dépendante dans différentes lignes, une pour chaque observation de temps, et utiliser la glmfonction avec un lien logit ou cloglog. En ce sens, j'ai trois …
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

1
Question sur l'exemple de fonction d'autocovariance
Je lis un livre d'analyse de séries chronologiques et la formule de l'échantillon d'autocovariance est définie dans le livre comme: γˆ(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)γ^(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) avecpour . est la moyenne.γˆ(−h)=γˆ(h)γ^(−h)=γ^(h)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\;ˉ xh=0,1,...,n−1h=0,1,...,n−1\;h = 0,1, ..., n-1x¯x¯\bar{x} Quelqu'un peut-il expliquer intuitivement pourquoi nous divisons la somme par et non par ? Le …







En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.