Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Conditions pour que l'estimateur M converge vers la vraie moyenne
Étant donné des échantillons iid d'une distribution gaussienne et de l'estimateur M, , quelles propriétés sur sont suffisantes pour garantir la ? Est étant strictement convexe et strictement croissante suffisante?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow \muρρ\rho
10 estimation 

4
Pourquoi les démographes donnent-ils des taux pour 100 000 habitants?
Il semble universel que les statistiques démographiques soient données en termes de 100 000 habitants par an. Par exemple, les taux de suicide, les taux d'homicides, l'année de vie ajustée sur l'incapacité, la liste continue. Pourquoi? Si nous parlions de chimie, les parties par million (ppm) sont courantes. Pourquoi l'acte …
10 demography  units 


1
Calcul / estimation rapide d'un système linéaire de bas rang
Les systèmes d'équations linéaires sont omniprésents dans les statistiques de calcul. Un système spécial que j'ai rencontré (par exemple, dans l'analyse factorielle) est le système Ax=bAx=bAx=b où A=D+BΩBTA=D+BΩBTA=D+ B \Omega B^T Ici DDD est une matrice diagonale n×nn×nn\times n avec une diagonale strictement positive, ΩΩ\Omega est une matrice semi-définie positive …




2
Comment estimer les paramètres d'un filtre de Kalman
Dans une question précédente, je me suis renseigné sur l'ajustement des distributions à certaines données empiriques non gaussiennes. On m'a suggéré hors ligne, que je pourrais essayer l'hypothèse selon laquelle les données sont gaussiennes et s'adapter d'abord à un filtre de Kalman. Ensuite, selon les erreurs, décidez s'il vaut la …

3
Technique de traçage aléatoire
J'ai rencontré la technique de traçage aléatoire suivante dans M. Seeger, «Mises à jour de bas rang pour la décomposition Cholesky», Université de Californie à Berkeley, Tech. Rep, 2007. tr(A)=E[xTAx]tr⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} où .x∼N(0,I)x∼N(0,I)\mathbf{x} \sim N(\mathbf{0},\mathbf{I}) En tant que personne sans formation approfondie en mathématiques, je me demande …

3
Quelle est la différence entre ITT et ATE?
J'ai du mal à comprendre les différents estimateurs qui peuvent être utilisés dans une évaluation d'impact. Je sais que l'estimateur en intention de traiter (ITT) compare les différences entre les personnes admissibles sans le programme et les personnes admissibles avec le programme, quelle que soit la conformité. Cependant, je pensais …

2
Pourquoi utiliser l'AUC?
Surtout du côté informatique de la littérature sur l'apprentissage automatique, l'ASC (aire sous la courbe caractéristique de l'opérateur du récepteur) est un critère populaire pour évaluer les classificateurs. Quelles sont les justifications de l'utilisation de l'AUC? Par exemple, existe-t-il une fonction de perte particulière pour laquelle la décision optimale est …

2
Optimisation de la variance moyenne du portefeuille de Markowitz dans R
J'ai 5 séries de rendement total en devises sur les marchés émergents, pour lesquelles je prévois des rendements futurs sur une seule période (1 an). J'aimerais construire un portefeuille Markowitz à variance moyenne optimisée de la série 5, en utilisant les variances et covariances historiques (1) et mes propres prévisions …
10 r 


6
Meilleure façon d'interagir avec une session R exécutée dans le cloud
Verrouillé . Cette question et ses réponses sont verrouillées car la question est hors sujet mais a une signification historique. Il n'accepte pas actuellement de nouvelles réponses ou interactions. J'ai R fonctionnant sur amazon EC2, en utilisant une version modifiée du bioconducteur AMI . Actuellement, j'utilise putty pour ssh dans …
10 r 

2
Données longitudinales: séries chronologiques, mesures répétées ou autre chose?
En clair: j'ai un modèle de régression multiple ou ANOVA mais la variable de réponse pour chaque individu est une fonction curviligne du temps. Comment puis-je savoir laquelle des variables de droite est responsable des différences significatives dans les formes ou les décalages verticaux des courbes? S'agit-il d'un problème de …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.