Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Besoin d'aide pour identifier une distribution par son histogramme
J'ai la population d'échantillon des maxima d'amplitude enregistrés d'un certain signal. La population est d'environ 15 millions d'échantillons. J'ai produit un histogramme de la population, mais je ne peux pas deviner la distribution avec un tel histogramme. EDIT1: le fichier contenant les valeurs brutes des échantillons est ici: données brutes …



1
Régression logistique avec des données directionnelles comme IV
Je recherche de bonnes références sur l'utilisation des données directionnelles (mesure de la direction en degrés) comme variable indépendante dans la régression; idéalement, il serait également utile pour les modèles hiérarchiques non linéaires (les données sont imbriquées). Je m'intéresse également aux données directionnelles plus généralement. J'ai trouvé un texte de …


4
Estimateur non biaisé pour la plus petite des deux variables aléatoires
Supposons que X∼N(μx,σ2x)X∼N(μx,σx2)X \sim \mathcal{N}(\mu_x, \sigma^2_x) et Y∼N(μy,σ2y)Y∼N(μy,σy2)Y \sim \mathcal{N}(\mu_y, \sigma^2_y) z=min(μx,μy)z=min(μx,μy)z = \min(\mu_x, \mu_y)zzz L'estimateur simple de où et sont par exemple des moyennes d'échantillon de et , est biaisé (bien que cohérent). Il a tendance à sous-mesurer .min(x¯,y¯)min(x¯,y¯)\min(\bar{x}, \bar{y})x¯x¯\bar{x}y¯y¯\bar{y}XXXYYYzzz Je ne peux pas penser à un estimateur sans …

1
Méthodes d'ajustement d'un modèle «simple» d'erreur de mesure
Je recherche des méthodes qui peuvent être utilisées pour estimer le modèle d'erreur de mesure "OLS". yi=Yi+ey,iyi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} xi=Xi+ex,ixi=Xi+ex,ix_{i}=X_{i}+e_{x,i} Yi=α+βXiYi=α+βXiY_{i}=\alpha + \beta X_{i} Où les erreurs sont normales indépendantes avec des variances inconnues et . L'OLS "standard" ne fonctionnera pas dans ce cas.σ2yσy2\sigma_{y}^{2}σ2xσx2\sigma_{x}^{2} Wikipedia a quelques solutions peu attrayantes - les …


3
Quelle est la différence entre l'utilisation de aov () et lme () dans l'analyse d'un ensemble de données longitudinales?
Quelqu'un peut-il me dire la différence entre l'utilisation aov()et l' lme()analyse de données longitudinales et comment interpréter les résultats de ces deux méthodes? Ci-dessous, j'analyse le même ensemble de données en utilisant aov()et lme()et j'ai obtenu 2 résultats différents. Avec aov(), j'ai obtenu un résultat significatif dans l'interaction temps par …

3
Formule de probabilité pour une distribution bernoulli multivariée
J'ai besoin d'une formule pour la probabilité d'un événement dans une distribution de Bernoulli à n variables X∈{0,1}nX∈{0,1}nX\in\{0,1\}^n avec des probabilités P(Xi=1)=piP(Xi=1)=piP(X_i=1)=p_i pour un seul élément et pour des paires d'éléments P(Xi=1∧Xj=1)=pijP(Xi=1∧Xj=1)=pijP(X_i=1 \wedge X_j=1)=p_{ij} . Je pourrais vous donner de manière équivalente moyenne et covariance de XXX . J'ai déjà …

2
Comprendre les comparaisons des résultats de clustering
J'expérimente avec la classification des données en groupes. Je suis assez nouveau sur ce sujet et j'essaie de comprendre le résultat de certaines analyses. En utilisant des exemples de Quick-R , plusieurs Rpackages sont suggérés. J'ai essayé d'utiliser deux de ces packages (en fpcutilisant la kmeansfonction, et mclust). Un aspect …
13 r  clustering 

3
GLMNET ou LARS pour le calcul des solutions LASSO?
Je voudrais obtenir les coefficients du problème LASSO ||Y−Xβ||+λ||β||1.||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. Le problème est que les fonctions glmnet et lars donnent des réponses différentes. Pour la fonction glmnet, je demande les coefficients de λ/||Y||λ/||Y||\lambda/||Y||au lieu de simplement λλ\lambda , mais j'obtiens toujours des réponses différentes. Est-ce attendu? Quelle est la relation …

2
Analyse exploratoire des erreurs de prévision spatio-temporelles
Les données: J'ai récemment travaillé sur l'analyse des propriétés stochastiques d'un champ spatio-temporel d'erreurs de prévision de production d'énergie éolienne. Formellement, on peut dire que c'est un processus (ϵpt+h|t)t=1…,T;h=1,…,H,p=p1,…,pn(ϵt+h|tp)t=1…,T;h=1,…,H,p=p1,…,pn \left (\epsilon^p_{t+h|t} \right )_{t=1\dots,T;\; h=1,\dots,H,\;p=p_1,\dots,p_n} indexé deux fois dans le temps (avectttethhh) et une fois dans l'espace (ppp) avecHHHétant le nombre …

7
Donner du sens à la théorie et aux applications de la statistique
J'ai récemment obtenu mon diplôme de maîtrise en modélisation médicale et biologique, accompagné de mathématiques d'ingénierie en arrière-plan. Même si mon programme d'éducation comprenait une quantité importante de cours sur les statistiques mathématiques (voir ci-dessous pour une liste), que j'ai réussi avec des notes assez élevées, je finis souvent par …

1
Les rapports de vraisemblance et la comparaison des modèles bayésiens offrent-ils des alternatives supérieures et suffisantes aux tests d'hypothèse nulle?
En réponse à un nombre croissant de statisticiens et de chercheurs qui critiquent l'utilité des tests d'hypothèse nulle (NHT) pour la science comme un effort cumulatif, le groupe de travail sur l'inférence statistique de l'American Psychological Association a évité une interdiction pure et simple du NHT, mais a plutôt suggéré …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.