Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Surdispersion et alternatives de modélisation dans les modèles à effet aléatoire de Poisson avec décalages
J'ai rencontré un certain nombre de questions pratiques lors de la modélisation des données de comptage issues de la recherche expérimentale à l'aide d'une expérience intra-sujet. Je décris brièvement l'expérience, les données et ce que j'ai fait jusqu'à présent, suivi de mes questions. Quatre films différents ont été montrés en …

1
L'optimiseur lme4 par défaut nécessite de nombreuses itérations pour les données de grande dimension
TL; DR: l' lme4optimisation semble être linéaire dans le nombre de paramètres du modèle par défaut, et est beaucoup plus lente qu'un glmmodèle équivalent avec des variables factices pour les groupes. Puis-je faire quelque chose pour l'accélérer? J'essaie d'adapter un modèle logit hiérarchique assez grand (~ 50k lignes, 100 colonnes, …

2
Comment trouver
Comment puis-je résoudre ça? J'ai besoin d'équations intermédiaires. Peut-être que la réponse est .−tf(x)−tf(x)-tf(x) ddt[∫∞txf(x)dx]ddt[∫t∞xf(x)dx] \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] f(x)f(x)f(x) est la fonction de densité de probabilité. C'est-à-dire, et \ lim \ limits_ {x \ to \ infty} F (x) = 1limx→∞f(x)=0limx→∞f(x)=0\lim\limits_{x \to \infty} f(x) = 0limx→∞F(x)=1limx→∞F(x)=1\lim\limits_{x \to …





2
Dérogation à l'hypothèse de normalité dans l'ANOVA: le kurtosis ou l'asymétrie est-il plus important?
Modèles statistiques linéaires appliqués par Kutner et al. énonce ce qui suit concernant les écarts par rapport à l'hypothèse de normalité des modèles ANOVA: le kurtosis de la distribution d'erreur (soit plus ou moins atteint un pic qu'une distribution normale) est plus important que l'asymétrie de la distribution en termes …

2
Quels sont les paramètres d'un postérieur de Wishart-Wishart?
Lors de l'inférence de la matrice de précision ΛΛ\boldsymbol{\Lambda} d'une distribution normale utilisée pour générer NNN vecteurs D-dimension x1,..,xNx1,..,xN\mathbf{x_1},..,\mathbf{x_N} xi∼N(μ,Λ−1)xi∼N(μ,Λ−1)\begin{align} \mathbf{x_i} &\sim \mathcal{N}(\boldsymbol{\mu, \Lambda^{-1}}) \\ \end{align} nous plaçons généralement un Wishart prioritaire sur ΛΛ\boldsymbol{\Lambda} car la distribution Wishart est le conjugué avant pour la précision d'une distribution normale multivariée avec …

1
Comment lire les résultats du test de Dunn?
Comment lire les résultats du test de Dunn ? Plus précisément, que m'indiquent les valeurs du tableau ci-dessous? J'ai des données non paramétriques dans 4 groupes, et j'ai d'abord fait un test de Kruskal-Wallis pour confirmer que les distributions des groupes étaient différentes les unes des autres et de l'ensemble …

1
Y a-t-il une différence entre une supervision à distance, une auto-formation, un apprentissage auto-supervisé et une supervision faible?
D'après ce que j'ai lu: Supervision à distance : A Distant supervision algorithm usually has the following steps: 1] It may have some labeled training data 2] It "has" access to a pool of unlabeled data 3] It has an operator that allows it to sample from this unlabeled data …

3
Estimateur du maximum de vraisemblance de la distribution conjointe, compte tenu uniquement des comptes marginaux
Soit une distribution conjointe de deux variables catégorielles , avec . Supposons que échantillons ont été tirés de cette distribution, mais nous ne recevons que les comptes marginaux, à savoir pour :px,ypx,yp_{x,y}X,YX,YX,Yx,y∈{1,…,K}x,y∈{1,…,K}x,y\in\{1,\ldots,K\}nnnj=1,…,Kj=1,…,Kj=1,\ldots,K Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j),Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j), S_j = \sum_{i=1}^{n}{\delta(X_i=l)}, T_j = \sum_{i=1}^{n}{\delta(Y_i=j)}, Quel est l'estimateur du maximum de vraisemblance pour , étant donné …


1
Régression logistique avec splines de régression dans R
J'ai développé un modèle de régression logistique basé sur des données rétrospectives d'une base de données nationale sur les traumatismes des traumatismes crâniens au Royaume-Uni. Le résultat clé est la mortalité à 30 jours (dénommée mesure de «survie»). D'autres mesures avec des preuves publiées d'effet significatif sur les résultats dans …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.