Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Regroupement optimal par rapport à une variable de réponse donnée
Je recherche une méthode de binning optimale (discrétisation) d'une variable continue par rapport à une variable binaire de réponse (cible) donnée et avec un nombre maximum d'intervalles comme paramètre. exemple: J'ai un ensemble d'observations de personnes avec des variables "hauteur" (numéral continu) et "has_back_pains" (binaire). Je veux discrétiser la hauteur …




2
Dérivation de Normal-Wishart postérieur
Je travaille sur la dérivation d'un postérieur de Normal-Wishart mais je suis bloqué sur l'un des paramètres (le postérieur de la matrice d'échelle, voir en bas). Juste pour le contexte et l'exhaustivité, voici le modèle et le reste des dérivations: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ …

2
obtenir des degrés de liberté de lmer
J'ai adapté un modèle lmer avec les éléments suivants (bien que la sortie soit composée): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 J'aimerais vraiment construire un intervalle de confiance pour chaque effet en utilisant la formule suivante: ( n - 1 ) s2χ2α / …



3
Comment faire une analyse factorielle lorsque la matrice de covariance n'est pas définie positive?
J'ai un ensemble de données qui comprend 717 observations (lignes) qui sont décrites par 33 variables (colonnes). Les données sont normalisées par z-score de toutes les variables. Il n'y a pas deux variables dépendantes linéairement ( ). J'ai également supprimé toutes les variables avec une très faible variance (inférieure à …

1
seuil de calcul pour le classificateur de risque minimum?
Supposons que deux classes et ont un attribut et ont la distribution et . si nous avons égal pour la matrice de coût suivante:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} pourquoi, est le seuil du classificateur de risque (coût) minimum?x0<0.5x0<0.5x_0 …

1
Comment sélectionner le meilleur ajustement sans données sur-ajustées? Modélisation d'une distribution bimodale avec N fonctions normales, etc.
J'ai une distribution de valeurs évidemment bimodale, que je cherche à adapter. Les données peuvent être adaptées à 2 fonctions normales (bimodales) ou à 3 fonctions normales. De plus, il existe une raison physique plausible pour ajuster les données avec 3. Plus il y a de paramètres introduits, plus l'ajustement …



1
Comment interpréter la sortie de lave?
J'essaie l'analyse factorielle confirmatoire (CFA) en utilisant lavaan. J'ai du mal à interpréter la sortie produite par lavaan. J'ai un modèle simple - 4 facteurs chacun pris en charge par les éléments des données d'enquête recueillies. Les facteurs sont conformes à ce qui est mesuré par les éléments, dans la …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.