Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
La matrice d'information observée est un estimateur cohérent de la matrice d'information attendue?
J'essaie de prouver que la matrice d'information observée évaluée à l'estimateur du maximum de vraisemblance faiblement cohérent (MLE) est un estimateur faiblement cohérent de la matrice d'information attendue. C'est un résultat largement cité mais personne ne donne de référence ou de preuve (j'ai épuisé je pense les 20 premières pages …

2
Choix du paramètre de complexité dans CART
Dans la routine rpart () pour créer des modèles CART, vous spécifiez le paramètre de complexité auquel vous souhaitez tailler votre arbre. J'ai vu deux recommandations différentes pour choisir le paramètre de complexité: Choisissez le paramètre de complexité associé à l'erreur de validation croisée minimale possible. Cette méthode est recommandée …
16 r  cart  rpart 



2
Quels processus pourraient générer des données ou des paramètres distribués par Laplace (double exponentielle)?
Beaucoup de distributions ont des "mythes d'origine", ou des exemples de processus physiques qu'ils décrivent bien: Vous pouvez obtenir des données normalement distribuées à partir de sommes d'erreurs non corrélées via le théorème de limite centrale Vous pouvez obtenir des données distribuées binomialement à partir de retournements de pièces indépendants, …

4
Cadrer la distribution binomiale négative pour le séquençage de l'ADN
La distribution binomiale négative est devenue un modèle populaire pour les données de comptage (en particulier le nombre attendu de lectures de séquençage dans une région donnée du génome d'une expérience donnée) en bioinformatique. Les explications varient: Certains l'expliquent comme quelque chose qui fonctionne comme la distribution de Poisson mais …

3
Poisson est exponentiel comme Gamma-Poisson est quoi?
Une distribution de Poisson peut mesurer des événements par unité de temps et le paramètre est . La distribution exponentielle mesure le temps jusqu'au prochain événement, avec le paramètre . On peut convertir une distribution dans l'autre, selon qu'il est plus facile de modéliser des événements ou des heures.λλ\lambda1λ1λ\frac{1}{\lambda} Maintenant, …

1
Comment simuler à partir d'une copule gaussienne?
Supposons que j'ai deux distributions marginales univariées, disons FFF et GGG , à partir desquelles je peux simuler. Maintenant, construisons leur distribution conjointe en utilisant une copule gaussienne , notée C(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) . Tous les paramètres sont connus. Existe-t-il une méthode non-MCMC pour simuler à partir de cette copule?

3
Une estimation non biaisée de la médiane
Supposons que nous ayons une variable aléatoireXXX prise en charge sur[0,1][0,1][0,1] partir de laquelle nous pouvons tirer des échantillons. Comment arriver à une estimation non biaisée de la médiane deXXX ? Nous pouvons, bien sûr, générer des échantillons et prendre la médiane de l'échantillon, mais je comprends que cela ne …
16 sampling 

3
Estimation des probabilités de transition de Markov à partir des données de séquence
J'ai un ensemble complet de séquences (432 observations pour être précis) de 4 états A−DA−DA-D : par ex. Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) …

1
Définition et convergence des moindres carrés itérativement repondérés
J'ai utilisé des moindres carrés itérativement repondérés (IRLS) pour minimiser les fonctions de la forme suivante, J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) où NNN est le nombre d'instances de xi∈Rxi∈Rx_i \in \mathbb{R} , m∈Rm∈Rm \in \mathbb{R} est l'estimation robuste que je veux, et ρρ\rho est une fonction …

1
Modèle mixte vs erreurs standard de regroupement pour les études multisites - Pourquoi un modèle mixte est-il tellement plus efficace?
J'ai un ensemble de données composé d'une série de décomptes mensuels de «bâtons cassés» provenant d'une poignée de sites. J'essaie d'obtenir une seule estimation récapitulative à partir de deux techniques différentes: Technique 1: Ajustez un «bâton cassé» avec un GLM de Poisson avec une variable indicatrice 0/1, et utilisez une …


3
Qu'est-ce que Theta signifie?
Je suis un débutant dans les statistiques et j'ai trouvé ça . En statistique, θ, la lettre grecque minuscule «thêta», est le nom habituel d'un (vecteur de) paramètre (s) d'une certaine distribution de probabilité générale. Un problème courant est de trouver la ou les valeurs de thêta. Notez qu'il n'y …

1
Valeur attendue du log-déterminant d'une matrice de Wishart
Soit Λ∼WD(ν,Ψ)Λ∼WD(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi) , c'est-à-dire distribué selon une distribution de Wishart dimensionnelle avec la moyenne et les degrés de liberté . Je voudrais une expression pour oùest le déterminant.ν Ψ ν E ( log | Λ | ) | Λ |D×DD×DD \times DνΨνΨ\nu \Psiνν\nuE( journal| Λ | …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.