Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


2
Quelles sont les raisons pour lesquelles les moindres carrés itérativement repondérés ne convergeraient pas lorsqu'ils sont utilisés pour la régression logistique?
J'ai utilisé la fonction glm.fit dans R pour ajuster les paramètres à un modèle de régression logistique. Par défaut, glm.fit utilise des moindres carrés itérativement repondérés pour ajuster les paramètres. Quelles sont les raisons pour lesquelles cet algorithme ne parviendrait pas à converger, lorsqu'il est utilisé pour la régression logistique?

2
Visualisation et superposition: Alternative aux dispersions
J'ai un grand ensemble de données sur les pays qui sont encombrées (comme vous pouvez le voir ci-dessous), mais j'ai besoin des étiquettes et des valeurs aberrantes - j'ai aussi beaucoup de graphiques, il serait donc fastidieux de réinitialiser la fenêtre et d'ajouter de faux points de données pour les …

2
Calcul manuel de la valeur de p pour le test t: comment éviter des valeurs supérieures à
Ces deux méthodes de calcul de la valeur p doivent être équivalentes: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) Le problème avec la deuxième méthode est qu'il y a le risque d'obtenir des valeurs supérieures à (en fait jusqu'à ):111222 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 On peut bien sûr y remédier en 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Ma question …
8 r  t-test  p-value 


1
Examen du document sur le filtre à particules
J'ai trouvé en ligne une ébauche d'un excellent article de synthèse de Zhe Chen intitulé "Filtrage bayésien: des filtres de Kalman aux filtres à particules et au-delà". Selon Google Scholar, la citation de la version publiée est "Statistics 182 (1), 1-69, 2003" mais le journal que je trouve avec ce …

1
Formule Schuette – Nesbitt
Je lisais l'article sur la formule Schuette-Nesbitt , qui est décrite comme "une généralisation du principe d'inclusion-exclusion" , qui a à la fois une version combinatoire et probabiliste. Un autre site Web a fourni une preuve des événements dépendants (téléchargement en pdf) et en a trouvé un troisième qui le …

1
Dériver l'algorithme K-means comme limite de maximisation des attentes pour les mélanges gaussiens
Christopher Bishop définit la valeur attendue de la fonction de vraisemblance du journal des données complètes (c'est-à-dire en supposant que l'on nous donne à la fois les données observables X et les données latentes Z) comme suit: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[ln⁡p(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){ln⁡πk+ln⁡N(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln …

1
Termes d'erreur vs Innovations
J'ai remarqué que nous appelons parfois les termes d'erreur «innovations». Je ne comprends pas si c'est dans des situations particulières ou si ces termes peuvent être utilisés les uns pour les autres. Ensuite, une autre question est "pourquoi appelons-nous les termes d'erreur" innovations "? Merci


3
Convertir le rapport de risques en rapport de cotes
En méta-analyse: comment convertir les ratios de risque dans certaines études en odds ratio? Il y a des études de cas témoins et de cohorte à inclure et certaines d'entre elles font état de ratios de risque. Les données brutes ne sont pas rapportées de manière à calculer le rapport …

2
Distributions asymétriques pour la régression logistique
J'ai développé un modèle de régression logistique basé sur les données rétrospectives d'une base de données nationale sur les traumatismes des traumatismes crâniens au Royaume-Uni. Le résultat clé est la mortalité à 30 jours (désignée comme Outcome30mesure). D'autres mesures dans l'ensemble de la base de données avec des preuves publiées …

1
Indépendance linéaire vs indépendance statistique (PCA et ICA)
Je lis cet article intéressant sur l'application de l'ICA aux données d'expression génique. Les auteurs écrivent: [T] il n'est pas nécessaire que les composants PCA soient statistiquement indépendants. C'est vrai, mais les PJ sont orthogonaux, n'est-ce pas? Je suis un peu flou quant à la relation entre l'indépendance statistique et …
8 pca  independence  ica 


2
Pourquoi les mélanges de prieurs conjugués sont importants?
J'ai une question sur le mélange de prieurs conjugués. J'ai appris et dit le mélange de prieurs conjugués à quelques reprises lorsque j'apprends le bayésien. Je me demande pourquoi ce théorème est si important, comment allons-nous l'appliquer lorsque nous faisons une analyse bayésienne. Pour être plus précis, un théorème de …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.