Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Prenons un échantillon de nombres réels. Disons que nous voulons estimer la tendance centrale de la population et avoir une idée de notre incertitude autour de cette estimation. Mettons de côté les hypothèses sur la répartition de la population et considérons les deux approches suivantes. Obtenez un échantillon d'amorçage de …
J'ai utilisé la fonction glm.fit dans R pour ajuster les paramètres à un modèle de régression logistique. Par défaut, glm.fit utilise des moindres carrés itérativement repondérés pour ajuster les paramètres. Quelles sont les raisons pour lesquelles cet algorithme ne parviendrait pas à converger, lorsqu'il est utilisé pour la régression logistique?
J'ai un grand ensemble de données sur les pays qui sont encombrées (comme vous pouvez le voir ci-dessous), mais j'ai besoin des étiquettes et des valeurs aberrantes - j'ai aussi beaucoup de graphiques, il serait donc fastidieux de réinitialiser la fenêtre et d'ajouter de faux points de données pour les …
Ces deux méthodes de calcul de la valeur p doivent être équivalentes: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) Le problème avec la deuxième méthode est qu'il y a le risque d'obtenir des valeurs supérieures à (en fait jusqu'à ):111222 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 On peut bien sûr y remédier en 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Ma question …
J'essaie de sauter de l'idée d'un centile, disons, sur la ligne du nombre réel (où le nième centile est simplement la position dans laquelle n% des points de données sont en dessous et 100 à n% au-dessus) ), à l'idée de l'aire sous une fonction de densité de probabilité. Si …
J'ai trouvé en ligne une ébauche d'un excellent article de synthèse de Zhe Chen intitulé "Filtrage bayésien: des filtres de Kalman aux filtres à particules et au-delà". Selon Google Scholar, la citation de la version publiée est "Statistics 182 (1), 1-69, 2003" mais le journal que je trouve avec ce …
Je lisais l'article sur la formule Schuette-Nesbitt , qui est décrite comme "une généralisation du principe d'inclusion-exclusion" , qui a à la fois une version combinatoire et probabiliste. Un autre site Web a fourni une preuve des événements dépendants (téléchargement en pdf) et en a trouvé un troisième qui le …
Christopher Bishop définit la valeur attendue de la fonction de vraisemblance du journal des données complètes (c'est-à-dire en supposant que l'on nous donne à la fois les données observables X et les données latentes Z) comme suit: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln …
J'ai remarqué que nous appelons parfois les termes d'erreur «innovations». Je ne comprends pas si c'est dans des situations particulières ou si ces termes peuvent être utilisés les uns pour les autres. Ensuite, une autre question est "pourquoi appelons-nous les termes d'erreur" innovations "? Merci
J'ai pensé à choisir des sujets de recherche pour la thèse de doctorat en biostatistique. Je souhaite connaître quelques sujets de recherche brûlants ces dernières années. Pour autant que je sache, certains sujets de recherche brûlants sont: Analyse de données à haute dimension; inférence causale dans les expériences et les …
En méta-analyse: comment convertir les ratios de risque dans certaines études en odds ratio? Il y a des études de cas témoins et de cohorte à inclure et certaines d'entre elles font état de ratios de risque. Les données brutes ne sont pas rapportées de manière à calculer le rapport …
J'ai développé un modèle de régression logistique basé sur les données rétrospectives d'une base de données nationale sur les traumatismes des traumatismes crâniens au Royaume-Uni. Le résultat clé est la mortalité à 30 jours (désignée comme Outcome30mesure). D'autres mesures dans l'ensemble de la base de données avec des preuves publiées …
Je lis cet article intéressant sur l'application de l'ICA aux données d'expression génique. Les auteurs écrivent: [T] il n'est pas nécessaire que les composants PCA soient statistiquement indépendants. C'est vrai, mais les PJ sont orthogonaux, n'est-ce pas? Je suis un peu flou quant à la relation entre l'indépendance statistique et …
J'ai une question sur le mélange de prieurs conjugués. J'ai appris et dit le mélange de prieurs conjugués à quelques reprises lorsque j'apprends le bayésien. Je me demande pourquoi ce théorème est si important, comment allons-nous l'appliquer lorsque nous faisons une analyse bayésienne. Pour être plus précis, un théorème de …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.