Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans le livre de Goodfellow (2016) sur l'apprentissage profond, il a parlé de l'équivalence de l'arrêt précoce de la régularisation L2 ( https://www.deeplearningbook.org/contents/regularization.html page 247). L'approximation quadratique de la fonction de coût jjj est donnée par: J^( θ ) = J( w∗) + 12( w - w∗)TH( w - w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) …
J'essaie de comprendre le facteur Bayes (BF). Je crois qu'ils sont comme le rapport de vraisemblance de 2 hypothèses. Donc, si BF est 5, cela signifie que H1 est 5 fois plus probable que H0. Et une valeur de 3 à 10 indique des preuves modérées, tandis que> 10 indique …
La distribution normale ne semble pas intuitive jusqu'à ce que vous appreniez le CLT, ce qui explique pourquoi il est si répandu dans la vie réelle. Mais apparaît-elle jamais comme la distribution "naturelle" d'une certaine quantité?
J'ai une fonction de vraisemblance pour la probabilité de mes données étant donné certains paramètres du modèle , que je voudrais estimer. En supposant des a priori plats sur les paramètres, la probabilité est proportionnelle à la probabilité postérieure. J'utilise une méthode MCMC pour échantillonner cette probabilité.L (d| θ)L(ré|θ)\mathcal{L}(d | …
Lorsque l' on calcule l'erreur - type d'un coefficient de régression, nous ne tenons pas compte du caractère aléatoire dans la matrice de conception XXX . Dans OLS par exemple, on calcule var(β^)var(β^)\text{var}(\hat{\beta}) en tant que var((XTX)−1XTY)=σ2(XTX)−1var((XTX)−1XTY)=σ2(XTX)−1\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} Si le XXX était considéré comme aléatoire, la loi de la …
Contexte : J'ai un doctorat en psychologie sociale, où les statistiques théoriques et les mathématiques étaient à peine couvertes dans mes cours quantitatifs. Au cours des études de premier cycle et des cycles supérieurs, on m'a enseigné (un peu comme beaucoup d'entre vous aussi dans les sciences sociales, probablement) à …
Contexte En informatique, en mathématiques et parfois dans d'autres domaines, les exemples «ésotériques» peuvent non seulement être divertissants, mais utiles pour illustrer certains concepts, par exemple: Bogosort et Slowsort sont des algorithmes de tri très inefficaces qui peuvent être utilisés pour comprendre les propriétés des algorithmes, en particulier par rapport …
Si p∼p∼p \sim Uniforme (0,1)(0,1)(0,1) et X∼X∼X \sim Bin (n,p)(n,p)(n, p) , alors la moyenne postérieure de ppp est donnée par X+1n+2X+1n+2\frac{X+1}{n+2} . Y a-t-il un nom commun pour cet estimateur? J'ai trouvé que cela résout de nombreux problèmes et j'aimerais pouvoir pointer les gens vers une référence, mais je …
Selon les références Livre 1 , Livre 2 et papier . Il a été mentionné qu'il existe une équivalence entre la régression régularisée (Ridge, LASSO et Elastic Net) et leurs formules de contraintes. J'ai également examiné Cross Validated 1 et Cross Validated 2 , mais je ne vois pas de …
Récemment, j'ai pris conscience des méthodes «sans vraisemblance» utilisées dans la littérature. Cependant, je ne sais pas exactement ce que signifie qu'une méthode d'inférence ou d'optimisation est sans vraisemblance . Dans l'apprentissage automatique, l'objectif est généralement de maximiser la probabilité que certains paramètres correspondent à une fonction, par exemple les …
D'après ce que je comprends, c'est (du moins, c'est ainsi que Wikipedia le définit ). Mais j'ai trouvé cette déclaration d'Efron * (je souligne): La chaîne de Markov Monte Carlo (MCMC) est la grande réussite des statistiques bayésiennes modernes. MCMC, et sa méthode sœur «échantillonnage de Gibbs», permettent le calcul …
Dans les statistiques fréquentistes, un intervalle de confiance à 95% est une procédure produisant un intervalle qui, si elle était répétée un nombre infini de fois, contiendrait le vrai paramètre 95% du temps. Pourquoi est-ce utile? Les intervalles de confiance sont souvent mal compris. Ce n'est pas un intervalle dans …
(Cette question est inspirée de ce commentaire de Xi'an .) Il est bien connu que si la distribution précédente est correcte et que la probabilité est bien définie, alors la distribution postérieure est presque sûrement propre.π(θ)π(θ)\pi(\theta)L(θ|x)L(θ|x)L(\theta | x)π(θ|x)∝π(θ)L(θ|x)π(θ|x)∝π(θ)L(θ|x)\pi(\theta|x)\propto \pi(\theta) L(\theta|x) Dans certains cas, nous utilisons plutôt une probabilité tempérée ou …
Je les parle souvent d'emprunt ou de partage d'informations dans les modèles hiérarchiques bayésiens. Je n'arrive pas à obtenir une réponse claire sur ce que cela signifie réellement et s'il est unique aux modèles hiérarchiques bayésiens. J'ai en quelque sorte compris l'idée: certains niveaux de votre hiérarchie partagent un paramètre …
J'aimerais que mon modèle formé soit testé sur un ensemble de données déséquilibré. Existe-t-il des algorithmes disponibles pour générer des données synthétiques à partir d'un ensemble de données étiqueté équilibré (spam / non-spam)?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.