Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je n'ai pas vraiment vu de livres de probabilité calculer l'espérance conditionnelle, à l'exception des algèbres générées par une variable aléatoire discrète. Ils déclarent simplement l'existence de l'attente conditionnelle, ainsi que ses propriétés, et en restent là. Je trouve cela un peu dérangeant et j'essaie de trouver une méthode pour …
Permettez-moi d'abord de donner quelques informations; Je résumerai mes questions à la fin. La distribution bêta, paramétrée par sa moyenne et , a , où est la fonction de variance.μμ\muϕϕ\phiVar(Y)=V(μ)/(ϕ+1)Var(Y)=V(μ)/(ϕ+1)\operatorname{Var}(Y) = \operatorname{V}(\mu)/(\phi+1)V(μ)=μ(1−μ)V(μ)=μ(1−μ)\operatorname{V}(\mu) = \mu(1-\mu) Dans une régression bêta (par exemple, en utilisant le package betareg dans R), la régression suppose …
Dans SGD, une époque serait la présentation complète des données d'entraînement, puis il y aurait N mises à jour de poids par époque (s'il y a N exemples de données dans l'ensemble d'entraînement). Si nous faisons maintenant des mini-lots à la place, disons par lots de 20. Une époque se …
Il semble que je puisse très bien apprendre les paramètres et trouver les probabilités postérieures pour les données d'entraînement, mais je n'ai aucune idée de comment faire de nouvelles prédictions sur de nouvelles données. Le problème vient en particulier des probabilités de transition changeant sur les covariables, il n'est donc …
Un de mes critiques demande pourquoi j'ai utilisé des données non pondérées, au lieu de données pondérées. J'ai discuté de la question avec un statisticien et sa réponse allait dans le sens de Si vous avez des observations indépendantes et que vous prenez la moyenne globale, sa variance est toujours …
Mon réseau neuronal récurrent (LSTM, resp. GRU) se comporte d'une manière que je ne peux pas expliquer. L'entraînement commence et il s'entraîne bien (les résultats semblent assez bons) lorsque la précision diminue soudainement (et que la perte augmente rapidement) - à la fois les mesures d'entraînement et de test. Parfois, …
J'essaie d'implémenter HMC avec une matrice de masse non diagonale, mais je me fais trébucher par une partie de la terminologie. Selon BDA3 et la revue de Neal, le terme d'énergie cinétique (qui, je suppose, est toujours utilisé pour des raisons de commodité) est K( p ) =pTM- 1p2.K(p)=pTM−1p2. K(p) …
Je me demandais si quelqu'un ici pouvait expliquer la différence entre le mode de normalisation l1, l2 et max dans le module sklearn.preprocessing.normalize ()? Après avoir lu la documentation, je n'ai pas réalisé la différence!
Si les couples sont assis au hasard à une table ronde, quelle est la chance que personne ne soit assis en face de leur partenaire? S'il y a quatre personnes, la réponse est 2/3. S'il y en a six c'est 8/15, je pense. Après cela, ma méthode étape par étape, …
Fermé. Cette question est hors sujet . Il n'accepte pas actuellement de réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle soit sur le sujet pour la validation croisée. Fermé l'année dernière . J'essaie d'adapter le modèle linéaire généralisé pour la famille weibull, mais quand je l'essaie …
Je cite (soulignement le mien) de la définition de wikipedia : La proposition de la théorie des probabilités connue sous le nom de loi de l'espérance totale, ..., stipule que si X est une variable aléatoire intégrable (c'est-à-dire une variable aléatoire satisfaisant E (| X |) <∞) et Y est …
Je voulais former un réseau avec des non-linéarités qui souffrent de la disparition (ou du problème de gradient explosif mais principalement de la disparition). Je sais que la méthode standard (actuelle) consiste à utiliser la normalisation par lots 1 [BN] 1 ou simplement à abandonner la non-linéarité et à utiliser …
En général, dois-je recycler mon réseau de neurones avec moins de neurones afin qu'il ait moins de neurones ReLU morts? J'ai lu des opinions contradictoires sur les ReLU morts. Certaines sources affirment que les ReLU morts sont bons car ils encouragent la rareté. D'autres disent qu'ils sont mauvais parce que …
Considérons un tableau de fréquences 2x2 typique (montré dans cette image): Notation: La variable de ligne est notée R et prend les valeurs 0 ou 1; la variable de colonne est notée C et prend les valeurs 0 ou 1. Les cellules du tableau indiquent la fréquence de chaque combinaison …
J'exécute quelques régressions et, comme je voulais être du bon côté, j'ai décidé d'utiliser des erreurs standard HAC (hétéroscédasticité et autocorrélation cohérentes) tout au long. Il peut y avoir quelques cas où la corrélation série n'est pas présente. Est-ce de toute façon une approche valable? Y a-t-il des inconvénients?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.