Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai lu à plusieurs endroits que R Squared n'est pas une mesure idéale lorsqu'un modèle est adapté avec LASSO. Cependant, je ne sais pas exactement pourquoi . De plus, pourriez-vous recommander la meilleure alternative?
Dans la détection compressée, il existe un théorème garantissant que a une solution clairsemée unique c (voir l'annexe pour plus de détails).argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc Existe-t-il un théorème similaire pour le lasso? S'il existe un tel théorème, non seulement …
L'utilisation de «variationnel» fait-elle toujours référence à l'optimisation via l'inférence variationnelle? Exemples: "Auto-encodeur variationnel" "Méthodes bayésiennes variationnelles" "Groupe de renormalisation variationnelle"
Je recherche de la documentation sur la régression de crête négative . En bref, il est une généralisation de la régression linéaire de la crête négative en utilisant λλ\lambda dans la formule β^=(X⊤X+λI)−1X⊤y.β^=(X⊤X+λI)−1X⊤y.\hat\beta = ( X^\top X + \lambda I)^{-1} X^\top y.Le cas positif a une belle théorie: en tant …
Si vous regardez une distribution bêta avecα=β=4α=β=4\alpha=\beta=4 elle ressemble beaucoup à une distribution gaussienne . Mais est-ce? Comment pouvez-vous prouver si une distribution bêta (4,4) est gaussienne ou non?
J'exécute des expériences sur l'ensemble de validation EMNIST en utilisant des réseaux avec RMSProp, Adam et SGD. J'atteins une précision de 87% avec SGD (taux d'apprentissage de 0,1) et décrochage (0,1 décrochage prob) ainsi que la régularisation L2 (pénalité 1e-05). En testant la même configuration exacte avec RMSProp et Adam …
Si nous voulions calculer l'effet causal de sur dans le graphique causal ci-dessous, nous pouvons utiliser à la fois les théorèmes d'ajustement de porte arrière et d'ajustement de porte d'entrée, c'est-à-dire XXXYYYP(y|do(X=x))=∑uP(y|x,u)P(u)P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) P(u) et P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y | \textit{do}(X = x)) = …
Jusqu'à présent, j'ai vu l'ANOVA utilisée de deux manières: Premièrement , dans mon texte d'introduction aux statistiques, l'ANOVA a été présentée comme un moyen de comparer les moyennes de trois groupes ou plus, comme une amélioration par rapport à la comparaison par paires, afin de déterminer si l'un des moyennes …
Tout d'abord: je sais, il n'y a pas de nombre général de taille d'échantillon requis pour former un réseau neuronal. Cela dépend de trop de facteurs comme la complexité de la tâche, le bruit dans les données, etc. Et plus j'aurai d'échantillons de formation, meilleur sera mon réseau. Mais je …
Je pensais à la signification de la famille à l'échelle de l'emplacement. Je crois comprendre que pour chaque XXX membre d'un emplacement famille à grande échelle avec des paramètres emplacement et échelle, la distribution de ne dépend pas de tous les paramètres et il est le même pour tous appartenant …
Je ne sais jamais quand utiliser l'encodage à chaud pour les variables catégorielles non ordonnées et quand ne pas le faire. Je l'utilise chaque fois que l'algorithme utilise une métrique de distance pour calculer la similitude. Quelqu'un peut-il donner une règle générale concernant les types d'algorithmes qui exigeraient que les …
À ma compréhension (très modeste) de l'inférence variationnelle, on essaie d'approximer une distribution inconnue ppp en trouvant une distribution qqq qui optimise ce qui suit: KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Chaque fois que j'investis du temps dans la compréhension de l'inférence variationnelle, je continue à appuyer sur cette …
Supposons que nous ayons un problème de classification et, dans un premier temps, nous voulons obtenir un aperçu des données et nous faisons t-SNE. Le résultat de t-SNE sépare très bien les classes. Cela implique qu'il est possible de construire un modèle de classification qui séparera également très bien les …
Contexte: J'étudie le chapitre 6 du Deep Learning par Ian Goodfellow et Yoshua Bengio et Aaron Courville. Dans la section 6.2.2.2 (pages 182 de 183 qui peuvent être consultées ici ), l'utilisation de sigmoïde pour produire est motivée.P(y=1|x)P(y=1|x)P(y=1|x) Pour résumer une partie du matériel, ils laissent un neurone de sortie …
Si nous traitons par exemple 10 exemples dans un lot, je comprends que nous pouvons additionner la perte pour chaque exemple, mais comment fonctionne la rétropropagation en ce qui concerne la mise à jour des poids pour chaque exemple? Par exemple: Exemple 1 -> perte = 2 Exemple 2 -> …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.