Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans la formation en mini-lots d'un réseau de neurones, j'ai entendu qu'une pratique importante est de mélanger les données d'entraînement avant chaque époque. Quelqu'un peut-il expliquer pourquoi le brassage à chaque époque aide? De la recherche google, j'ai trouvé les réponses suivantes: il aide la formation à converger rapidement il …
Qu'est-ce qu'une fonction de génération de moment (MGF)? Pouvez-vous l'expliquer en termes simples et avec un exemple simple et facile? Veuillez limiter autant que possible les notations mathématiques formelles.
Je lisais sur l' optimiseur Adam pour le Deep Learning et suis tombé sur la phrase suivante dans le nouveau livre Deep Learning de Begnio, Goodfellow et Courtville: Adam inclut des corrections de biais dans les estimations des moments du premier ordre (le terme de momentum) et des moments du …
La comparaison d'entités utilise-t-elle F-regressionla même chose que la corrélation individuelle d'entités avec l'étiquette et l'observation de la valeur ?R2R2R^2 J'ai souvent vu mes collègues utiliser une F regressionsélection de fonctionnalités dans leur pipeline d'apprentissage automatique à partir de sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Certains me disent s'il vous plaît - pourquoi cela …
Les endroits que j'ai lus sur la malédiction de la dimensionnalité l'expliquent conjointement avec kNN principalement et les modèles linéaires en général. Je vois régulièrement les meilleurs classeurs de Kaggle utiliser des milliers d'entités sur un ensemble de données qui ne contient pratiquement pas 100 000 points de données. Ils …
Dans l'apprentissage automatique de base, nous apprenons les «règles de base» suivantes: a) la taille de vos données doit être au moins 10 fois supérieure à la dimension VC de votre ensemble d'hypothèses. b) un réseau neuronal avec N connexions a une dimension VC d'environ N. Ainsi, lorsqu'un réseau neuronal …
Je cherchais des moyens de faire un test de rapport de vraisemblance en R pour comparer les ajustements du modèle. Je l'ai d'abord codé moi-même, puis j'ai trouvé la anova()fonction par défaut et également lrtest()dans le lmtestpackage. Cependant, lorsque j'ai vérifié, anova()produit toujours une valeur de p légèrement différente des …
Fermé. Cette question est hors sujet . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle soit sur le sujet pour la validation croisée. Fermé il y a 3 ans . Je construis une régression logistique en R en utilisant la méthode …
Si où , c'est-à-dire que tous les sont iid des variables aléatoires normales de zéro moyenne avec les mêmes variances, puisY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Je sais que la distribution du chi-carré est un cas particulier de la distribution gamma, mais n'a pas pu obtenir la distribution chi-carré pour la …
Je recherche une méthode pour transformer mon ensemble de données de sa moyenne actuelle et de son écart type en une moyenne cible et un écart type cible. Fondamentalement, je veux réduire / étendre la dispersion et mettre à l'échelle tous les nombres à une moyenne. Cela ne fonctionne pas …
Dans le cadre général de l'algorithme de descente de gradient, nous avons où x n est le point courant, η est la taille du pas et g r a d i e n t x n est le gradient évalué à x n . Xn + 1= xn- η∗ gr …
Je souhaite utiliser à la distribution pour modéliser les rendements des actifs à court intervalle dans un modèle bayésien. Je voudrais estimer à la fois les degrés de liberté (ainsi que d'autres paramètres de mon modèle) pour la distribution. Je sais que les rendements des actifs sont tout à fait …
Tensorflow propose un exemple de didacticiel sur la classification de CIFAR-10 . Dans le didacticiel, la perte d'entropie croisée moyenne sur le lot est minimisée. def loss(logits, labels): """Add L2Loss to all the trainable variables. Add summary for for "Loss" and "Loss/avg". Args: logits: Logits from inference(). labels: Labels from …
Dans l'analyse discriminante, la variable dépendante est catégorielle, mais puis-je utiliser une variable catégorielle (par exemple, le statut résidentiel: rural, urbain) avec une autre variable continue comme variable indépendante dans l'analyse discriminante linéaire?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.