Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans le wiki, la fonction softmax est définie comme le normalisateur de gradient-log de la distribution de probabilité catégorielle . Une explication partielle du normalisateur de journal se trouve ici , mais que signifie normalisateur de journal de gradient ?
Je travaille beaucoup avec les modèles de séries temporelles financières, principalement AR (I) MA et Kalman. Un problème auquel je continue de faire face est la fréquence d'échantillonnage. Au départ, je pensais que si on m'offrait la possibilité d'échantillonner plus fréquemment à partir d'un processus sous-jacent, je devrais échantillonner aussi …
J'utilise la adonis()fonction du veganpackage pour déterminer 1) si les espèces hôtes cooccurrentes varient dans leur communauté microbienne sur plusieurs sites, et 2) si les sites sont différents. J'ai examiné tous les messages sur CV et SO, et il n'y a pas de réponse claire sur la façon de déterminer …
Le coefficient de corrélation de Matthews ( ) est une mesure pour mesurer la qualité d'une classification binaire ([Wikipedia] [1]). formulation est donnée pour la classification binaire utilisant les valeurs de vrais positifs ( ), de faux positifs ( ), de faux négatifs ( ) et de vrais négatifs ( …
Mon collègue et moi essayons de comprendre la différence entre la régression logistique et un SVM. De toute évidence, ils optimisent différentes fonctions objectives. Un SVM est-il aussi simple que de dire qu'il s'agit d'un classificateur discriminant qui optimise simplement la perte de charnière? Ou est-ce plus complexe que ça? …
J'ai observé que la fonction lasso dans MATLAB est relativement lente. Je gère de nombreux problèmes de régression, avec généralement 1 à 100 prédicteurs et 200 à 500 observations. Dans certains cas, le lasso s'est avéré extrêmement lent (pour résoudre un problème de régression, il a fallu plusieurs minutes). J'ai …
Je lis cet article: traducteur skype où ils utilisent des CD-DNN-HMM (réseaux neuronaux profonds dépendants du contexte avec des modèles de Markov cachés). Je peux comprendre l'idée du projet et l'architecture qu'ils ont conçue mais je ne comprends pas ce que sont les senones . Je cherchais une définition mais …
Je suis un peu perplexe par une formule présentée dans "Introduction à l'apprentissage statistique" de Hastie. Au chapitre 6, page 212 (sixième impression, disponible ici ), il est indiqué que: AIC=RSSnσ^2+2dnAIC=RSSnσ^2+2dnAIC = \frac{RSS}{n\hat\sigma^2} + \frac{2d}{n} Pour les modèles linéaires avec bruit gaussien, étant le nombre de prédicteurs et étant l'estimation …
Je recherche une explication à la fois 1) mécanique et 2) intuitive de la façon dont les effets des variables individuelles sont déterminés en maintenant les autres variables constantes. Dans un exemple utilisant des données d'enquête, que signifie exactement: "en maintenant un âge, un sexe et un revenu constants, l'effet …
soit des variables aléatoires définies sur le même espace de probabilité et que la covariance de et soit finie, alors la loi de la formule de décomposition de la covariance totale / covariance indique: Quelle est l'interprétation de et ?X, Y, ZX,Y,ZX,Y,ZXXXOuiYYCov ( X, Y) =E [ Cov(X, Y| Z) …
En faisant des recherches sur l'algorithme xgboost, j'ai parcouru la documentation . Dans cette approche, les arbres sont régularisés en utilisant la définition de la complexité Ω ( f) = γT+12λ∑j = 1Tw2jΩ(f)=γT+12λ∑j=1Twj2 \Omega(f) = \gamma T + \frac12 \lambda \sum_{j=1}^T w_j^2 où γγ\gamma et λλ\lambda sont des paramètres, TTT …
Dans les modèles CBOW et skip-gram de word2vec, comment le choix des vecteurs de mots de (matrice de mots d'entrée) par rapport au choix des vecteurs de mots de (matrice de mots de sortie) affecte-t-il la qualité des vecteurs de mots résultants?WWWW′W′W' CBOW: Skip-gram:
On m'a posé une question concernant un modèle linéaire fait avec des R lm: "La régression a-t-elle utilisé des moindres carrés itératifs linéaires ou non linéaires?" J'ai cherché un peu et [pense que je] comprends la différence entre les deux, mais je n'ai trouvé aucune preuve de l'utilisation par R …
J'essaie de comprendre la définition exacte des paramètres de localisation / échelle / forme (par exemple, est appelé paramètre de forme et est paramètre d'échelle dans Pareto Type I). Mais les livres auxquels j'ai fait référence ( The Cambridge Dictionary of Statistics , HMC's Introduction to Mathematical Statistics , Feller's …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.