Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je lis un impressionnant article introductif de HMC par le professeur Michael Betancourt, mais je suis coincé dans la compréhension de la façon dont nous procédons au choix de la distribution de l'élan. Sommaire L'idée de base de la console HMC est d'introduire une variable de momentum ppp en conjonction …
Dans l'apprentissage par renforcement, une politique est-elle toujours déterministe ou est-ce une distribution de probabilité sur les actions (à partir desquelles nous échantillonnons)? Si la politique est déterministe, pourquoi pas la fonction valeur, qui est définie à un état donné pour une politique donnée comme suitππ\pi Vπ(s)=E[∑t>0γtrt|s0=s,π]Vπ(s)=E[∑t>0γtrt|s0=s,π]V^{\pi}(s) = E\left[\sum_{t>0} \gamma^{t}r_t|s_0 …
Ce problème est apparu dans mes recherches: supposons que Vje∼ EDVi∼EDV_i \sim \text{ED} sont les distributions exponentielles iid (ED) avec la moyenne 111 et laisse λλ\lambdaêtre un nombre non négatif. Est-il vrai que ∑k = 0∞λke- λV0⋯Vkk !∼ ED ?∑k=0∞λke−λV0⋯Vkk!∼ED? \sum_{k=0}^{\infty} \frac{\lambda^k e^{-\lambda}V_{0} \cdots V_k}{k!} \sim \text{ED}? Cela passe le …
L'apprentissage en profondeur est un sujet de plus en plus d'actualité de nos jours. Quelles sont les principales hypothèses qui font que l'apprentissage en profondeur manque dans certains ensembles de données. Ex: fonctionne-t-il bien sur des ensembles de données bruyants?
Il est assez intuitif que la plupart des topologies / architectures de réseaux de neurones ne soient pas identifiables. Mais quels sont les résultats bien connus sur le terrain? Existe-t-il des conditions simples qui permettent / empêchent l’identifiabilité? Par exemple, tous les réseaux avec des fonctions d'activation non linéaires et …
J'ai un ensemble de données avec 338 prédicteurs et 570 instances (impossible de télécharger malheureusement) sur lequel j'utilise le Lasso pour effectuer la sélection des fonctionnalités. En particulier, j'utilise la cv.glmnetfonction glmnetcomme suit, où se mydata_matrixtrouve une matrice binaire 570 x 339 et la sortie est également binaire: library(glmnet) x_dat …
Supposons que régression linéaire multivariée suivante Comment puis-je tester cette ?y=β0+β1x1+β2x2+β3x3+β4x4+ϵy=β0+β1x1+β2x2+β3x3+β4x4+ϵ y = \beta_0 +\beta_1 x_1 +\beta_2 x_2+\beta_3x_3+\beta_4x_4 + \epsilonβ1=β2=β3β1=β2=β3\beta_1=\beta_2=\beta_3 Je sais que pour tester si vous pouvez simplement construire un test avec β1=β2β1=β2\beta_1=\beta_2ZZZZ=β1−β2se2β1+se2β2−−−−−−−−−√Z=β1−β2seβ12+seβ22 Z = \frac{\beta_1-\beta_2}{\sqrt{se_{\beta_1}^2+se_{\beta_2}^2}} Existe-t-il un analogue pour les estimations de coefficients multiples?
Au niveau du modèle, pour évaluer la contribution / l'importance des prédicteurs, nous pouvons utiliser: Techniques spécifiques au modèle - par exemple pureté (indice de Gini) pour un modèle basé sur un arbre, coefficients du modèle le cas échéant, etc. Techniques indépendantes du modèle - par exemple, importance des caractéristiques …
J'essaie de comprendre quelle est la différence entre le recuit simulé et l'exécution de plusieurs algorithmes gourmands d'escalade. D'après ma compréhension, l'algorithme gourmand poussera le score à un maximum local, mais si nous commençons avec plusieurs configurations aléatoires et appliquons gourmand à toutes, nous aurons plusieurs maximums locaux. Ensuite, nous …
L'étude que j'examine rapporte une hauteur moyenne pour 20 sujets de 1,70 mètre avec un écart type de 0,0. Est-ce à dire que les 20 font exactement 1,70 mètre? Ou s'agit-il d'une erreur de signalement?
Fermé . Cette question doit être plus ciblée . Il n'accepte pas actuellement de réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle se concentre sur un problème uniquement en modifiant ce message . Fermé il y a 2 ans . Je suis un Bayésien simple d'esprit …
Cette question semble suffisamment fondamentale pour que je sois convaincue qu'il y ait une réponse ici quelque part, mais je ne l'ai pas trouvée. Je comprends que si la variable dépendante d'une régression est normalement distribuée, la probabilité maximale et les moindres carrés ordinaires produisent les mêmes estimations de paramètres. …
Il y a donc écart-type, variance et covariance, mais y a-t-il un écart-type co? Sinon pourquoi pas? Y a-t-il une raison mathématique fondamentale ou s'agit-il simplement d'une convention? Si oui, pourquoi n'est-il pas utilisé davantage, ou du moins vraiment difficile à trouver en utilisant les recherches Google? Je ne veux …
L'un de nos experts Monte-Carlo peut-il expliquer l'attente "inattendue" à la fin de cette réponse ? Résumé ex post facto de l'autre question / réponse: si sont des variables aléatoires IID et que les attentes existent, alors un simple argument de symétrie montre que , mais une expérience de Monte …
Si les réseaux de neurones profonds sont considérés comme des approximateurs de fonctions universelles, l'expansion de la base est-elle vraiment nécessaire? Ou serait-ce spécifique au cas? Par exemple, si l'on a trois variables X quantitatives, y aurait-il un avantage à augmenter le nombre de variables en introduisant des interactions, des …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.