Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Ma question porte sur le classificateur du plus proche voisin et concerne une déclaration faite dans l'excellent livre The Elements of Statistical Learning, par Hastie, Tibshirani et Friedman. La déclaration est (p. 465, section 13.3): "Parce qu'il utilise uniquement le point d'apprentissage le plus proche du point d'interrogation, le biais …
Dans l'apprentissage par renforcement, nous avons une fonction de récompense qui informe l'agent de la qualité de ses actions et états actuels. Dans un cadre général, la fonction de récompense est fonction de trois variables: État actuelSSS Action en cours à l'état actuelπ(s)=aπ(s)=a\pi(s) = a Prochain étatS′S′S' Cela ressemble donc …
Je suis confronté à un problème lié à la recherche du gradient de la fonction de perte d'entropie croisée par rapport au paramètre où:θθ\theta CE(θ)=−∑iyi∗log(y^i)CE(θ)=−∑iyi∗log(y^i)CE(\theta) = -\sum\nolimits_{i}{y_i*log({\hat{y}_{i}})} Où, et est une entrée vectorielle.y^i=softmax(θi)y^i=softmax(θi)\hat{y}_{i} = softmax(\theta_i)θiθi\theta_i De plus, est un vecteur chaud de la classe correcte et est la prédiction pour …
Nous savons que si , alors où est la fonction Digamma. Existe-t-il un formulaire simple pour ?p∼Beta(α,β)p∼Beta(α,β)p \sim Beta(\alpha, \beta)E[lnp]=ψ(α)−ψ(α+β)E[lnp]=ψ(α)−ψ(α+β) \mathbb{E}[\ln p] = \psi(\alpha) - \psi(\alpha + \beta) ψ(.)ψ(.)\psi(.)E[ln(1−p)]E[ln(1−p)] \mathbb{E}[\ln (1-p)]
J'étudie «Introduction à l'apprentissage statistique» par James, Witten, Hastie, Tibshirani. À la page 139 de leur livre, ils ont commencé par présenter le théorème de Bayes . n'est pas une constante mathématique, mais indique la probabilité antérieure. Rien n'est étrange dans cette équation.pk( X) = P( O= k | X= …
J'apprends la régression. J'ai fait quelques régressions transversales qui sont très bien. J'ai récemment fait une régression simple de séries chronologiques. J'ai donc des vecteurs ay & x contenant chacun 1000 observations. J'ai fait une régression ols simple dans Excel qui m'a semblé très bien. Cependant, mon tuteur en ligne …
\def\l{|\!|} Étant donné la régression nette élastique minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1\min_b \frac{1}{2}\l y - Xb \l^2 + \alpha\lambda \l b\l_2^2 + (1 - \alpha) \lambda \l b\l_1 comment choisir une plage appropriée de λλ\lambda pour la validation croisée? Dans le cas α=1α=1\alpha=1 (régression de crête), la formule dof=∑js2js2j+λdof=∑jsj2sj2+λ\textrm{dof} = \sum_j \frac{s_j^2}{s_j^2+\lambda} peut être …
Mon professeur a prouvé que la dérivée seconde de l'entropie croisée est toujours positive, de sorte que la fonction de coût des réseaux de neurones utilisant l'entropie croisée est convexe. Est-ce vrai? Je suis assez confus à ce sujet car j'ai toujours appris que la fonction de coût de ANN …
Supposons que dans une analyse de régression dans R, j'ai une variable indépendante de type de facteur avec 3 niveaux dans mon jeu de données de train. Mais dans l'ensemble de données de test, la même variable de facteur a 5 niveaux. Par conséquent, je ne peux pas prédire les …
Je fais un projet qui consiste à remplacer les valeurs manquantes dans un ensemble de données (pour la première fois). Cela implique d'utiliser deux méthodes replacement by meanet replacement by mediande remplir les valeurs manquantes. Il n'y a pas beaucoup de différence entre les résultats du minimum, de la médiane, …
Je sais que la variance de la différence de deux variables indépendantes est la somme des variances, et je peux le prouver. Je veux savoir où va la covariance dans l'autre cas.
Je veux simuler un échantillon d'une distribution normale de mélange telle que p × N(μ1,σ21) + ( 1 - p ) × N(μ2,σ22)p×N(μ1,σ12)+(1−p)×N(μ2,σ22)p\times\mathcal{N}(\mu_1,\sigma_1^2) + (1-p)\times\mathcal{N}(\mu_2,\sigma_2^2) est limité à l'intervalle au lieu de . Cela signifie que je veux simuler un mélange tronqué de distributions normales.[ 0 , 1 ][0,1][0,1]RR\mathbb{R} Je …
Je simule des essais de Bernoulli avec un aléatoire entre les groupes, puis j'adapte le modèle correspondant avec le paquet:logitθ ∼ N( logitθ0,12)logitθ∼N(logitθ0,12)\text{logit}\, \theta \sim {\cal N}(\text{logit}\, \theta_0, 1^2)lme4 library(lme4) library(data.table) I <- 30 # number of groups J <- 10 # number of Bernoulli trials within each group logit …
J'ai une variable dépendante qui peut aller de 0 à l'infini, les 0 étant en fait des observations correctes. Je comprends que la censure et les modèles Tobit ne s'appliquent que lorsque la valeur réelle de est partiellement inconnue ou manquante, auquel cas les données seraient tronquées. Quelques informations supplémentaires …
Mes données brutes consistent en une série chronologique de 60 jours avec une tendance à la baisse. Les données sont hebdomadaires, la fréquence est donc réglée sur 7. J'ai calculé la différence des données qui ressemble à ceci Lorsque je lance des tracés ACF et PACF sur la différence, il …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.