Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je fais de la lecture et voici la définition que j'ai tirée du livre de DeGroot: Est-ce à dire que les paramètres sont les mêmes? Par exemple, supposons que X est distribué lognormalement et Y est normalement distribué où Y = log (X). Est-ce à dire que X et Y …
Ce message dit Un fichier PDF est utilisé pour spécifier la probabilité que la variable aléatoire tombe dans une plage particulière de valeurs, par opposition à la prise de n'importe quelle valeur. Est-ce vrai? c'est le PDF de la distribution normale standard. φ(x)=12π−−√e−x2/2φ(x)=12πe−x2/2\varphi(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} branchez x = 0 …
Je travaille sur un modèle de régression logistique. J'ai vérifié le résumé du modèle qui est construit sur 5 variables indépendantes dont l'une n'est pas significative avec une valeur P de 0,74. Je souhaite savoir si nous supprimons directement la variable ou existe-t-il un autre moyen de vérifier sa signification …
Dans les commentaires ci - dessous un de mes messages, Glen_b et moi discutions comment les distributions discrètes ont nécessairement une moyenne et une variance dépendantes. Pour une distribution normale, cela a du sens. Si je te raconteX¯X¯\bar{x}, vous ne savez pas quoi s2s2s^2 est, et si je vous dis …
Description générale Un estimateur efficace (dont la variance d'échantillon est égale à la borne de Cramér – Rao) maximise-t-il la probabilité d'être proche du vrai paramètre ?θθ\theta Disons que nous comparons la différence ou la différence absolue entre l'estimation et le vrai paramètreΔ^=θ^−θΔ^=θ^−θ\hat\Delta = \hat \theta - \theta La distribution …
Soit un espace de probabilité, et soit un vecteur aléatoire. Soit la distribution de , une mesure de Borel sur .( Ω , F, P)(Ω,F,P)(\Omega, \mathcal{F}, P)X: Ω →RnX:Ω→RnX : \Omega \to \mathbb{R}^nPX=X∗PPX=X∗PP_X = X_* PXXXRnRn\mathbb{R}^n La fonction caractéristique de est la fonction définie pour (la variable aléatoire est donc …
Ma question concerne la classification binaire, disons séparer les bons clients des mauvais clients, mais pas la régression ou la classification non binaire. Dans ce contexte, une forêt aléatoire est un ensemble d'arbres de classification. Pour chaque observation, chaque arbre vote «oui» ou «non», et le vote moyen de tous …
L'analyse des données bayésiennes (p. 64) dit, concernant un modèle normal : une densité a priori vague sensible pour μμ\mu et σσ\sigma, en supposant une indépendance préalable des paramètres de localisation et d'échelle, est uniforme sur ( μ , logσ)(μ,Journalσ)(\mu, \log \sigma), ou équivalent, p ( μ ,σ2) ∝ (σ2)- …
Un autoencodeur variationnel (VAE) fournit un moyen d'apprendre la distribution de probabilité reliant une entrée à sa représentation latente . En particulier, le codeur e mappe une entrée x à une distribution sur z . Un encodeur typique affichera des paramètres (\ mu, \ sigma) = e (x) , représentant …
Je lis le Machine Learning pratique avec Scikit-Learn et TensorFlow: Concepts, outils et techniques pour construire des systèmes intelligents . Ensuite, je ne suis pas en mesure de comprendre la différence entre le vote dur et le vote doux dans le contexte des méthodes basées sur l'ensemble. J'en cite des …
Je lis l'apprentissage en profondeur par Ian Goodfellow et al. Il introduit un biais car Bias(θ)=E(θ^)−θBias(θ)=E(θ^)−θBias(\theta)=E(\hat\theta)-\theta où et sont respectivement le paramètre estimé et le paramètre réel sous-jacent.θ^θ^\hat\thetaθθ\theta La cohérence, d'autre part, est définie par ce qui signifie que pour tout , aslimm→∞θ^m=θlimm→∞θ^m=θ\mathrm{lim}_{m\to\infty}\hat\theta_m=\thetaϵ>0ϵ>0\epsilon > 0P(|θ^m−θ|>ϵ)→0P(|θ^m−θ|>ϵ)→0P(|\hat\theta_m-\theta|>\epsilon)\to0m→∞m→∞m\to\infty Ensuite, il dit que la …
Question : J'ai adapté un modèle probabiliste (réseau bayésien) pour modéliser une variable de résultat binaire. Je voudrais créer un tracé d'étalonnage haute résolution (par exemple spline) corrigé pour le sur-ajustement avec bootstrapping. Existe-t-il une procédure standard pour calculer une telle courbe? Considérations : je pourrais le faire facilement avec …
Il existe un certain nombre de sites Web décrivant la descente de gradient pour trouver les paramètres d'une régression linéaire simple (en voici un). Google le décrit également dans son nouveau cours de ML (au public). Cependant, sur Wikipedia , les formules suivantes pour calculer les paramètres sont fournies: α^β^=y¯-β^X¯,=∑ni …
Je travaille actuellement sur une tâche de prévision de la demande, avec des données sur des dizaines de milliers de produits dans quelques milliers de magasins. Plus précisément, j'ai quelques années de données de ventes quotidiennes par produit dans chaque magasin, et mon objectif est de prévoir les ventes futures …
Le titre dit tout - combien de paramètres entraînables y a-t-il dans une couche GRU? Ce type de question revient souvent lorsque l'on tente de comparer des modèles de différents types de couches RNN, tels que les unités de mémoire à court terme (LSTM) vs GRU, en termes de performances …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.