Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Dans le cours d'apprentissage automatique d'Andrew Ng, il utilise cette formule: ∇Atr(ABATC)=CAB+CTABT∇Atr(ABATC)=CAB+CTABT\nabla_A tr(ABA^TC) = CAB + C^TAB^T et il fait une preuve rapide qui est montrée ci-dessous: ∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = \nabla_{\circ} tr(f(\circ)A^TC) + \nabla_{\circ}tr(f(A)\circ^T C)\\ =(A^TC)^Tf'(\circ) + (\nabla_{\circ^T}tr(f(A)\circ^T C)^T \\ = C^TAB^T + (\nabla_{\circ^T}tr(\circ^T)Cf(A))^T \\ …
Disons que nous avons une liste d'articles commandée [a, b, c, ... x, y, z, ...] Je recherche une famille de distributions avec support sur la liste ci-dessus régie par un paramètre alpha afin que: Pour alpha = 0, il affecte la probabilité 1 au premier élément, a ci-dessus et …
S'agit-il simplement de l'agrégation de points de données? Ou s'agit-il de la représentation de points de données pour différents éléments dans un format tabulaire arrangé avec les valeurs des différentes variables? En quoi est-ce différent des données brutes?
Je suis intéressé par les interactions traitement covariables dans le cadre d'expériences / essais contrôlés randomisés, avec un indicateur de traitement binaire assignation .TTT En fonction de la méthode / source spécifique, j'ai vu respectivement et T = { 1 , - 1 } pour les sujets traités et non …
J'essaie de calculer les prédictions d'effet aléatoire à partir d'un modèle mixte linéaire à la main, et en utilisant la notation fournie par Wood dans les modèles additifs généralisés: une introduction avec R (pg 294 / pg 307 du pdf), je suis confus sur ce que chaque paramètre représente. Voici …
[Une question similaire a été posée ici sans réponse] J'ai ajusté un modèle de régression logistique avec régularisation L1 (régression logistique Lasso) et je voudrais tester la signification des coefficients ajustés et obtenir leurs valeurs de p. Je sais que les tests de Wald (par exemple) sont une option pour …
Considérons le modèle de régression multiple suivant:Y=Xβ+Zδ+U.(1)(1)Y=Xβ+Zδ+U.Y=X\beta+Z\delta+U.\tag{1} Ici, est un vecteur de colonne ; une matrice ; a vecteur de colonne; a matrice; a vecteur de colonne; et , le terme d'erreur, un vecteur de colonne .OuiYYn × 1n×1n\times 1XXXn × ( k + 1 )n×(k+1)n\times (k+1)ββ\beta( k + 1 …
La variable aléatoire est définie comme une fonction mesurable d'une algèbre σ ( Ω 1 , F 1 ) avec la mesure sous-jacente P à une autre algèbre σ ( Ω 2 , F 2 ) .XXXσσ\sigma(Ω1,F1)(Ω1,F1)(\Omega_1, \mathcal F_1)PPPσσ\sigma(Ω2,F2)(Ω2,F2)(\Omega_2, \mathcal F_2) Comment parler d'un échantillon de cette variable aléatoire? La …
Je me demande comment aborder correctement la formation et le test d'un modèle LASSO à l'aide de glmnet dans R? Plus précisément, je me demande comment procéder si l'absence d'un ensemble de données de test externe nécessite que j'utilise la validation croisée (ou une autre approche similaire) pour tester mon …
J'utilise actuellement une approche bayésienne pour estimer les paramètres d'un modèle composé de plusieurs ODE. Comme j'ai 15 paramètres à estimer, mon espace d'échantillonnage est à 15 dimensions et ma distribution postérieure recherchée semble avoir de nombreux maxima locaux qui sont très isolés par de grandes régions de très faible …
On suppose que θ est un estimateur non biaisé pour θ . Alors bien sûr, E [ θ | θ ] = θ .θ^θ^\hat{\theta}θθ\thetaE [ θ^∣ θ ] = θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta Comment expliquer cela à un profane? Dans le passé, ce que je l' ai dit est …
Comme l'indique le titre, j'essaie de reproduire les résultats de glmnet linear en utilisant l'optimiseur LBFGS de la bibliothèque lbfgs. Cet optimiseur nous permet d'ajouter un terme de régularisateur L1 sans avoir à se soucier de la différentiabilité, tant que notre fonction objectif (sans le terme de régularisateur L1) est …
En termes de différence entre réseau neuronal et apprentissage en profondeur, nous pouvons énumérer plusieurs éléments, tels que davantage de couches sont incluses, un ensemble de données massif, un matériel informatique puissant pour rendre possible la formation d'un modèle compliqué. En plus de cela, y a-t-il une explication plus détaillée …
À l'exception des arbres de décision et de la régression logistique, quels autres modèles de classification fournissent une bonne interprétation? Je ne suis pas intéressé par la précision ou d'autres paramètres, seule l'interprétation des résultats est importante.
Existe-t-il une règle empirique entre la profondeur d'un réseau neuronal et le taux d'apprentissage? J'ai remarqué que plus le réseau est profond, plus le taux d'apprentissage doit être faible. Si c'est exact, pourquoi?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.