Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
TLDR: Les splines de régression en plaques minces ont-elles une interprétation probabiliste / bayésienne? Étant donné les paires entrée-sortie , ; Je veux estimer une fonction comme suit où est une fonction du noyau et est un vecteur caractéristique de taille . Les coefficients et peuvent être trouvés en résolvant …
Je ne suis pas sûr de ce que je comprends de la documentation officielle, qui dit: Renvoie: Une paire (sorties, état) où: outputs: Le tenseur de sortie RNN. Si time_major == False( par défaut), ce sera une forme Tensor: [batch_size, max_time, cell.output_size]. Si time_major == True, ce sera une forme …
Est-ce que ce qui suit est vrai? biais faible = variance élevée biais élevé = faible variance Je comprends les biais élevés et faibles, mais en quoi la variance est-elle différente? Ou sont les synonymes ci-dessus?
Le théorème d'approximation universel pour les réseaux de neurones s'applique-t-il à une fonction d'activation (sigmoïde, ReLU, Softmax, etc ...) ou est-il limité aux fonctions sigmoïdes? Mise à jour: Comme le souligne shimao dans les commentaires, cela ne vaut absolument pour aucune fonction. Alors, pour quelle classe de fonctions d'activation tient-il?
J'ai récemment découvert un article fascinant sur la prévision des rendements futurs du marché boursier. L'auteur présente le graphique ci-dessous et cite un R ^ 2 de 0,913. Cela rendrait la méthode de l'auteur bien supérieure à tout ce que j'ai jamais vu sur le sujet (la plupart soutiennent que …
Je jette un dé juste. Quelle est la distribution de probabilité du nombre de rouleaux jusqu'à ce que j'accumule d'abord: 1) Cinq uns 2) 20 occurrences de faces qui ne sont pas une? Je suis heureux de partager l'application réelle si cela peut vous aider.
J'ai suivi des tutoriels en ligne pour le krigeage spatial avec geoRet gstat(et aussi automap). Je peux effectuer le krigeage spatial et je comprends les principaux concepts qui le sous-tendent. Je sais comment construire un semi-variogramme, comment y adapter un modèle et comment effectuer un krigeage ordinaire. Ce que je …
Cela peut être une vague question, mais je me demande comment la transformation quantile de Scikit-Learn est mise en œuvre? Je me demande comment un ensemble de données asymétrique peut être transformé en une distribution normale comme celle-ci ? Scikit-learn fournit généralement un lien vers le wiki, mais pas cette …
Je suis tombé sur la formule pour obtenir les limites de confiance supérieures sur le problème des bandits armés de k: clnNjenje-----√clnNinic\sqrt{\frac{\text{ln} N_i}{n_i}} où njenin_i est la quantité d'échantillons que nous avons pour ce bandit particulier et NjeNiN_iest la quantité totale d'échantillons que nous avons de tous les bandits. Le …
J'ai récemment rencontré plusieurs sources "informelles" qui indiquent que dans certaines circonstances, si nous utilisons l' AIC ou le BIC pour former un modèle de série chronologique, nous n'avons pas besoin de diviser les données en test et en formation - nous pouvons utiliser tous les données pour la formation. …
Mon but ultime est de pouvoir générer un vecteur de taille NNNdes variables aléatoires de Bernoulli corrélées. Une façon de le faire est d'utiliser l'approche Coupla gaussienne. Cependant, l'approche Coupla gaussienne me laisse juste un vecteur: (p1, … ,pN) ∈ [ 0 , 1]N(p1,…,pN)∈[0,1]N (p_1, \ldots, p_N) \in [0,1]^N Supposons …
Supposons que vous ayez reçu des données d'un modèle de bloc aléatoire avec 4 répétitions et 23 traitements. Après une première inspection des données, vous constatez que pour 8 traitements toutes les répétitions sont identiques, ce qui est évidemment faux. Après avoir signalé le problème, vous êtes informé qu'il est …
Je suis nouveau au ML. J'ai été informé que la normalisation L2 de la régression des crêtes ne punit pas l'interceptionθ0θ0\theta_{0}. Comme dans la fonction de coût: ∇θJ( θ ) =12∑i = 1m(hθ⃗ (X( i )) -y( i ))2+ λ∑j = 1nθ2j∇θJ(θ)=12∑i=1m(hθ→(x(i))−y(i))2+λ∑j=1nθj2 \nabla_{\theta}J(\theta)=\frac{1}{2}\sum_{i=1}^{m}(h_{\vec \theta}(x^{(i)})-y^{(i)})^2+\lambda\sum_{j=1}^{n}{\theta_{j}^{2}} Le terme de normalisation L2 λ∑nj …
Je vois parfois des gens utiliser l'approximation de Taylor comme suit: E(ex)≈E(1+x)E(ex)≈E(1+x)E(e^x)\approx E(1+x) Je sais que l'approximation taylor fonctionne pour ex≈1+xex≈1+xe^x \approx 1+x Mais il n'est pas clair pour moi que nous pouvons faire l'approximation à l'intérieur de l'opérateur d'attente. Intuitivement, je suppose que cela fonctionne si "la probabilité que …
Je cherche à estimer un GLM hiérarchique mais avec une sélection de caractéristiques pour déterminer quelles covariables sont pertinentes au niveau de la population à inclure. Supposons que j'ai GGG groupes avec NNN observations et KKKcovariables possibles C'est-à-dire que j'ai une matrice de conception de covariables , résultats . Les …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.