Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je lis Thinking, Fast and Slow de Daniel Kahneman et je suis tombé sur le texte suivant Il y a quelques années, j'ai eu une occasion inhabituelle d'examiner de près l'illusion de compétences financières. J'avais été invité à parler à un groupe de conseillers en placement dans une entreprise qui …
Quelles situations connaissons-nous où la descente de gradient peut converger (soit vers un point critique, soit vers un minimum local / global) pour des fonctions non convexes? Pour SGD sur les fonctions non convexes, un type de preuve a été examiné ici, http://www.cs.cornell.edu/courses/cs6787/2017fa/Lecture7.pdf
Laisser K=(K11K21K12K22)K=(K11K12K21K22)K=\begin{pmatrix} K_{11} & K_{12}\\ K_{21} & K_{22} \end{pmatrix} être une matrice réelle semi-définie positive symétrique (PSD) avec K12=KT21K12=K21TK_{12}=K_{21}^T. Puis pour|r|≤1|r|≤1|r| \le 1, K∗=(K11rK21rK12K22)K∗=(K11rK12rK21K22)K^*=\begin{pmatrix} K_{11} & rK_{12}\\ rK_{21} & K_{22} \end{pmatrix} est également une matrice PSD. MatricesKKK et K∗K∗K^* sont 2×22×22 \times 2 et KT21K21TK_{21}^Tdésigne la matrice de transposition. Comment …
Laisser X∼Binomial(n,p)X∼Binomial(n,p)X\sim\mathrm{Binomial}(n,p). Nous savons queE[X]=npE[X]=np\mathrm{E}[X]=np et V a r[X] = n p ( 1 - p )Var[X]=np(1-p)\mathrm{Var}[X]=np(1-p). Cela signifie-t-il que l' échantillon signifieX¯X¯\bar xet la variance de l' échantillons2s2s^2sont dépendants les uns des autres? Ou cela signifie-t-il simplement que la variance de la population peut être écrite en fonction de …
Je sais que la taille de l'échantillon affecte la puissance dans n'importe quelle méthode statistique. Il existe des règles pour déterminer le nombre d'échantillons dont une régression a besoin pour chaque prédicteur. J'entends aussi souvent que le nombre d'échantillons dans chaque catégorie dans la variable dépendante d'une régression logistique est …
J'ai un modèle de régression simple ( y = param1 * x1 + param2 * x2 ). Lorsque j'adapte le modèle à mes données, je trouve deux bonnes solutions: La solution A, params = (2,7), est la meilleure sur l' ensemble d'entraînement avec RMSE = 2,5 MAIS! Solution B params …
J'ai travaillé sur l'apprentissage de la politique optimale de communication pour les clients (quelles notifications envoyer, combien envoyer et quand envoyer). J'ai des données historiques des notifications passées envoyées (avec des horodatages) et leurs performances. J'essayais d'appliquer RL à ce problème afin d'apprendre la stratégie optimale. Cependant, une contrainte clé …
Je suis relativement nouveau dans l'analyse de survie. On m'a conseillé de rechercher et d'apprendre les résidus de Schoenfeld dans le cadre d'un diagnostic de modèle pour voir si l'hypothèse de risque proportionnel était satisfaite. En recherchant ceci, j'ai vu des références à de nombreux types de résidus, notamment: Cox-Snell …
Je suis relativement nouveau dans l'apprentissage automatique et les statistiques, mais je me demandais pourquoi l'optimisation bayésienne n'est pas référée plus souvent en ligne lors de l'apprentissage de l'apprentissage automatique pour optimiser les hyperparamètres de votre algorithme. Par exemple, en utilisant un cadre comme celui-ci: https://github.com/fmfn/BayesianOptimization L'optimisation bayésienne de vos …
Dans ce https://cs231n.github.io/neural-networks-case-study/ pourquoi mentionne-t-il "le classificateur Softmax interprète chaque élément de ff comme détenant les probabilités de log (non normalisées) des trois classes." Je comprends pourquoi il n'est pas normalisé mais pas pourquoi il s'agit d'un journal? Que signifie une probabilité logarithmique? Pourquoi ne pas simplement dire des probabilités …
Il est bien connu qu’étant donné une variable aléatoire de valeur réelle XXX avec pdf FFf, la moyenne de XXX (s'il existe) est trouvé par E [X] =∫RXF( x )d x.E[X]=∫RXF(X)réX.\begin{equation} \mathbb{E}[X]=\int_{\mathbb{R}}x\,f(x)\,\mathrm{d}x\,. \end{equation} Question générale: maintenant, si l'on ne peut pas résoudre l'intégrale ci-dessus sous forme fermée, mais veut simplement …
Salut, j'étudie les techniques de régression. Mes données ont 15 fonctionnalités et 60 millions d'exemples (tâche de régression). Lorsque j'ai essayé de nombreuses techniques de régression connues (arbre boosté par gradient, régression d'arbre de décision, AdaBoostRegressor, etc.), la régression linéaire s'est très bien déroulée. Meilleur score parmi ces algorithmes. Quelle …
Tout en apprenant à calculer les matrices de covariance et de corrélation et leurs inverses en VB et T-SQL il y a quelques années, j'ai appris que les différentes entrées ont des propriétés intéressantes qui peuvent les rendre utiles dans les bons scénarios d'exploration de données. Un exemple évident est …
J'utilise le modèle pré-formé de TensorFlow de réseau neuronal convolutionnel. https://github.com/tensorflow/models/blob/master/slim/nets/resnet_v2.py#L130 J'ai trouvé la phrase suivante: Cependant, pour les tâches de prédiction denses, nous conseillons d'utiliser des entrées dont les dimensions spatiales sont des multiples de 32 plus 1, par exemple [321, 321]. Quelqu'un sait-il ce qu'est la prédiction dense …
Je comprends l'intuition derrière le MCP mais j'ai du mal à identifier exactement la cause, qu'est-ce qui devrait être évité, ou du moins expliqué. Dans sa définition la plus directe, je conviens que si je prends des données et que j'applique une approche de force brute en essayant toutes les …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.