Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai déjà une idée des avantages et des inconvénients de la régression des crêtes et du LASSO. Pour le LASSO, le terme de pénalité L1 donnera un vecteur de coefficient clairsemé, qui peut être considéré comme une méthode de sélection de caractéristiques. Cependant, il existe certaines limitations pour le LASSO. …
Je recherche des ressources (livres, notes de cours, etc.) sur les techniques pouvant gérer des données à cibles multiples (Ex: trois variables dépendantes: 2 discrètes et 1 continue). Quelqu'un at-il des ressources / connaissances à ce sujet? Je sais qu'il est possible d'utiliser des réseaux de neurones pour cela.
J'essaie de visualiser un graphique approprié pour les observations dans ce tableau des moyennes et des écarts-types des scores de rappel: RecallControlMean37SD8ExperimentalMean21SD6ControlExperimentalMeanSDMeanSDRecall378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ …
Si 20 essais Bernoulli indépendants sont effectués chacun avec une probabilité de réussite et donc d'échec différente. Quelle est la probabilité que exactement n des 20 essais aient réussi? Existe-t-il une meilleure façon de calculer ces probabilités plutôt que de simplement résumer les combinaisons de probabilités de réussite et d'échec?
Contrairement à l'analyse des composants principaux, les solutions aux modèles d'analyse factorielle ne sont pas nécessairement imbriquées. Autrement dit, les charges (par exemple) pour le premier facteur ne seront pas nécessairement identiques lorsque seul le premier facteur est extrait par rapport aux deux premiers facteurs. Dans cet esprit, considérons un …
Je lis le livre de Larry Wasserman, All of Statistics , et actuellement sur les valeurs de p (page 187). Permettez-moi d'abord de présenter quelques définitions (je cite): Définition 1 La fonction de puissance d'un test avec une région de rejet est définie par La taille d'un test est définie …
Le contexte C'est un peu similaire à cette question , mais je ne pense pas que ce soit un doublon exact. Lorsque vous recherchez des instructions sur la façon d'effectuer un test d'hypothèse de bootstrap, il est généralement indiqué qu'il est correct d'utiliser la distribution empirique pour les intervalles de …
Je suis en train d' étudier LASSO (moins un retrait absolu et opérateur sélection) à l'intervalle. Je vois que la valeur optimale pour le paramètre de régularisation peut être choisie par validation croisée. Je vois aussi dans la régression de crête et de nombreuses méthodes qui appliquent la régularisation, nous …
J'ai une situation où je peux estimer (les premiers) moments d'un ensemble de données, et je voudrais l'utiliser pour produire une estimation de la fonction de densité.kkk J'ai déjà rencontré la distribution Pearson , mais j'ai réalisé qu'elle ne dépend que des 4 premiers moments (avec quelques restrictions sur les …
J'essaie d'incorporer environ 60 millions de phrases dans un espace vectoriel , puis de calculer la similitude en cosinus entre elles. J'ai utilisé sklearn CountVectorizeravec une fonction de tokenizer construite sur mesure qui produit des unigrammes et des bigrammes. Il s'avère que pour obtenir des représentations significatives, je dois autoriser …
J'apprends la sélection des fonctionnalités. Je vois pourquoi ce serait important et utile pour la construction de modèles. Mais concentrons-nous sur les tâches d'apprentissage supervisé (classification). Pourquoi la sélection des fonctionnalités est-elle importante pour les tâches de classification? Je vois beaucoup de littérature écrite sur la sélection des fonctionnalités et …
Je veux détecter si la colinéarité est un problème dans ma régression OLS. Je comprends que les facteurs d'inflation de la variance et l'indice de condition sont deux mesures couramment utilisées, mais j'ai du mal à trouver quoi que ce soit de précis sur le bien-fondé de chaque approche, ou …
Je lis un article dont la méthode est entièrement basée sur le test du rapport de vraisemblance. L'auteur dit que le test LR contre des alternatives unilatérales est UMP. Il procède en affirmant que "... même quand il [le test LR] ne peut pas être démontré comme étant le plus …
Supposons que je veuille apprendre un classificateur qui prend un vecteur de nombres en entrée et donne une étiquette de classe en sortie. Mes données d'entraînement se composent d'un grand nombre de paires d'entrée-sortie. Cependant, lorsque je viens de tester certaines nouvelles données, ces données ne sont généralement que partiellement …
Je dois calculer l'estimation de densité de noyau 2d (kde) à partir d'une liste de coordonnées de latitude et de longitude. Mais un degré de latitude n'est pas la même distance qu'un degré de longitude, cela signifie que les grains individuels seraient ovales, spécialement plus le point est éloigné de …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.