Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
C'est une question assez générale: J'ai généralement constaté que l'utilisation de plusieurs modèles différents surpasse un modèle lorsque vous essayez de prédire une série temporelle hors échantillon. Existe-t-il de bons documents démontrant que la combinaison de modèles surclassera un seul modèle? Existe-t-il des meilleures pratiques concernant la combinaison de plusieurs …
J'ai discuté avec plusieurs membres du laboratoire de celui-ci, et nous sommes allés à plusieurs sources mais n'avons toujours pas tout à fait la réponse: Quand on dit qu'un GLM a une famille de poisson , disons-nous parler de la distribution des résidus ou de la variable de réponse? Points …
J'ai récemment appris les règles de notation appropriées pour les classificateurs probabilistes. Plusieurs discussions sur ce site Web ont mis un point d'honneur à souligner que la précision est une règle de notation incorrecte et ne doit pas être utilisée pour évaluer la qualité des prévisions générées par un modèle …
Ma question: Pourquoi la forêt aléatoire considère-t-elle des sous-ensembles aléatoires de fonctionnalités pour la division au niveau du nœud dans chaque arbre plutôt qu'au niveau de l'arbre ? Contexte: Il s'agit d'une question d'histoire. Tin Kam Ho a publié ce document sur la construction de « forêts de décision » …
Je veux construire un modèle de régression qui est une moyenne de plusieurs modèles OLS, chacun basé sur un sous-ensemble des données complètes. L'idée derrière cela est basée sur cet article . Je crée k plis et je crée k modèles OLS, chacun sur des données sans l'un des plis. …
Le théorème de Halmos-Savage dit que pour un modèle statistique dominé ( Ω , A, P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P) une statistique T: ( Ω , A, P) → ( Ω′, A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A') est suffisante si (et seulement si) pour tout { P∈ P}{P∈P}\{P …
Disons que je calcule des hauteurs (en cm) et que les nombres doivent être supérieurs à zéro. Voici l'exemple de liste: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 Dans cet exemple, selon la distribution normale, 99,7% des valeurs doivent être comprises entre ± …
En essayant ici des modèles de mélanges gaussiens , j'ai trouvé ces 4 types de covariances. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single …
J'ai une connaissance de base du fonctionnement des RNN (et en particulier des unités LSTM). J'ai une idée picturale de l'architecture d'une unité LSTM, c'est-à-dire une cellule et quelques portes, qui régulent le flux de valeurs. Cependant, apparemment, je n'ai pas complètement compris comment LSTM résout le problème des "gradients …
Dans R, il existe trois méthodes pour formater les données d'entrée pour une régression logistique à l'aide de la glmfonction: Les données peuvent être dans un format "binaire" pour chaque observation (par exemple, y = 0 ou 1 pour chaque observation); Les données peuvent être au format «Wilkinson-Rogers» (p. Ex. …
Disons que notre ensemble de données contient 1 million d'exemples, c'est-à-dire , et nous souhaitons utiliser la descente de gradient pour effectuer une régression logistique ou linéaire sur ces ensembles de données.X1, … , Xdix6x1,…,x106x_1, \ldots, x_{10^6} Qu'est-ce que la méthode de descente de gradient rend inefficace? Rappelons que le …
Apprendre les statistiques bayésiennes pour la première fois; comme un angle vers la compréhension de MCMC, je me suis demandé: est-ce qu'il fait quelque chose qui ne peut fondamentalement pas être fait d'une autre manière, ou est-ce juste quelque chose de bien plus efficace que les alternatives? À titre d'illustration, …
Je ne sais pas si c'est le bon site de pile, mais voilà. Comment fonctionne la méthode .similiarity? Wow spaCy est super! Son modèle tfidf pourrait être plus simple, mais w2v avec une seule ligne de code?! Dans son didacticiel en 10 lignes sur spaCy andrazhribernik nous montre la méthode …
Je passe par le cours DeepAI de Cousera (semaine 1 vidéo 1 "Présentation des réseaux de neurones") et Andrew Ng explique comment chaque couche d'un réseau de neurones n'est qu'une autre régression logistique, mais il n'explique pas comment cela rend les choses plus précises. Ainsi, dans un réseau à 2 …
Le classificateur Naive Bayes est le classificateur qui attribue les éléments à une classe fonction de la maximisation du postérieur pour l'appartenance à la classe, et suppose que les caractéristiques des éléments sont indépendantes.C P ( C | x )xxxCCCP(C|x)P(C|x)P(C|x) La perte 0-1 est la perte qui attribue à tout …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.