Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'essaie de comprendre pourquoi l'augmentation du nombre de fonctionnalités pourrait réduire les performances. J'utilise actuellement un classificateur LDA qui fonctionne mieux de manière bivariée parmi certaines fonctionnalités, mais pire quand on regarde plus de fonctionnalités. Ma précision de classification est effectuée à l'aide d'un xval stratifié 10 fois. Existe-t-il un …
Je viens de tomber sur cette grande analyse qui est à la fois intéressante et belle visuellement: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html Je suis curieux de savoir comment un tel "arbre de chemin" peut être construit en utilisant R. De quelles données et algorithme a-t-on besoin pour construire un tel arbre de chemin? Merci.
J'ai utilisé stl () dans R pour décomposer les données de comptage en composantes de tendance, saisonnières et irrégulières. Les valeurs de tendance résultantes ne sont plus des nombres entiers. J'ai les questions suivantes: Stl () est-il un moyen approprié de désaisonnaliser les données de comptage? Étant donné que la …
Dans une régression logistique avec des termes linéaires et quadratiques uniquement, si j'ai un coefficient linéaire et un coefficient quadratique , puis-je dire qu'il y a un point tournant de la probabilité à ?β 2 - β 1 / ( 2 β 2 )β1β1\beta_1β2β2\beta_2- β1/ (2 β2)−β1/(2β2)-\beta_1 / (2\beta_2)
Ma compréhension est que la forêt aléatoire choisit des variables aléatoires pour construire chaque arbre de décision. Donc, si mtry = ncol / 3, alors chaque variable sera utilisée en moyenne dans 1/3 des arbres. Et 2/3 des arbres ne les utiliseront pas. Mais que faire si je sais qu'une …
L'AIC est défini comme , où est l'estimateur du maximum de vraisemblance et est la dimension de l'espace des paramètres. Pour l'estimation de , on néglige généralement le facteur constant de la densité. Il s'agit du facteur qui ne dépend pas des paramètres, afin de simplifier la probabilité. D'un autre …
J'ai des données avec un nombre minimum de fonctionnalités qui ne changent pas, et quelques fonctionnalités supplémentaires qui peuvent changer et avoir un grand impact sur le résultat. Mon ensemble de données ressemble à ceci: Les fonctionnalités sont A, B, C (toujours présentes) et D, E, F, G, H (parfois …
Pour un ensemble de données donné, l'écart est souvent calculé soit comme l'écart type, soit comme l'IQR (intervalle inter-quartile). Alors que a standard deviationest normalisé (z-scores, etc.) et peut donc être utilisé pour comparer la propagation de deux populations différentes, ce n'est pas le cas avec l'IQR car les échantillons …
Je compare la distribution de taille des arbres dans six paires de parcelles où une parcelle a reçu un traitement et l'autre un contrôle. En utilisant un test de Kolmogorov-Smirnov sur chaque paire de parcelles, je trouve que varie de à 0,75 . Existe-t-il des méthodes appropriées pour traiter toutes …
Supposons que j'ai un mélange de Gaussiens finis avec des poids, des moyens et des écarts-types connus. Les moyens ne sont pas égaux. La moyenne et l'écart type du mélange peuvent être calculés, bien sûr, car les moments sont des moyennes pondérées des moments des composants. Le mélange n'est pas …
Existe-t-il une astuce technique pour déterminer le troisième quartile s'il appartient à un intervalle ouvert qui contient plus d'un quart de la population (donc je ne peux pas fermer l'intervalle et utiliser la formule standard)? Éditer Au cas où j'aurais mal compris quelque chose, je fournirai un contexte plus ou …
Je n'ai pas réussi à comprendre comment effectuer une régression linéaire dans R pour un plan de mesures répétées. Dans une question précédente (toujours sans réponse), il m'a été suggéré de ne pas utiliser lmmais plutôt d'utiliser des modèles mixtes. J'ai utilisé lmde la manière suivante: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) …
Pouvons-nous interpréter la probabilité a posteriori obtenue à partir d'un classificateur qui génère une valeur de classe prédite et une probabilité (par exemple, régression logistique ou Naive Bayes) comme une sorte de score de confiance attribué à cette valeur de classe prédite?
J'essaie de détecter des valeurs anormales dans une série chronologique de données climatiques avec quelques observations manquantes. En cherchant sur le Web, j'ai trouvé de nombreuses approches disponibles. Parmi ceux-ci, la décomposition stl semble attrayante, dans le sens de supprimer les composantes de tendance et saisonnières et d'étudier le reste. …
Je souhaite utiliser le critère d'information Akaike (AIC) pour choisir le nombre approprié de facteurs à extraire dans une ACP. Le seul problème est que je ne sais pas comment déterminer le nombre de paramètres. Considérons une matrice X , où N représente le nombre de variables et T le …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.