Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je voudrais créer une forêt aléatoire en utilisant le processus suivant: Construisez un arbre sur un échantillon aléatoire des données et des fonctionnalités en utilisant le gain d'informations pour déterminer les divisions Terminer un nœud feuille s'il dépasse une profondeur prédéfinie OU toute scission entraînerait un nombre de feuilles inférieur …
J'utilise la régression quantile (par exemple via gbmou quantregdans R) - ne me concentrant pas sur la médiane mais plutôt sur un quantile supérieur (par exemple 75e). Issu d'un arrière-plan de modélisation prédictive, je veux mesurer l'adéquation du modèle avec un ensemble de tests et pouvoir le décrire à un …
J'ai un jeu de données comme +--------+------+-------------------+ | income | year | use | +--------+------+-------------------+ | 46328 | 1989 | COMMERCIAL EXEMPT | | 75469 | 1998 | CONDOMINIUM | | 49250 | 1950 | SINGLE FAMILY | | 82354 | 2001 | SINGLE FAMILY | | 88281 | 1985 …
Je pensais que je pourrais jouer avec une sélection de variables bayésiennes, à la suite d'un bel article de blog et des articles liés. J'ai écrit un programme dans rjags (où je suis plutôt une recrue) et récupéré des données de prix pour Exxon Mobil, ainsi que certaines choses qui …
Je suis tombé sur une rumeur selon laquelle une étude a montré que les performances des modèles prédictifs dépendent davantage de l'expertise de l'analyste de données avec la méthode choisie que du choix de la méthode. En d'autres termes, l'affirmation est qu'il est plus important que l'analyste de données soit …
J'essaie de résoudre ce problème depuis plus d'un an sans grand progrès. Cela fait partie d'un projet de recherche que je fais, mais je vais l'illustrer avec un exemple d'histoire que j'ai inventé, car le domaine réel du problème est un peu déroutant (eye-tracking). Vous êtes un avion qui suit …
Supposons que nous ayons des points dans un espace à deux dimensions, et nous souhaitons mesurer les effets des attributs XXX sur l'attribut . Le modèle de régression linéaire typique est bien sûr yyyy= Xβ+ ϵy=Xβ+ϵy= X\beta + \epsilon Il y a deux problèmes ici: le premier est que les …
Dans la recherche en économétrie financière, il est très courant d'étudier les relations entre les séries chronologiques financières qui prennent la forme de données quotidiennes . La variable sera souvent faite en prenant la différence logarithmique, par exemple; ln ( P t ) - ln ( P t - 1 …
Je lis le chapitre sur les statistiques fréquentes du livre de Kevin Murphy " Machine Learning - A Probabilistic Perspective ". La section sur le bootstrap se lit comme suit: Le bootstrap est une technique Monte Carlo simple pour approximer la distribution d'échantillonnage. Ceci est particulièrement utile dans les cas …
Je fais une validation croisée en utilisant la méthode du congé-un. J'ai une réponse binaire et j'utilise le package de démarrage pour R et la fonction cv.glm . Mon problème est que je ne comprends pas bien la partie "coût" de cette fonction. D'après ce que je peux comprendre, c'est …
Fermé. Cette question est hors sujet . Il n'accepte pas actuellement les réponses. Voulez-vous améliorer cette question? Mettez à jour la question afin qu'elle soit sur le sujet pour la validation croisée. Fermé il y a 2 ans . J'ai un ensemble de données assez simple composé d'une variable indépendante, …
J'ai lu que le test de Kolmogorov-Smirnov ne devrait pas être utilisé pour tester la qualité de l'ajustement d'une distribution dont les paramètres ont été estimés à partir de l'échantillon. Est-il judicieux de diviser mon échantillon en deux et d'utiliser la première moitié pour l'estimation des paramètres et la seconde …
J'ai du mal à comprendre comment utiliser le bootstrap pour calculer les intervalles de prédiction pour un modèle de régression linéaire. Quelqu'un peut-il décrire une procédure étape par étape? J'ai cherché via google mais rien n'a vraiment de sens pour moi. Je comprends comment utiliser le bootstrap pour calculer les …
Supposons que j'ai un vecteur ordonné où le premier élément est le nombre de visites d'un site Web dans une période donnée par l'IP unique avec le plus grand nombre de visites, le deuxième élément est le nombre de visites par l'IP unique avec le second le plus grand nombre …
J'ai envisagé de faire une méta-analyse pour un domaine d'étude particulier en évolution, mais avant d'aller plus loin, j'aimerais savoir; quels sont les points positifs et négatifs du processus? Par exemple, pas besoin d'une expérience pratique n'est un avantage (temps et argent) mais il y aura un biais de publication …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.