Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'utilise une régression logistique binomiale pour identifier si l'exposition à has_xou has_yaffecte la probabilité qu'un utilisateur clique sur quelque chose. Mon modèle est le suivant: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) Voici la sortie de mon modèle: Call: glm(formula = has_clicked ~ has_x …
Il s'agit d'une question de discussion sur l'intersection de la statistique et d'autres sciences. Je suis souvent confronté au même problème: les chercheurs dans mon domaine ont tendance à dire qu'il n'y a pas d'effet lorsque la valeur p n'est pas inférieure au niveau de signification. Au début, j'ai souvent …
http://www.deeplearningbook.org/contents/ml.html La page 116 explique l'erreur bayes comme ci-dessous Le modèle idéal est un oracle qui connaît simplement la vraie distribution de probabilité qui génère les données. Même un tel modèle entraînera toujours une erreur sur de nombreux problèmes, car il peut y avoir encore du bruit dans la distribution. …
Presque toutes les bases de données que nous voulons faire des prédictions à l'aide d'algorithmes d'apprentissage automatique trouveront des valeurs manquantes pour certaines caractéristiques. Il existe plusieurs approches pour résoudre ce problème, pour exclure les lignes qui ont des valeurs manquantes jusqu'à ce qu'elles se remplissent avec les valeurs moyennes …
Je simplifie une question de recherche que j'ai au travail. Imaginez que j'ai 5 pièces et appelons les têtes un succès. Ce sont des pièces TRÈS biaisées avec une probabilité de succès p = 0,1. Maintenant, si les pièces étaient indépendantes, puis obtenir la probabilité d'au moins 1 tête ou …
J'ai récemment lu cet article sur l'entropie d'une distribution de probabilité discrète. Il décrit une belle façon de penser à l'entropie comme les bits numériques attendus (au moins lors de l'utilisation de log2log2\log_2 dans votre définition d'entropie) nécessaires pour coder un message lorsque votre codage est optimal, compte tenu de …
J'essaie de comprendre la courbe de rappel de précision, je comprends ce que sont la précision et le rappel, mais ce que je ne comprends pas, c'est la valeur "de base". Je lisais ce lien https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ et je ne comprends pas la partie de la ligne de base comme indiqué …
J'analyse un ensemble de données à l'aide d'un modèle à effets mixtes avec un effet fixe (condition) et deux effets aléatoires (participant en raison de la conception et de la paire du sujet). Le modèle a été généré avec le lme4package: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Ensuite, j'ai effectué un test de rapport de …
Apprentissage par renforcement: une introduction. Deuxième édition, en cours ., Richard S. Sutton et Andrew G. Barto (c) 2012, pp. 67-68. Résoudre une tâche d'apprentissage par renforcement signifie, en gros, trouver une politique qui obtient beaucoup de récompenses à long terme. Pour les MDP finis, nous pouvons définir précisément une …
Je suis censé enseigner le théorème de Frish Waugh en économétrie, que je n'ai pas étudié. J'ai compris les mathématiques et j'espère que l'idée aussi "le coefficient que vous obtenez pour un coefficient particulier à partir d'un modèle linéaire multiple est égal au coefficient du modèle de régression simple si …
Je fais l'analyse exploratoire des données (EDA) sur un ensemble de données. Ensuite, je sélectionnerai certaines fonctionnalités pour prédire une variable dépendante. La question est: dois-je faire l'EDA sur mon ensemble de données de formation uniquement? Ou dois-je joindre les ensembles de données de formation et de test ensemble, puis …
J'ai toujours du mal à obtenir la véritable essence du problème des paramètres accessoires. J'ai lu à plusieurs reprises que les estimateurs à effets fixes des modèles de données de panel non linéaires peuvent être gravement biaisés en raison du problème de paramètre incident "bien connu". Lorsque je demande une …
Je prévois d'utiliser une validation croisée stratifiée répétée (10 fois) sur environ 10 000 cas en utilisant un algorithme d'apprentissage automatique. Chaque fois, la répétition sera effectuée avec différentes graines aléatoires. Dans ce processus, je crée 10 instances d'estimations de probabilité pour chaque cas. 1 instance d'estimation de probabilité pour …
Quelqu'un peut-il me dire comment je suis censé construire un réseau neuronal en utilisant la méthode batch? J'ai lu que, en mode batch, pour tous les échantillons de l'ensemble d'apprentissage, nous calculons l'erreur, les poids delta et donc delta pour chaque neurone du réseau, puis au lieu de mettre à …
Je suis intéressé à regarder plusieurs mesures différentes pour les algorithmes de classement - il y en a quelques-unes répertoriées sur la page wikipedia Apprendre à classer, notamment: • Précision moyenne moyenne (MAP); • DCG et NDCG; • Precision @ n, NDCG @ n, où "@n" indique que les métriques …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.