Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


4
Acceptation de l'hypothèse nulle
Il s'agit d'une question de discussion sur l'intersection de la statistique et d'autres sciences. Je suis souvent confronté au même problème: les chercheurs dans mon domaine ont tendance à dire qu'il n'y a pas d'effet lorsque la valeur p n'est pas inférieure au niveau de signification. Au début, j'ai souvent …


3
Méthodes pour contourner le problème des données manquantes dans l'apprentissage automatique
Presque toutes les bases de données que nous voulons faire des prédictions à l'aide d'algorithmes d'apprentissage automatique trouveront des valeurs manquantes pour certaines caractéristiques. Il existe plusieurs approches pour résoudre ce problème, pour exclure les lignes qui ont des valeurs manquantes jusqu'à ce qu'elles se remplissent avec les valeurs moyennes …


1
Comment interpréter l'entropie différentielle?
J'ai récemment lu cet article sur l'entropie d'une distribution de probabilité discrète. Il décrit une belle façon de penser à l'entropie comme les bits numériques attendus (au moins lors de l'utilisation de log2log2\log_2 dans votre définition d'entropie) nécessaires pour coder un message lorsque votre codage est optimal, compte tenu de …


1
Quelle méthode de comparaison multiple utiliser pour un modèle lmer: lsmeans ou glht?
J'analyse un ensemble de données à l'aide d'un modèle à effets mixtes avec un effet fixe (condition) et deux effets aléatoires (participant en raison de la conception et de la paire du sujet). Le modèle a été généré avec le lme4package: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Ensuite, j'ai effectué un test de rapport de …

3
Pourquoi y a-t-il toujours au moins une politique meilleure ou égale à toutes les autres politiques?
Apprentissage par renforcement: une introduction. Deuxième édition, en cours ., Richard S. Sutton et Andrew G. Barto (c) 2012, pp. 67-68. Résoudre une tâche d'apprentissage par renforcement signifie, en gros, trouver une politique qui obtient beaucoup de récompenses à long terme. Pour les MDP finis, nous pouvons définir précisément une …


5
Est-il préférable de faire une analyse exploratoire des données sur l'ensemble de données de formation uniquement?
Je fais l'analyse exploratoire des données (EDA) sur un ensemble de données. Ensuite, je sélectionnerai certaines fonctionnalités pour prédire une variable dépendante. La question est: dois-je faire l'EDA sur mon ensemble de données de formation uniquement? Ou dois-je joindre les ensembles de données de formation et de test ensemble, puis …

1
Problème de paramètre accessoire
J'ai toujours du mal à obtenir la véritable essence du problème des paramètres accessoires. J'ai lu à plusieurs reprises que les estimateurs à effets fixes des modèles de données de panel non linéaires peuvent être gravement biaisés en raison du problème de paramètre incident "bien connu". Lorsque je demande une …



3
Mesures pour évaluer les algorithmes de classement
Je suis intéressé à regarder plusieurs mesures différentes pour les algorithmes de classement - il y en a quelques-unes répertoriées sur la page wikipedia Apprendre à classer, notamment: • Précision moyenne moyenne (MAP); • DCG et NDCG; • Precision @ n, NDCG @ n, où "@n" indique que les métriques …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.