Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Interprétation des parcelles de violon
Je compare la distribution de différents groupes à l'aide des parcelles de violon, mais la plupart des ressources en ligne que j'ai trouvées sont uniquement liées à la façon de créer les parcelles et à l'interprétation très basique des résultats (la variation médiane, les données sont regroupées ou non). Je …

1
Y a-t-il une signification conventionnelle de
Je lisais un article sur l'ajustement de courbe bayésienne ( Dimatteo et al., Ajustement de courbe bayésienne avec des splines à nœuds libres, 2001 ) et suis tombé sur le symbole \ bumpeq≏≏\bumpeq . Il est utilisé plusieurs fois dans le document, mais jamais défini de manière explicite. Après quelques …


2
Mesure de performance du classificateur qui combine sensibilité et spécificité?
J'ai des données étiquetées à 2 classes sur lesquelles j'effectue une classification à l'aide de plusieurs classificateurs. Et les ensembles de données sont bien équilibrés. Lors de l'évaluation des performances des classificateurs, je dois prendre en compte la précision du classificateur pour déterminer non seulement les vrais positifs, mais aussi …

1
Expériences bonnes, utiles et caractéristiques pour une conception statistique (optimale) des expériences
Il y a plus de phénomènes auxquels la conception expérimentale peut être appliquée qu'il n'y a d'autres stratégies de conception valides. Cela devrait être vrai, bien qu'il existe de nombreuses façons de concevoir correctement une expérience. Quels sont les meilleurs "problèmes" qui démontrent vraiment la valeur et la nuance des …



2
Confusion liée à l'échantillonnage de Gibbs
Je suis tombé sur cet article où il est dit que dans l'échantillonnage de Gibbs, chaque échantillon est accepté. Je suis un peu confus. Comment se fait-il que chaque échantillon qu'il a accepté converge vers une distribution stationnaire. En général, nous acceptons l'algorithme Metropolis comme min (1, p (x *) …


2
Ajout de pondérations pour des ensembles de données fortement asymétriques dans la régression logistique
J'utilise une version standard de régression logistique pour adapter mes variables d'entrée aux variables de sortie binaires. Cependant, dans mon problème, les sorties négatives (0s) dépassent de loin les sorties positives (1s). Le rapport est de 20: 1. Ainsi, lorsque je forme un classificateur, il semble que même les fonctionnalités …


1
Terme d'interaction utilisant une analyse de régression hiérarchique à variables centrées? Quelles variables devons-nous centrer?
Je lance une analyse de régression hiérarchique et j'ai quelques petits doutes: Calculons-nous le terme d'interaction en utilisant les variables centrées? Faut-il centrer TOUTES les variables continues que nous avons dans l'ensemble de données, à l'exception de la variable dépendante? Lorsque nous devons enregistrer certaines variables (parce que leur sd …


3
LDA contre perceptron
J'essaie de me faire une idée de la façon dont LDA «s'inscrit» dans d'autres techniques d'apprentissage supervisé. J'ai déjà lu certains des articles de LDA ici sur LDA. Je connais déjà le perceptron, mais j'apprends juste le LDA maintenant. Comment le LDA s'intègre-t-il dans la famille des algorithmes d'apprentissage supervisé? …

4
Si j'ai de nombreux résultats positifs et insignifiants, puis-je tester «au moins de ces résultats sont positifs»?
Disons que j'ai effectué la même régression pour 100 individus différents séparément. Mes coefficients d'intérêt sont positifs (et assez différents les uns des autres) mais statistiquement non significatifs dans les 100 résultats (disons chaque valeur de p = 0,11). Existe-t-il un moyen de combiner ces valeurs de p pour conclure …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.