Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


3
Quantifier la similitude entre deux ensembles de données
Résumé : essayer de trouver la meilleure méthode résume la similitude entre deux ensembles de données alignés de données en utilisant une seule valeur. Détails : Ma question est mieux expliquée avec un diagramme. Les graphiques ci-dessous montrent deux ensembles de données différents, chacun avec des valeurs étiquetées nfet nr. …

1
Variance de la statistique
Le de Cohen réddest l'une des façons les plus courantes de mesurer la taille d'un effet ( voir Wikipedia ). Il mesure simplement la distance entre deux moyennes en termes d'écart type groupé. Comment dériver la formule mathématique d'estimation de la variance du de Cohen rédd? Édition de décembre 2015: …

2
Comment calculer les poids des critères Fisher?
J'étudie la reconnaissance des formes et l'apprentissage automatique, et je suis tombé sur la question suivante. Considérons un problème de classification à deux classes avec une probabilité de classe antérieure égaleP(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} et la distribution des instances dans chaque classe donnée par p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 …

3
pourquoi la méthode de boosting est sensible aux valeurs aberrantes
J'ai trouvé de nombreux articles qui indiquent que les méthodes de boosting sont sensibles aux valeurs aberrantes, mais aucun article expliquant pourquoi. D'après mon expérience, les valeurs aberrantes sont mauvaises pour tout algorithme d'apprentissage automatique, mais pourquoi les méthodes de renforcement sont-elles particulièrement sensibles? Comment les algorithmes suivants se classeraient-ils …

2
Quand utiliser les réseaux bayésiens par rapport à d'autres approches d'apprentissage automatique?
J'espère qu'il n'y aura peut-être pas de réponse définitive à cette question. Mais j'ai utilisé un certain nombre d'algorithmes d'apprentissage automatique dans le passé et j'essaie d'en apprendre davantage sur les réseaux bayésiens. Je voudrais comprendre dans quelles circonstances ou pour quels types de problèmes choisiriez-vous d'utiliser le réseau bayésien …

2
Un intervalle de confiance fournit-il réellement une mesure de l'incertitude d'une estimation de paramètre?
Je lisais un article de blog du statisticien William Briggs, et l'affirmation suivante m'a le moins intéressé. Qu'est-ce que vous en faites? Qu'est-ce qu'un intervalle de confiance? C'est une équation, bien sûr, qui vous fournira un intervalle pour vos données. Il vise à fournir une mesure de l'incertitude d'une estimation …


2
Quand MCMC est-il utile?
J'ai du mal à comprendre dans quelle situation l'approche MCMC est réellement utile. Je passe par un exemple de jouet du livre de Kruschke "Faire l'analyse des données bayésiennes: un tutoriel avec R et BUGS". Ce que j'ai compris jusqu'à présent, c'est que nous avons besoin d'une distribution cible qui …
12 mcmc 


3
Pourquoi la méthode d'exclusion (fractionnement des données en formation et tests) n'est-elle pas utilisée dans les statistiques classiques?
Dans mon exposition en classe à l'exploration de données, la méthode de rétention a été introduite comme moyen d'évaluer les performances du modèle. Cependant, lorsque j'ai suivi mon premier cours sur les modèles linéaires, cela n'a pas été introduit comme moyen de validation ou d'évaluation des modèles. Ma recherche en …

1
k-means || alias K-Means évolutif ++
Bahman Bahmani et al. a introduit k-means ||, qui est une version plus rapide de k-means ++. Cet algorithme est tiré de la page 4 de leur article , Bahmani, B., Moseley, B., Vattani, A., Kumar, R., et Vassilvitskii, S. (2012). K-means évolutif ++. Actes de la dotation VLDB , …




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.