Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
«Chaque personne portant un t-shirt bleu» est-elle un échantillon systématique?
J'enseigne une classe de statistiques d'introduction et passais en revue les types d'échantillonnage, y compris l'échantillonnage systématique où vous échantillonnez chaque kième individu ou objet. Un élève a demandé si l'échantillonnage de chaque personne ayant une caractéristique particulière accomplirait la même chose. Par exemple, l'échantillonnage de chaque personne avec un …
17 sampling 

2
Paysage statistique
Quelqu'un a-t-il écrit un bref aperçu des différentes approches statistiques? En première approximation, vous disposez de statistiques fréquentistes et bayésiennes. Mais lorsque vous regardez de plus près, vous avez également d'autres approches comme les bayésiens vraisemblables et empiriques. Et puis vous avez des subdivisions au sein de groupes tels que …


7
La médiane est-elle plus juste que la moyenne?
J'ai récemment lu le conseil que vous devez généralement utiliser la médiane et non pas éliminer les valeurs aberrantes. Exemple: l'article suivant http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ a actuellement 16 avis: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st …
17 mean  median  average 

8
Mesure de la qualité du clustering
J'ai un algorithme de clustering (pas k-means) avec le paramètre d'entrée (nombre de clusters). Après avoir effectué le clustering, j'aimerais obtenir une mesure quantitative de la qualité de ce clustering. L'algorithme de clustering a une propriété importante. Pour si j'alimente points de données sans aucune distinction significative entre eux à …
17 clustering 

2
Pourquoi utiliser la mise à l'échelle de Platt?
Afin d'étalonner un niveau de confiance à une probabilité dans un apprentissage supervisé (par exemple, pour mapper la confiance d'un SVM ou d'un arbre de décision à l'aide de données suréchantillonnées), une méthode consiste à utiliser la mise à l'échelle de Platt (par exemple, obtenir des probabilités calibrées à partir …

2
Analyse bayésienne non paramétrique en R
Je suis à la recherche d'un bon tutoriel sur le clustering des données en Rutilisant le processus de dirichlet hiérarchique (HDP) (l'une des méthodes bayésiennes non paramétriques récentes et populaires). Il existe DPpackage(à mon humble avis, le plus complet de tous ceux disponibles) Rpour l'analyse bayésienne non paramétrique. Mais je …


6
R: calculer la corrélation par groupe
Verrouillé . Cette question et ses réponses sont verrouillées car la question est hors sujet mais a une signification historique. Il n'accepte pas actuellement de nouvelles réponses ou interactions. Dans R, j'ai une trame de données comprenant une étiquette de classe C (un facteur) et deux mesures, M1 et M2 …
17 r  correlation 




2
Si les largeurs variables du noyau sont souvent bonnes pour la régression du noyau, pourquoi ne sont-elles généralement pas bonnes pour l'estimation de la densité du noyau?
Cette question est motivée par une discussion ailleurs . Les noyaux variables sont souvent utilisés dans la régression locale. Par exemple, le loess est largement utilisé et fonctionne bien comme un régulateur de régression, et est basé sur un noyau de largeur variable qui s'adapte à la rareté des données. …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.