Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'enseigne une classe de statistiques d'introduction et passais en revue les types d'échantillonnage, y compris l'échantillonnage systématique où vous échantillonnez chaque kième individu ou objet. Un élève a demandé si l'échantillonnage de chaque personne ayant une caractéristique particulière accomplirait la même chose. Par exemple, l'échantillonnage de chaque personne avec un …
Quelqu'un a-t-il écrit un bref aperçu des différentes approches statistiques? En première approximation, vous disposez de statistiques fréquentistes et bayésiennes. Mais lorsque vous regardez de plus près, vous avez également d'autres approches comme les bayésiens vraisemblables et empiriques. Et puis vous avez des subdivisions au sein de groupes tels que …
J'espère pouvoir poser cette question correctement. J'ai accès aux données play-by-play, c'est donc plus un problème avec la meilleure approche et la construction des données correctement. Ce que je cherche à faire, c'est de calculer la probabilité de gagner un match dans la LNH compte tenu du score et du …
J'ai récemment lu le conseil que vous devez généralement utiliser la médiane et non pas éliminer les valeurs aberrantes. Exemple: l'article suivant http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ a actuellement 16 avis: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st …
J'ai un algorithme de clustering (pas k-means) avec le paramètre d'entrée (nombre de clusters). Après avoir effectué le clustering, j'aimerais obtenir une mesure quantitative de la qualité de ce clustering. L'algorithme de clustering a une propriété importante. Pour si j'alimente points de données sans aucune distinction significative entre eux à …
Afin d'étalonner un niveau de confiance à une probabilité dans un apprentissage supervisé (par exemple, pour mapper la confiance d'un SVM ou d'un arbre de décision à l'aide de données suréchantillonnées), une méthode consiste à utiliser la mise à l'échelle de Platt (par exemple, obtenir des probabilités calibrées à partir …
Je suis à la recherche d'un bon tutoriel sur le clustering des données en Rutilisant le processus de dirichlet hiérarchique (HDP) (l'une des méthodes bayésiennes non paramétriques récentes et populaires). Il existe DPpackage(à mon humble avis, le plus complet de tous ceux disponibles) Rpour l'analyse bayésienne non paramétrique. Mais je …
Dans une question précédente, j'ai posé des questions sur les outils d'édition des fichiers CSV . Gavin lié à un commentaire sur R Help par Duncan Murdoch suggérant que le format d'échange de données est un moyen plus fiable de stocker des données que CSV. Pour certaines applications, un système …
Verrouillé . Cette question et ses réponses sont verrouillées car la question est hors sujet mais a une signification historique. Il n'accepte pas actuellement de nouvelles réponses ou interactions. Dans R, j'ai une trame de données comprenant une étiquette de classe C (un facteur) et deux mesures, M1 et M2 …
Il m'est venu à l'esprit que, même si j'ai rassemblé quelques idées au fil des ans sur les différences entre les statistiques et la biostatistique, je n'ai jamais entendu d'explication formelle. Quelle est la distinction entre ces deux disciplines (actuellement)? Et pourquoi cette distinction a-t-elle commencé en premier lieu? EDIT: …
J'ai des données de patients traités avec 2 types de traitements différents pendant la chirurgie. J'ai besoin d'analyser son effet sur la fréquence cardiaque. La mesure de la fréquence cardiaque est prise toutes les 15 minutes. Étant donné que la durée de la chirurgie peut être différente pour chaque patient, …
J'ai lu ce fil et il me semble que l'on peut dire que: statistiques = induction? probabilité = déduction? Mais je me demande s'il pourrait y avoir plus de détails sur la comparaison qui me manque. Par exemple, les statistiques sont-elles égales à l'induction, ou s'agit-il simplement d'un cas particulier? …
Cette question est motivée par une discussion ailleurs . Les noyaux variables sont souvent utilisés dans la régression locale. Par exemple, le loess est largement utilisé et fonctionne bien comme un régulateur de régression, et est basé sur un noyau de largeur variable qui s'adapte à la rareté des données. …
Supposons que l'on ait deux échantillons indépendants de la même population et que des méthodes différentes ont été utilisées sur les deux échantillons pour dériver l'estimation ponctuelle et les intervalles de confiance. Dans des cas triviaux, une personne sensée regrouperait simplement les deux échantillons et utiliserait une seule méthode pour …
Parmi Matlab et Python, quel langage est bon pour l'analyse générale des données statistiques? Quels sont les avantages et les inconvénients, autres que l'accessibilité, pour chacun?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.