Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Déterminer la taille de l'échantillon avec une proportion et une distribution binomiale
J'essaie d'apprendre quelques statistiques en utilisant le livre, Biometry by Sokal and Rohlf (3e). Il s'agit d'un exercice du 5ème chapitre qui couvre la probabilité, la distribution binomiale et la distribution de Poisson. Je me rends compte qu'il existe une formule pour produire une réponse à cette question: Cependant, cette …


1
Arbres de décision: mise à l'échelle variable (fonctionnalité) et normalisation variable (fonctionnalité) (réglage) requises dans quelles implémentations?
Dans de nombreux algorithmes d'apprentissage automatique, la mise à l'échelle des fonctionnalités (aka mise à l'échelle variable, normalisation) est une étape de pré-traitement courante Wikipedia - Mise à l'échelle des fonctionnalités - cette question était proche Question # 41704 - Comment et pourquoi la normalisation et la mise à l'échelle …




2
PyMC pour le regroupement non paramétrique: le processus de Dirichlet pour estimer les paramètres du mélange gaussien ne parvient pas à se regrouper
Configuration du problème L'un des premiers problèmes de jouets auquel j'ai voulu appliquer PyMC est le clustering non paramétrique: étant donné certaines données, modélisez-le comme un mélange gaussien et apprenez le nombre de clusters et la moyenne et la covariance de chaque cluster. La plupart de ce que je sais …

1
Expliquer les filtres de Kalman dans les modèles d'espace d'état
Quelles sont les étapes de l'utilisation des filtres de Kalman dans les modèles d'espace d'état? J'ai vu quelques formulations différentes , mais je ne suis pas sûr des détails. Par exemple, Cowpertwait commence par cet ensemble d'équations: θt=Gtθt-1+wtyt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} où et , sont nos estimations inconnues …

2
L'ANOVA bidirectionnelle est-elle appropriée?
Voici la description de mon étude. J'expérimente avec trois plantes: A, B et C. Ces plantes sont censées réduire la glycémie des patients diabétiques. Je veux déterminer laquelle de ces trois plantes a un effet plus long sur la réduction de la glycémie après une seule administration à des souris. …


2
Est-il judicieux de calculer des intervalles de confiance et de tester des hypothèses lorsque des données de l'ensemble de la population sont disponibles?
Est-il judicieux de calculer des intervalles de confiance et de tester des hypothèses lorsque des données de l'ensemble de la population sont disponibles? À mon avis, la réponse est non, car nous pouvons calculer avec précision les vraies valeurs des paramètres. Mais alors, quelle est la proportion maximale de données …

6
Modèles flexibles et rigides en apprentissage automatique
Je suis tombé sur une question simple sur la comparaison des modèles flexibles (c'est-à-dire des splines) et des modèles inflexibles (par exemple la régression linéaire) dans différents scénarios. La question est: En général, nous attendons-nous à ce que les performances d'une méthode d'apprentissage statistique flexible soient meilleures ou moins bonnes …




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.