Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

3
Est-il préférable de sélectionner des distributions basées sur la théorie, l'ajustement ou autre chose?
Ceci est à la limite d'une question philosophique, mais je suis intéressé par la façon dont d'autres personnes ayant plus d'expérience pensent la sélection de distribution. Dans certains cas, il semble clair que la théorie pourrait mieux fonctionner (les longueurs de queue des souris sont probablement normalement distribuées). Dans de …

3
Déduire la variance du boxplot
Je me demandais comment déduire la variance d'une variable à l'aide d'un boxplot. Est-il au moins possible de déduire si deux variables ont la même variance en observant leur boxplot?
12 variance  boxplot 

1
Comment former les HMM pour la classification?
Je comprends donc que lorsque vous formez des HMM à la classification, l'approche standard est la suivante: Séparez vos ensembles de données dans les ensembles de données pour chaque classe Former un HMM par classe Sur l'ensemble de test, comparez la probabilité de chaque modèle de classer chaque fenêtre Mais …

2
Vérification de la normalité des résidus dans les modèles linéaires généralisés
Cet article utilise des modèles linéaires généralisés (distributions d'erreur binomiale et binomiale négative) pour analyser les données. Mais ensuite, dans la section analyse statistique des méthodes, il y a cette déclaration: ... et deuxièmement en modélisant les données de présence à l'aide de modèles de régression logistique et les données …



1
Clopper-Pearson pour les non-mathématiciens
Je me demandais si quelqu'un pouvait m'expliquer l'intuition au-delà du Clopper-Pearson CI pour les proportions. Pour autant que je sache, chaque CI comprend une variance. Cependant, pour les proportions, même si ma proportion est de 0 ou 1 (0% ou 100%), l'IC Clopper-Pearson peut être calculé. J'ai essayé de regarder …

4
Estimation de la densité du noyau intégrant des incertitudes
Lors de la visualisation de données unidimensionnelles, il est courant d'utiliser la technique d'estimation de la densité du noyau pour tenir compte des largeurs de bac mal choisies. Lorsque mon ensemble de données unidimensionnel présente des incertitudes de mesure, existe-t-il un moyen standard d'incorporer ces informations? Par exemple (et pardonnez-moi …

1
Vous avez du mal à trouver un bon modèle adapté aux données de comptage avec des effets mixtes - ZINB ou autre chose?
J'ai un très petit ensemble de données sur l'abondance des abeilles solitaires que j'ai du mal à analyser. Ce sont des données de comptage, et presque tous les comptages sont dans un traitement avec la plupart des zéros dans l'autre traitement. Il existe également quelques valeurs très élevées (une sur …


4
Pouvez-vous comparer différentes méthodes de clustering sur un ensemble de données sans vérité de fond par validation croisée?
Actuellement, j'essaie d'analyser un ensemble de données de document texte qui n'a aucune vérité fondamentale. On m'a dit que vous pouvez utiliser la validation croisée k-fold pour comparer différentes méthodes de clustering. Cependant, les exemples que j'ai vus dans le passé utilisent une vérité fondamentale. Existe-t-il un moyen d'utiliser les …

1
Inversion des baies
J'ai un grand ensemble de données de marché agrégées sur les ventes de vin aux États-Unis et je voudrais estimer la demande de certains vins de haute qualité. Ces parts de marché sont essentiellement dérivées d'un modèle d'utilité aléatoire de la forme où inclut les caractéristiques de produit observées, désigne …

2
Statistiques de pizza pour les masses
Une brève entrée sur le site Web du NY Times fournit les faits et chiffres de la consommation de pizza aux États-Unis. J'ai un intérêt occasionnel dans la façon dont les statistiques sont utilisées (ou utilisées abusivement) pour fournir des informations au grand public, et quelques questions se sont posées …

1
Calculer log-vraisemblance «à la main» pour la régression généralisée des moindres carrés non linéaires (nlme)
J'essaie de calculer la log-vraisemblance pour une régression des moindres carrés non linéaires généralisée pour la fonction optimisée par le dans le package R , en utilisant la matrice de covariance de variance générée par les distances sur un arbre phylogénétique en supposant un mouvement brownien (à partir du package). …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.