Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Puis-je utiliser Kolmogorov-Smirnov pour comparer deux distributions empiriques?
Peut-on utiliser le test d'ajustement de Kolmogorov-Smirnov pour comparer deux distributions empiriques afin de déterminer si elles semblent provenir de la même distribution sous-jacente, plutôt que de comparer une distribution empirique à une distribution de référence prédéfinie? Permettez-moi d'essayer de poser cette question d'une autre manière. Je collecte N échantillons …

2
Quand combinons-nous la réduction de dimensionnalité avec le clustering?
J'essaie d'effectuer un clustering au niveau du document. J'ai construit la matrice de fréquence terme-document et j'essaie de regrouper ces vecteurs de haute dimension en utilisant k-means. Au lieu de regrouper directement, ce que j'ai fait, j'ai d'abord appliqué la décomposition vectorielle singulière de LSA (Latent Semantic Analysis) pour obtenir …


2
Que signifie exactement «regrouper les données»?
Je pensais que «regrouper les données» signifiait simplement combiner des données qui étaient auparavant divisées en catégories ... essentiellement, ignorer les catégories et faire de l'ensemble de données un «pool» géant de données. Je suppose que c'est une question plus sur la terminologie que sur l'application des statistiques. Par exemple: …



2
Évaluer la fiabilité d'un questionnaire: dimensionnalité, éléments problématiques et utiliser l'alpha, le lambda6 ou un autre indice?
J'analyse les scores donnés par les participants à une expérience. Je souhaite estimer la fiabilité de mon questionnaire qui est composé de 6 items visant à estimer l'attitude des participants envers un produit. J'ai calculé l'alpha de Cronbach en traitant tous les éléments comme une seule échelle (l'alpha était d'environ …


2
Est-ce une bonne pratique de standardiser vos données dans une régression avec des données de panel / longitudinales?
En général, je standardise mes variables indépendantes en régressions, afin de comparer correctement les coefficients (de cette façon ils ont les mêmes unités: les écarts-types). Cependant, avec des données de panel / longitudinales, je ne sais pas comment je devrais standardiser mes données, surtout si j'évalue un modèle hiérarchique. Pour …




2
Comment calculez-vous les intervalles de confiance pour le d de Cohen?
J'ai calculé le d de Cohen pour les coefficients de régression (à partir de la statistique t), les rapports de cotes et les différences de moyennes, en espérant regrouper les résultats dans une méta-analyse et voir comment cela fonctionne. Cependant, dans Stata, il ne semble pas que vous puissiez regrouper …
16 cohens-d 

4
Hypothèses de l'analyse en grappes
Toutes mes excuses pour la question rudimentaire, je suis nouveau dans cette forme d'analyse et j'ai une compréhension très limitée des principes jusqu'à présent. Je me demandais simplement si bon nombre des hypothèses paramétriques pour les tests multivariés / univariés s'appliquent à l'analyse de cluster? De nombreuses sources d'informations que …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.