Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données



5
Puis-je utiliser PCA pour effectuer une sélection de variables pour l'analyse de cluster?
Je dois réduire le nombre de variables pour effectuer une analyse de cluster. Mes variables sont fortement corrélées, j'ai donc pensé faire une analyse factorielle PCA (analyse en composantes principales). Cependant, si j'utilise les scores obtenus, mes grappes ne sont pas tout à fait correctes (par rapport aux classifications précédentes …

3
Lecture de seulement deux colonnes sur trois avec read.csv
Verrouillé . Cette question et ses réponses sont verrouillées car la question est hors sujet mais a une signification historique. Il n'accepte pas actuellement de nouvelles réponses ou interactions. J'ai un ensemble de données ascii qui se compose de trois colonnes, mais seules les deux dernières sont des données réelles. …
12 r 



4
Estimateur d'une distribution binomiale
Comment définir un estimateur pour les données provenant d'une distribution binomiale? Pour bernoulli je peux penser à un estimateur estimant un paramètre p, mais pour le binôme je ne vois pas quels paramètres estimer quand on a n caractérisant la distribution? Mise à jour: Par estimateur, j'entends une fonction des …


2
Comment spécifier des contrastes spécifiques pour des mesures répétées ANOVA en voiture?
J'essaie d'exécuter une mesure répétée Anova dans R suivie de quelques contrastes spécifiques sur cet ensemble de données. Je pense que la bonne approche serait d'utiliser à Anova()partir du package de voiture. Permet d'illustrer ma question avec l'exemple tiré de l' ?Anovautilisation des OBrienKaiserdonnées (Remarque: j'ai omis le facteur de …



1
Définition des quantiles sur un échantillon pondéré
J'ai un échantillon pondéré, pour lequel je souhaite calculer des quantiles. 1 Idéalement, où les poids sont égaux (si = 1 ou autre), les résultats seraient conformes à celles de scipy.stats.scoreatpercentile()et R de quantile(...,type=7). Une approche simple serait de «multiplier» l'échantillon en utilisant les poids donnés. Cela donne effectivement un …

2
Que maximisent les premiers facteurs de l'analyse factorielle?
Dans l'analyse des composantes principales, les premières composantes principales sont les directions orthogonales avec la variance maximale. En d'autres termes, la première composante principale est choisie pour être la direction de la variance maximale, la deuxième composante principale est choisie pour être la direction orthogonale à la première avec la …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.