Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

2
Pourquoi l'augmentation du nombre de fonctionnalités réduit-elle les performances?
J'essaie de comprendre pourquoi l'augmentation du nombre de fonctionnalités pourrait réduire les performances. J'utilise actuellement un classificateur LDA qui fonctionne mieux de manière bivariée parmi certaines fonctionnalités, mais pire quand on regarde plus de fonctionnalités. Ma précision de classification est effectuée à l'aide d'un xval stratifié 10 fois. Existe-t-il un …

1
Comment calculer les «Chemins vers la Maison Blanche» en utilisant R?
Je viens de tomber sur cette grande analyse qui est à la fois intéressante et belle visuellement: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html Je suis curieux de savoir comment un tel "arbre de chemin" peut être construit en utilisant R. De quelles données et algorithme a-t-on besoin pour construire un tel arbre de chemin? Merci.

1
Désaisonnalisation des données de comptage
J'ai utilisé stl () dans R pour décomposer les données de comptage en composantes de tendance, saisonnières et irrégulières. Les valeurs de tendance résultantes ne sont plus des nombres entiers. J'ai les questions suivantes: Stl () est-il un moyen approprié de désaisonnaliser les données de comptage? Étant donné que la …





6
Une mesure robuste (non paramétrique) comme le coefficient de variation - IQR / médiane, ou alternative?
Pour un ensemble de données donné, l'écart est souvent calculé soit comme l'écart type, soit comme l'IQR (intervalle inter-quartile). Alors que a standard deviationest normalisé (z-scores, etc.) et peut donc être utilisé pour comparer la propagation de deux populations différentes, ce n'est pas le cas avec l'IQR car les échantillons …




1
Régression linéaire avec mesures répétées dans R
Je n'ai pas réussi à comprendre comment effectuer une régression linéaire dans R pour un plan de mesures répétées. Dans une question précédente (toujours sans réponse), il m'a été suggéré de ne pas utiliser lmmais plutôt d'utiliser des modèles mixtes. J'ai utilisé lmde la manière suivante: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) …


3
STL sur séries chronologiques avec valeurs manquantes pour la détection d'anomalies
J'essaie de détecter des valeurs anormales dans une série chronologique de données climatiques avec quelques observations manquantes. En cherchant sur le Web, j'ai trouvé de nombreuses approches disponibles. Parmi ceux-ci, la décomposition stl semble attrayante, dans le sens de supprimer les composantes de tendance et saisonnières et d'étudier le reste. …

4
Sélection du modèle PCA avec AIC (ou BIC)
Je souhaite utiliser le critère d'information Akaike (AIC) pour choisir le nombre approprié de facteurs à extraire dans une ACP. Le seul problème est que je ne sais pas comment déterminer le nombre de paramètres. Considérons une matrice X , où N représente le nombre de variables et T le …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.