Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Pourquoi les décompositions propres et svd d'une matrice de covariance basées sur des données clairsemées donnent-elles des résultats différents?
J'essaie de décomposer une matrice de covariance basée sur un ensemble de données clairsemé / gappy. Je remarque que la somme de lambda (variance expliquée), telle que calculée avec svd, est amplifiée avec des données de plus en plus pertinentes. Sans lacunes, svdet eigenobtenez les mêmes résultats. Cela ne semble …
12 r  svd  eigenvalues 

2
randomForest choisit la régression au lieu de la classification
J'utilise le package randomForest dans R et j'utilise les données d'iris, la forêt aléatoire générée est une classification mais lorsque j'utilise un ensemble de données avec environ 700 entités (les entités sont chaque pixel dans une image de 28 x 28 pixels) et la colonne d'étiquette est nommée label, le …
12 r  random-forest 

1
modèles bayésiens hiérarchiques vs Bayes empiriques
Considérez-vous le HBM vs EB comme deux alternatives dans lesquelles les hyperparamètres sont "dans le jeu" d'être échantillonnés / estimés / etc.? Il y a clairement un lien entre ces deux. Considérez-vous HBM plus "pleinement bayésien" qu'EB? Y a-t-il un endroit où je peux voir quelles sont les différences entre …




5
Les Bayésiens soutiennent-ils jamais qu'il existe des cas dans lesquels leur approche se généralise / recoupe avec l'approche fréquentiste?
Les bayésiens soutiennent-ils que leur approche généralise l'approche fréquentiste, parce que l'on peut utiliser des priors non informatifs et donc, récupérer une structure de modèle fréquentiste typique? Quelqu'un peut-il me référer à un endroit où je pourrai lire cet argument, s'il est effectivement utilisé? EDIT: Cette question n'est peut-être pas …

3
SVD d'une matrice avec des valeurs manquantes
Supposons que j'ai une matrice de recommandations de style Netflix et que je souhaite créer un modèle qui prédit les futures classifications de films potentielles pour un utilisateur donné. En utilisant l'approche de Simon Funk, on utiliserait la descente de gradient stochastique pour minimiser la norme Frobenius entre la matrice …


2
PCA et forêts aléatoires
Pour un récent concours Kaggle, j'ai (manuellement) défini 10 fonctionnalités supplémentaires pour mon ensemble d'entraînement, qui seraient ensuite utilisées pour former un classificateur de forêts aléatoires. J'ai décidé d'exécuter PCA sur l'ensemble de données avec les nouvelles fonctionnalités, pour voir comment elles se comparaient les unes aux autres. J'ai trouvé …

2
Différence entre l'analyse factorielle exploratoire et confirmatoire pour déterminer l'indépendance du construit
Les chercheurs utilisent souvent deux mesures qui ont des éléments très similaires et affirment qu'ils mesurent des choses différentes (par exemple, "je m'inquiète toujours quand je suis près des voitures"; "j'ai peur des voitures"). Appelons les mesures hypothétiques la mesure de la peur des voitures et de l'anxiété à l'échelle …

2
Comment réduire le nombre d'articles en utilisant conjointement l'analyse factorielle, la cohérence interne et la théorie de la réponse des articles?
Je suis en train de développer empiriquement un questionnaire et j'utiliserai des nombres arbitraires dans cet exemple pour illustrer. Pour le contexte, je développe un questionnaire psychologique visant à évaluer les schémas de pensée couramment identifiés chez les personnes souffrant de troubles anxieux. Un article pourrait ressembler à "J'ai besoin …



En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.