Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données


1
Du HMM standard au HMM bayésien
J'essaie de comprendre quelle est la différence entre un HMM standard et un HMM bayésien. Wikipedia mentionne brièvement à quoi ressemble le modèle, mais j'ai besoin d'un tutoriel plus détaillé. Quelqu'un connaît-il un document ou une mise en œuvre que je peux consulter? J'ai également des problèmes avec la terminologie …






1
Biais variable omis dans la régression linéaire
J'ai une question philosophique concernant le biais variable omis. Nous avons le modèle de régression typique (modèle de population) où proviennent les échantillons , puis un tas de conditions dans lesquelles les estimations de l'OLS se comportent assez bien.Y=β0+β1X1+...+βnXn+υ,Y=β0+β1X1+...+βnXn+υ, Y= \beta_0 + \beta_1X_1 + ... + \beta_nX_n + \upsilon, (Y,X1,...,Xn)(Y,X1,...,Xn)(Y,X_1,...,X_n) …




2
Quelle est l'importance de la connaissance du domaine dans notre profession?
ou: La sélection d'un domaine lors de la saisie d'un emploi réduit-elle vos futures options pour les domaines et donc les emplois? Pour rendre cette question aussi largement applicable que possible ... profession fait référence à toutes sortes d'analystes de données, des statisticiens aux programmeurs d'apprenants machine en passant par …
8 careers 

2
Comment comparer statistiquement deux algorithmes à travers trois ensembles de données dans la sélection et la classification d'entités?
Contexte du problème: Dans le cadre de mes recherches, j'ai écrit deux algorithmes qui peuvent sélectionner un ensemble de fonctionnalités à partir d'un ensemble de données (données d'expression génique de patients cancéreux). Ces caractéristiques sont ensuite testées pour voir dans quelle mesure elles peuvent classer un échantillon invisible comme cancéreux …

2
Imputation avec des forêts aléatoires
J'ai deux questions sur l'utilisation de la forêt aléatoire (spécifiquement randomForest dans R) pour l'imputation des valeurs manquantes (dans l'espace des prédicteurs). 1) Comment fonctionne l'algorithme d'imputation - en particulier comment et pourquoi l'étiquette de classe est-elle requise pour l'imputation? la matrice de proximité qui sert à pondérer la valeur …

2
Test post-hoc après mesures répétées à 2 facteurs ANOVA dans R?
J'ai des problèmes à trouver une solution concernant la façon d'exécuter un test post-hoc (Tukey HSD) après une ANOVA à mesures répétées à 2 facteurs (tous deux intra-sujets) en R. Pour l'ANOVA, j'ai utilisé la fonction aov: summary(aov(dv ~ x1 * x2 + Error(subject/(x1*x2)), data=df1)) Après avoir lu les réponses …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.