Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai des données qui ressemblent un peu à ceci: ID Status 01 A 02 G 03 E ... ... 100 G Vous voyez l'idée, je pense. J'ai ces données de deux populations distinctes (cohortes) et je veux comparer la distribution de la variable de statut dans une population à la …
J'essaie de comprendre quelle est la différence entre un HMM standard et un HMM bayésien. Wikipedia mentionne brièvement à quoi ressemble le modèle, mais j'ai besoin d'un tutoriel plus détaillé. Quelqu'un connaît-il un document ou une mise en œuvre que je peux consulter? J'ai également des problèmes avec la terminologie …
Je travaille sur un projet logiciel qui consiste à créer un visualiseur pour les simulations de crue. Dans le cadre de ce projet, j'ai créé un gradient d'eau qui montre la profondeur de l'eau à des points particuliers. Pour définir quelles valeurs représenteront quelles couleurs, je passe en revue les …
J'ai 65 échantillons de données en 21 dimensions (collées ici ) et j'en construis la matrice de covariance. Lorsque calculé en C ++, je récupère la matrice de covariance collée ici . Et lorsque calculé dans matlab à partir des données (comme indiqué ci-dessous), je reçois la matrice de covariance …
J'utilise le lme4package dans R pour faire de la modélisation logistique à effets mixtes. J'ai cru comprendre que la somme de chaque effet aléatoire devait être nulle. Lorsque je crée des modèles mixtes linéaires de jouets à l'aide de lmer, les effets aléatoires sont généralement < confirmant ma conviction que …
Je veux estimer les paramètres des modèles de mélange de Dirichlet en utilisant l'échantillonnage de Gibbs et j'ai quelques questions à ce sujet: Un mélange de distributions de Dirichlet est-il équivalent à un processus de Dirichlet? Quelles sont leurs principales différences si ce n'est pas le cas? De plus, si …
Lorsqu'il s'agit de données avec des facteurs, R peut être utilisé pour calculer les moyennes pour chaque groupe avec la fonction lm (). Cela donne également les erreurs types pour les moyennes estimées. Mais cette erreur standard diffère de ce que j'obtiens d'un calcul à la main. Voici un exemple …
J'ai une question philosophique concernant le biais variable omis. Nous avons le modèle de régression typique (modèle de population) où proviennent les échantillons , puis un tas de conditions dans lesquelles les estimations de l'OLS se comportent assez bien.Y=β0+β1X1+...+βnXn+υ,Y=β0+β1X1+...+βnXn+υ, Y= \beta_0 + \beta_1X_1 + ... + \beta_nX_n + \upsilon, (Y,X1,...,Xn)(Y,X1,...,Xn)(Y,X_1,...,X_n) …
Disons que je veux prédire si un projet sera rentable ou non. Dans mes données d'échantillon, la variable de réponse est en fait une variable continue: le $ profit / loss du projet. Parce que mon objectif ultime est juste une classification binaire (projet rentable ou projet non rentable), dois-je …
J'ai un problème où y=a+by=a+by = a + b J'observe y, mais ni ni . Je veux estimeraaabbb b=f(x)+ϵb=f(x)+ϵb = f(x) + \epsilon Je peux estimer , en utilisant une sorte de modèle de régression. Cela me donne . Je pourrais alors estimeraaab^b^\hat b b^=f(x)+ϵb^=f(x)+ϵ\hat b = f(x) + \epsilon …
Je suis familier avec l'utilisation des connaissances de la théorie des matrices aléatoires pour déterminer le nombre de composants principaux de l'ACP d'une matrice de covariance / corrélation à utiliser pour former des facteurs. Si la valeur propre associée au premier PC est grande, cela signifie que les valeurs propres …
ou: La sélection d'un domaine lors de la saisie d'un emploi réduit-elle vos futures options pour les domaines et donc les emplois? Pour rendre cette question aussi largement applicable que possible ... profession fait référence à toutes sortes d'analystes de données, des statisticiens aux programmeurs d'apprenants machine en passant par …
Contexte du problème: Dans le cadre de mes recherches, j'ai écrit deux algorithmes qui peuvent sélectionner un ensemble de fonctionnalités à partir d'un ensemble de données (données d'expression génique de patients cancéreux). Ces caractéristiques sont ensuite testées pour voir dans quelle mesure elles peuvent classer un échantillon invisible comme cancéreux …
J'ai deux questions sur l'utilisation de la forêt aléatoire (spécifiquement randomForest dans R) pour l'imputation des valeurs manquantes (dans l'espace des prédicteurs). 1) Comment fonctionne l'algorithme d'imputation - en particulier comment et pourquoi l'étiquette de classe est-elle requise pour l'imputation? la matrice de proximité qui sert à pondérer la valeur …
J'ai des problèmes à trouver une solution concernant la façon d'exécuter un test post-hoc (Tukey HSD) après une ANOVA à mesures répétées à 2 facteurs (tous deux intra-sujets) en R. Pour l'ANOVA, j'ai utilisé la fonction aov: summary(aov(dv ~ x1 * x2 + Error(subject/(x1*x2)), data=df1)) Après avoir lu les réponses …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.