Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'ai exécuté quatre programmes en a, b, c, d parallèle sur deux machines différentes Xet Yséparément pendant 10 fois. Ce qui suit est un échantillon des données. Les temps d'exécution (millisecondes) des 10exécutions de chaque programme sont indiqués sous leurs noms respectifs. Machine-X: a b c d 29 40 21 …
Supposons qu'une certaine maladie ( ) ait une prévalence de . Supposons également qu'un certain symptôme ( ) ait une prévalence (dans la population générale = personnes atteintes de cette maladie D et personnes sans cette maladie [probablement avec une autre maladie, mais ce n'est pas important]) de . Dans …
J'ai un ensemble de données de plus de 11 000 éléments distincts, chacun étant classé sur une échelle nominale par au moins 3 évaluateurs différents sur Mechanical Turk d' Amazon . 88 évaluateurs différents ont rendu des jugements pour la tâche, et aucun évaluateur n'a rendu plus de 800 jugements. …
J'ai besoin de quelques suggestions pour la méthode de clustering (classification non supervisée) pour un projet de conseil. Je recherche une méthode qui, espérons-le, possède les propriétés suivantes: Le sujet de mon étude a trois propriétés. L'une est représentée par une matrice de distance (non euclidienne) et les deux autres …
Considérez l'expérience de biologie cellulaire suivante. Nous comparons différents traitements de cellules en culture. Chaque traitement est répliqué dans plusieurs puits (microtitrage) , indexés par la variable . Pour mesurer la réponse au traitement dans le puits , un total de micrographies ou champs non chevauchants sont enregistrés. Ensuite, pour …
Je travaille avec des données de séquence qui sont de longues listes d'appels win-api de logiciels malveillants. J'essaie de jeter le problème de l'identification du «comportement de malware» dans celui de trouver des modèles séquentiels. Je traite chaque appel d'API comme un élément unique. Le nombre d'éléments différents possibles (appels …
Sur la base d'une réponse sur la validation croisée, j'ai cherché à implémenter une forêt aléatoire en .NET / C # pour classer les documents de texte. En parcourant le Web pour voir s'il existe des implémentations existantes, je suis tombé sur un algorithme pour une forêt de décision sur …
Disons que j'ai collecté un petit nombre (N) d'observations pour une hypothèse que j'aimerais tester. Je pourrais utiliser la méthode bootstrap pour produire une distribution d'échantillon pour le résultat moyen de N observations, mais je crains que ce modèle ne se décompose lorsque N devient très petit, introduisant une erreur …
Je travaille sur un modèle de prévision basé sur ANN pour une série temporelle financière. J'utilise la validation croisée 5 fois et les performances moyennes sont ainsi. Les performances sur le dernier pli (l'itération où le dernier segment est omis de la formation et utilisé pour la validation) sont meilleures …
Contexte: Huit médecins ont chacun évalué les mêmes 54 patients sur une mesure de persuasion (échelle de 1-7 Likert). Le score moyen sur la mesure de persuasion sera finalement la mesure des résultats de mon expérience. La fiabilité inter-évaluateurs a été quantifiée comme le coefficient de corrélation intraclasse (ICC), en …
Je voudrais trouver une solution pour effectuer un modèle à effets mixtes de régression quantile. De ma recherche Google, je n'ai pas pu trouver une implémentation R pour une telle procédure (seulement des avertissements que " ce n'est pas pour les timides "). Je voudrais résoudre une situation simple où …
J'essaie d'utiliser le clustering de la canopée pour fournir des clusters initiaux pour KMeans dans mahout. Existe-t-il un moyen de déterminer / approximer les valeurs des seuils de distance T1 et T2 de manière algorithmique? En ce moment, j'ai T1 = 100 et T2 = 1, ce qui ne semble …
J'essaie de comprendre comment dinterval () fonctionne dans JAGS pour les données censurées. Je modélise des données grossières où je n'ai que des limites supérieures et inférieures pour chaque point de données (pas la vraie valeur). Voici un exemple simple de la façon dont je pense que cela devrait fonctionner: …
J'ai un ensemble de données de repères et sous-échantillons dans chaque repère. J'exécute ces benchmarks et leurs sous-échantillons sur machines soumises. Les «individus» étudiés par les sous-échantillons sont les mêmes pour chaque machine sujet, et les repères sont les mêmes pour chaque machine sujet.nnnmmmppp Comment réaliser une ANOVA en R …
En régression multiple, si un test F global est significatif, les tests t (ou tests Wald) pour les coefficients sont-ils considérés comme des comparaisons multiples et des tests post hoc et doivent-ils être ajustés?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.