Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je lis un article et l'auteur a écrit: L'effet de A, B, C sur Y a été étudié à l'aide d'une analyse de régression multiple. A, B, C ont été entrés dans l'équation de régression avec Y comme variable dépendante. L'analyse de la variance est présentée dans le tableau 3. …
Pour évaluer les performances d'un nouvel algorithme de classificateur, j'essaie de comparer la précision et la complexité (big-O dans la formation et la classification). De Machine Learning: un examen, j'obtiens une liste complète des classificateurs supervisés, ainsi qu'un tableau de précision entre les algorithmes et 44 problèmes de test du …
Je cherche une méthode pour calculer la zone de chevauchement entre deux estimations de densité de noyau dans R, comme mesure de similitude entre deux échantillons. Pour clarifier, dans l'exemple suivant, il me faudrait quantifier l'aire de la région de chevauchement violacé: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), …
J'ai lu dans Abdi (2003) que Lorsque les variables indépendantes sont orthogonales par paire, l'effet de chacune d'elles dans la régression est évalué en calculant la pente de la régression entre cette variable indépendante et la variable dépendante. Dans ce cas (c'est-à-dire l'orthogonalité des IV), les coefficients de régression partielle …
J'ai parcouru divers fils ici, mais je ne pense pas que ma question exacte soit répondue. J'ai un ensemble de données d'environ 50 000 étudiants et leur temps d'abandon. Je vais effectuer une régression des risques proportionnels avec un grand nombre de covariables potentielles. Je vais également faire une régression …
J'utilise vowpal wabbit pour résoudre un problème de bandit contextuel . Je montre des publicités aux utilisateurs, et j'ai pas mal d'informations sur le contexte dans lequel la publicité est diffusée (par exemple, qui est l'utilisateur, sur quel site il se trouve, etc.). Cela semble être un problème de bandit …
le problème suivant est apparu récemment lors de l'analyse des données. Si la variable aléatoire X suit une distribution normale et Y suit une distribution χ2nχn2\chi^2_n (avec n ddl), comment Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2 distribué? Jusqu'à présent, je suis venu avec le pdf de Y2Y2Y^2 : ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& …
Quel est le meilleur logiciel de visualisation de données open source? J'ai besoin des éléments suivants: Peut importer des données à partir de Microsoft Excel (l'importation de données à partir de bases de données Oracle serait également bonne, mais ce n'est pas obligatoire). Les graphiques générés par le logiciel peuvent …
J'ai des données de test où j'ai plusieurs grands échantillons de distributions discrètes que j'utilise comme distributions empiriques. Je veux tester si les distributions sont réellement différentes et quelle est la différence de moyennes pour ces distributions qui sont réellement différentes. Puisqu'il s'agit de distributions discrètes, je crois comprendre que …
Comme motivé par le récent changement de la statistique de sélection de modèle par défaut dans l'ensemble de prévisions du R de AIC à AICc, je suis curieux de savoir si ce dernier est effectivement applicable où que ce soit le premier. J'ai une série de questions à ce sujet …
Dans une variante du problème du collecteur de coupons , vous ne connaissez pas le nombre de coupons et devez le déterminer en fonction des données. J'appellerai cela le problème du cookie de fortune: Étant donné un nombre inconnu de messages distincts sur les cookies de fortune , estimez en …
À partir de la page Wikipedia sur les intervalles de confiance : ... si des intervalles de confiance sont construits sur de nombreuses analyses de données distinctes d'expériences répétées (et éventuellement différentes), la proportion de ces intervalles qui contiennent la vraie valeur du paramètre correspondra au niveau de confiance ... …
À partir de wikipedia , la corrélation de rang de Spearman est calculée en convertissant les variables X iXiX_i et Y iYiY_i en variables classées x ixix_i et y iyiy_i , puis en calculant la corrélation de Pearson entre les variables classées: Cependant, l'article poursuit en déclarant que s'il n'y …
J'examine actuellement certains travaux et suis tombé sur les suivants, ce qui me semble faux. Deux modèles mixtes sont montés (en R) à l'aide de lmer. Les modèles ne sont pas imbriqués et sont comparés par des tests de rapport de vraisemblance. En bref, voici un exemple reproductible de ce …
Je sais que cela pourrait être un peu compliqué, statistiquement, mais c'est mon problème. J'ai beaucoup de données de plage, c'est-à-dire la taille minimum, maximum et échantillon d'une variable. Pour certaines de ces données, j'ai également une moyenne, mais pas beaucoup. Je veux comparer ces gammes entre elles pour quantifier …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.