Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
J'entends souvent un échantillonnage à la hausse ou à la baisse des données discutées comme moyen de traiter la classification des données déséquilibrées. Je comprends que cela pourrait être utile si vous travaillez avec un classificateur binaire (par opposition à un classificateur probabiliste ou basé sur les scores) et que …
Disons que j'ai deux conditions, et ma taille d'échantillon pour les deux conditions est extrêmement faible. Disons que je n'ai que 14 observations dans la première condition et 11 dans l'autre. Je veux utiliser le test t pour tester si les différences moyennes sont significativement différentes les unes des autres. …
J'examine les tendances (entre 1998 et 2011) des taux de mortalité chez les patients atteints de la maladie de Crohn. Chaque patient (cas) a été inclus entre 1998 et 2011. À l'inclusion, chaque patient a été apparié à un contrôle sain de même âge et de même sexe. J'analyse les …
Étant donné deux ensembles de données de nombres réels positifs X et Y, tous deux de la même taille et 0 <= Y <= X pour chaque ligne; le CDF empirique de X peut-il jamais croiser le CDF empirique de Y?
J'essaie d'estimer l'écart salarial entre hommes et femmes pour les employés de bureau masculins et féminins d'une grande entreprise suédoise afin de vérifier s'il existe une discrimination fondée sur le sexe. Le test de Hausman rejette la valeur nulle selon laquelle les effets fixes individuels sont aléatoires et, par conséquent, …
Je voudrais spécifier un modèle de régression logistique où j'ai la relation suivante: E[Yi|Xi]=f(βxi1+β2xi2)E[Yi|Xi]=f(βxi1+β2xi2)E[Y_i|X_i] = f(\beta x_{i1} + \beta^2x_{i2}) où est la fonction logit inverse.fff Existe-t-il un moyen "rapide" de le faire avec des fonctions R préexistantes ou existe-t-il un nom pour un modèle comme celui-ci? Je me rends compte …
On dit généralement que les a priori sur les statistiques bayésiennes peuvent être considérés comme des facteurs de régularisation car ils pénalisent les solutions où le précédent place une faible densité de probabilité. Ensuite, étant donné ce modèle simple dont les paramètres MLE sont: a r gm aXμ N( y; …
J'ai un tas de descriptions de poste entrées par les utilisateurs. Il y a toutes sortes de fautes d'orthographe et de mauvaises données. c'est à dire: ... tulane univ hospital tulip tullett prebon ... weik investment weill cornell university medical center weis weiss waldee hohimer dds welded constrction l.p. welder …
Dans leur livre "Multilevel Analysis: An Introduction to Basic and Advanced Multilevel Modeling" (1999), Snijders & Bosker (ch. 8, section 8.2, page 119) a déclaré que la corrélation intercept-pente, calculée comme la covariance inter-pente divisée par la racine carrée du produit de la variance d'interception et de la variance de …
Je suis relativement nouveau dans les statistiques bayésiennes, alors soyez gentil. Je viens d'effectuer le calcul bayésien approximatif (ABC) pour l'inférence d'un modèle multi-paramètres. Maintenant, je cherche à effectuer une vérification prédictive postérieure des paramètres qui ont été déduits. Ce que je veux savoir, c'est que, lors de l'échantillonnage à …
La relation entre la normale normale et les distributions du chi carré est bien connue. Je me demandais cependant, y a-t-il une transformation qui peut conduire d'un à une distribution normale standard?χ2(1)χ2(1)\chi^2 (1) On peut facilement voir que la transformation de racine carrée ne fonctionne pas car sa plage n'est …
Une personne reçoit trois articles, par exemple des images de visages, et est invitée à choisir quels sont les deux visages les plus similaires. Cette opération est répétée un grand nombre de fois avec différentes combinaisons de visages, chaque visage pouvant apparaître dans de nombreuses combinaisons. Compte tenu de ce …
Je recherche une mesure appropriée de la "variance expliquée" d'un GLM de Poisson (en utilisant une fonction log-link). J'ai trouvé un certain nombre de ressources différentes (à la fois sur ce site et ailleurs) qui discutent d'un certain nombre de différentes mesures pseudo- , mais presque tous les sites mentionnent …
Je modélise actuellement certaines données à l'aide d'une régression logistique binaire. La variable dépendante a un bon nombre de cas positifs et négatifs - elle n'est pas rare. J'ai également un grand ensemble d'entraînement (> 100 000) et le nombre d'effets principaux qui m'intéresse est d'environ 15, donc je ne …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.