Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je veux faire une régression logistique ordinale dans R sans l'hypothèse de cotes de proportionnalité. Je sais que cela peut être fait directement en utilisant la vglm()fonction en Rdéfinissant parallel=FALSE. Mais mon problème est de savoir comment corriger un ensemble particulier de coefficients dans cette configuration de régression? Par exemple, …
Voici un tracé QQ pour mon échantillon (notez l'axe Y logarithmique); :n = 1000n=1000n = 1000 Comme l'a souligné whuber, cela indique que la distribution sous-jacente est asymétrique à gauche (la queue droite est plus courte). En utilisant shapiro.test(sur les données transformées par log) dans R, j'obtiens une statistique de …
Dans un modèle de risques proportionnels de Cox avec de nombreuses variables, si les résidus de Schoenfeld ne sont pas plats pour l'une des variables, cela invalide-t-il le modèle entier ou peut-on simplement ignorer la variable peu performante? C'est-à-dire, interpréter les coefficients pour les autres variables, mais ne pas interpréter …
Je voudrais générer des données avec "Model 1" et les adapter avec "Model 2". L'idée sous-jacente est d'étudier les propriétés de robustesse du «modèle 2». Je suis particulièrement intéressé par le taux de couverture de l'intervalle de confiance à 95% (basé sur l'approximation normale). Comment définir le nombre d'exécutions d'itérations? …
J'ai exécuté un glm dans R, et près du bas de la summary()sortie, il indique (Dispersion parameter for gaussian family taken to be 28.35031) J'ai fait quelques recherches sur Google et j'ai appris que le paramètre de dispersion est utilisé pour ajuster les erreurs standard. J'espère que quelqu'un pourrait fournir …
Après avoir lu le chapitre 3 des Éléments de l'apprentissage statistique (Hastie, Tibshrani & Friedman), je me suis demandé s'il était possible de mettre en œuvre les fameuses méthodes de rétrécissement citées sur le titre de cette question étant donné une structure de covariance, c'est-à-dire minimiser la (peut-être plus générale …
J'ai une formation de deuxième cycle en mathématiques pures (théorie des mesures, analyse fonctionnelle, algèbre d'opérateur, etc.). J'ai également un travail qui nécessite une certaine connaissance de la théorie des probabilités (des principes de base aux techniques d'apprentissage automatique). Ma question: quelqu'un peut-il fournir des lectures canoniques et des documents …
Lorsque je détermine mon lambda par validation croisée, tous les coefficients deviennent nuls. Mais j'ai quelques indices dans la littérature que certains des prédicteurs devraient définitivement affecter le résultat. Est-ce une foutaise de choisir arbitrairement lambda pour qu'il y ait autant de parcimonie qu'on le souhaite? Je veux sélectionner les …
Existe-t-il une interprétation bayésienne, ML ou MDL connue de la validation croisée? Puis-je interpréter la validation croisée comme effectuant la bonne mise à jour sur une version antérieure spécialement conçue?
Mon objectif est d'utiliser les coefficients dérivés de recherches antérieures sur le sujet pour prédire les résultats réels compte tenu d'un ensemble de variables indépendantes. Cependant, le document de recherche ne répertorie que les coefficients bêta et la valeur t. Je voudrais savoir s'il est possible de convertir les coefficients …
Si quelqu'un fait une déclaration comme ci-dessous: "Dans l'ensemble, les non-fumeurs exposés à la fumée ambiante avaient un risque relatif de maladie coronarienne de 1,25 (intervalle de confiance à 95%, 1,17 à 1,32) par rapport aux non-fumeurs non exposés à la fumée." Quel est le risque relatif pour l'ensemble de …
Je connais le test de réinitialisation Ramsey qui peut détecter des dépendances non linéaires. Cependant, si vous jetez simplement l'un des coefficients de régression (simplement des dépendances linéaires), vous pouvez obtenir un biais, selon les corrélations. Ceci n'est évidemment pas détecté par le test de réinitialisation. Je n'ai pas trouvé …
Dans sa réponse à ma question précédente, @Erik P. donne l'expression où est l' excès de kurtosis de la distribution. Une référence à l'entrée Wikipedia sur la distribution de la variance de l'échantillon est donnée, mais la page wikipedia dit "la citation nécessaire".Var[s2]=σ4(2n−1+κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Ma …
Contexte: Une méta-analyse typique en psychologie pourrait chercher à modéliser la corrélation entre deux variables X et Y. L'analyse impliquerait généralement d'obtenir un ensemble de corrélations pertinentes à partir de la littérature ainsi que la taille des échantillons. Des formules peuvent ensuite être appliquées pour calculer une corrélation moyenne pondérée. …
Je suis un informaticien travaillant dans l'exploration de données. Ce n'est pas un secret pour dire que les informaticiens sont assez faibles pour faire une conception expérimentale systématique et une évaluation - l'utilisation des valeurs de p et des estimations de confiance est considérée comme avancée :). Ce que j'aimerais …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.