Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Comment fixer un coefficient dans une régression logistique ordinale sans hypothèse de cotes proportionnelles dans R?
Je veux faire une régression logistique ordinale dans R sans l'hypothèse de cotes de proportionnalité. Je sais que cela peut être fait directement en utilisant la vglm()fonction en Rdéfinissant parallel=FALSE. Mais mon problème est de savoir comment corriger un ensemble particulier de coefficients dans cette configuration de régression? Par exemple, …
11 r  regression  logistic 


1
Résidus de Schoenfeld
Dans un modèle de risques proportionnels de Cox avec de nombreuses variables, si les résidus de Schoenfeld ne sont pas plats pour l'une des variables, cela invalide-t-il le modèle entier ou peut-on simplement ignorer la variable peu performante? C'est-à-dire, interpréter les coefficients pour les autres variables, mais ne pas interpréter …

3
Etude de simulation: comment choisir le nombre d'itérations?
Je voudrais générer des données avec "Model 1" et les adapter avec "Model 2". L'idée sous-jacente est d'étudier les propriétés de robustesse du «modèle 2». Je suis particulièrement intéressé par le taux de couverture de l'intervalle de confiance à 95% (basé sur l'approximation normale). Comment définir le nombre d'exécutions d'itérations? …

2
Paramètre de dispersion dans la sortie GLM
J'ai exécuté un glm dans R, et près du bas de la summary()sortie, il indique (Dispersion parameter for gaussian family taken to be 28.35031) J'ai fait quelques recherches sur Google et j'ai appris que le paramètre de dispersion est utilisé pour ajuster les erreurs standard. J'espère que quelqu'un pourrait fournir …

1
Ridge et LASSO ont une structure de covariance?
Après avoir lu le chapitre 3 des Éléments de l'apprentissage statistique (Hastie, Tibshrani & Friedman), je me suis demandé s'il était possible de mettre en œuvre les fameuses méthodes de rétrécissement citées sur le titre de cette question étant donné une structure de covariance, c'est-à-dire minimiser la (peut-être plus générale …

2
Introduction à la probabilité appliquée pour les mathématiciens purs?
J'ai une formation de deuxième cycle en mathématiques pures (théorie des mesures, analyse fonctionnelle, algèbre d'opérateur, etc.). J'ai également un travail qui nécessite une certaine connaissance de la théorie des probabilités (des principes de base aux techniques d'apprentissage automatique). Ma question: quelqu'un peut-il fournir des lectures canoniques et des documents …

3
Dans quelle mesure est-il défendable de choisir
Lorsque je détermine mon lambda par validation croisée, tous les coefficients deviennent nuls. Mais j'ai quelques indices dans la littérature que certains des prédicteurs devraient définitivement affecter le résultat. Est-ce une foutaise de choisir arbitrairement lambda pour qu'il y ait autant de parcimonie qu'on le souhaite? Je veux sélectionner les …
11 lasso 



5
Intervalle de confiance et probabilité - où est l'erreur dans cette déclaration?
Si quelqu'un fait une déclaration comme ci-dessous: "Dans l'ensemble, les non-fumeurs exposés à la fumée ambiante avaient un risque relatif de maladie coronarienne de 1,25 (intervalle de confiance à 95%, 1,17 à 1,32) par rapport aux non-fumeurs non exposés à la fumée." Quel est le risque relatif pour l'ensemble de …


2
Référence pour ?
Dans sa réponse à ma question précédente, @Erik P. donne l'expression où est l' excès de kurtosis de la distribution. Une référence à l'entrée Wikipedia sur la distribution de la variance de l'échantillon est donnée, mais la page wikipedia dit "la citation nécessaire".Var[s2]=σ4(2n−1+κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Ma …

2
Pourquoi ne pas effectuer une méta-analyse sur des données partiellement simulées?
Contexte: Une méta-analyse typique en psychologie pourrait chercher à modéliser la corrélation entre deux variables X et Y. L'analyse impliquerait généralement d'obtenir un ensemble de corrélations pertinentes à partir de la littérature ainsi que la taille des échantillons. Des formules peuvent ensuite être appliquées pour calculer une corrélation moyenne pondérée. …


En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.