Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Quelqu'un connaît-il une méthode pour comparer deux variables avec un test du chi carré si les variables proviennent d'enquêtes différentes avec des svydesign()énoncés différents ? Je cherche à tester une différence dans une distribution variable sur deux vagues d'une enquête, mais l' svychisq()énoncé est limité à un objet de conception. …
Un peu comme une boîte à moustaches. Je ne veux pas nécessairement dire l'intervalle de confiance supérieur standard, l'intervalle de confiance inférieur, la moyenne et les diagrammes en boîte montrant la plage de données, mais je veux dire comme un diagramme en boîte avec seulement les trois éléments de données: …
En régression linéaire, les transformations des variables explicatives sont effectuées pour avoir une corrélation maximale avec la variable dépendante. Quelle est la meilleure mesure pour choisir entre plusieurs transformations dans la régression logistique, car la variable dépendante est binaire et non continue? L'objectif final est de maximiser la portance (puissance …
J'ai lu que la validation croisée avec abandon fournit une «estimation sans biais de la véritable performance de généralisation» (par exemple ici ) et que c'est une propriété avantageuse du CV avec abandon. Cependant, je ne vois pas comment cela découle des propriétés du CV à laisser-un. Pourquoi le biais …
Je travaille sur un modèle d'apprentissage de catégorie en ligne qui utilise la descente de gradient stochastique pour s'adapter à un modèle de mélange gaussien. Le modèle est basé sur le modèle d'apprentissage en ligne utilisé dans Toscano et McMurray (2010). Bien que la descente de gradient semble fonctionner assez …
Je veux inclure des échantillons de poids dans mon modèle de régression quantile, mais je ne sais pas comment procéder. J'ai déjà défini mon poids, qui sont des poids répliqués déjà donnés dans l'ensemble de données d'enquête (calculé dans le package d'enquête): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") et mon modèle rq …
La distance de Mahalanobis, lorsqu'elle est utilisée à des fins de classification, suppose généralement une distribution normale multivariée, et les distances par rapport au centroïde doivent ensuite suivre une (avec degrés de liberté égaux au nombre de dimensions / caractéristiques). Nous pouvons calculer la probabilité qu'un nouveau point de données …
J'ai besoin d'un seul ensemble de données imputées (par exemple, pour créer un mannequin de groupe de pays à partir des données imputées sur le revenu par habitant du pays). R propose des packages de packages pour créer plusieurs données imputées (par exemple Amelia) et combiner les résultats de plusieurs …
Je me réfère à ce post qui semble remettre en question l'importance de la distribution normale des résidus, en faisant valoir que cela, ainsi que l'hétéroskédasticité, pourraient potentiellement être évités en utilisant des erreurs standard robustes. J'ai envisagé diverses transformations - racines, journaux, etc. - et tout se révèle inutile …
De Wikipédia Le modèle linéaire général (GLM) est un modèle linéaire statistique. Il peut être écrit comme 1 où est une matrice avec une série de mesures multivariées, est une matrice qui pourrait être une matrice de conception , est une matrice contenant des paramètres qui sont généralement à estimer …
Plusieurs articles ( ici et ici ) suggèrent que la régression bêta est plus appropriée lorsque la variable dépendante est naturellement limitée entre 0 et 1. Ma question est, en laissant de côté la pertinence, est-il techniquement incorrect d'adapter une régression logistique à une variable de réponse proportionnelle? R lancera …
J'examine les captures de rongeurs sur six grilles de piégeage de rongeurs permanentes mesurant 150 x 150 mètres et comprenant 121 stations de piégeage régulièrement espacées de 15 mètres. Il y a six de ces grilles de piégeage sur le site d'étude d'une superficie <1 000 hectares. Je voudrais interpoler …
Je travaille sur un modèle reposant sur une vilaine fonction paramétrée faisant office de fonction de calibration sur une partie du modèle. En utilisant un paramètre bayésien, j'ai besoin d'obtenir des priors non informatifs pour les paramètres décrivant ma fonction. Je sais que dans l'idéal, je devrais dériver la référence …
J'ai 2 études examinant la réponse du patient au même médicament. L'étude 1 a trouvé 10 000 gènes exprimés au-dessus du fond et 500 d'entre eux sont différentiellement exprimés et appelés signature de réponse au médicament. L'étude 2 a trouvé 1 000 gènes représentant la signature de la réponse au …
J'essaie d'exécuter une régression de Cox sur un échantillon de données de 2 000 000 lignes comme suit en utilisant uniquement R. Il s'agit d'une traduction directe d'un PHREG dans SAS. L'échantillon est représentatif de la structure de l'ensemble de données d'origine. ## library(survival) ### Replace 100000 by 2,000,000 test …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.