Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Conception de l'enquête Chi Square
Quelqu'un connaît-il une méthode pour comparer deux variables avec un test du chi carré si les variables proviennent d'enquêtes différentes avec des svydesign()énoncés différents ? Je cherche à tester une différence dans une distribution variable sur deux vagues d'une enquête, mais l' svychisq()énoncé est limité à un objet de conception. …
8 r  chi-squared  survey 

7
Tracer des barres d'intervalle de confiance à partir de statistiques récapitulatives
Un peu comme une boîte à moustaches. Je ne veux pas nécessairement dire l'intervalle de confiance supérieur standard, l'intervalle de confiance inférieur, la moyenne et les diagrammes en boîte montrant la plage de données, mais je veux dire comme un diagramme en boîte avec seulement les trois éléments de données: …

3
Choisir entre les transformations de la régression logistique
En régression linéaire, les transformations des variables explicatives sont effectuées pour avoir une corrélation maximale avec la variable dépendante. Quelle est la meilleure mesure pour choisir entre plusieurs transformations dans la régression logistique, car la variable dépendante est binaire et non continue? L'objectif final est de maximiser la portance (puissance …



2
Poids dans la régression quantile pour une enquête complexe dans R
Je veux inclure des échantillons de poids dans mon modèle de régression quantile, mais je ne sais pas comment procéder. J'ai déjà défini mon poids, qui sont des poids répliqués déjà donnés dans l'ensemble de données d'enquête (calculé dans le package d'enquête): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") et mon modèle rq …

1
Distance de Mahalanobis sur des données non normales
La distance de Mahalanobis, lorsqu'elle est utilisée à des fins de classification, suppose généralement une distribution normale multivariée, et les distances par rapport au centroïde doivent ensuite suivre une (avec degrés de liberté égaux au nombre de dimensions / caractéristiques). Nous pouvons calculer la probabilité qu'un nouveau point de données …

2
Comment combiner plusieurs jeux de données imputés?
J'ai besoin d'un seul ensemble de données imputées (par exemple, pour créer un mannequin de groupe de pays à partir des données imputées sur le revenu par habitant du pays). R propose des packages de packages pour créer plusieurs données imputées (par exemple Amelia) et combiner les résultats de plusieurs …

2
Non-normalité dans les résidus
Je me réfère à ce post qui semble remettre en question l'importance de la distribution normale des résidus, en faisant valoir que cela, ainsi que l'hétéroskédasticité, pourraient potentiellement être évités en utilisant des erreurs standard robustes. J'ai envisagé diverses transformations - racines, journaux, etc. - et tout se révèle inutile …


2
Est-il techniquement «valide» d'adapter une régression logistique à une variable dépendante qui est une proportion?
Plusieurs articles ( ici et ici ) suggèrent que la régression bêta est plus appropriée lorsque la variable dépendante est naturellement limitée entre 0 et 1. Ma question est, en laissant de côté la pertinence, est-il techniquement incorrect d'adapter une régression logistique à une variable de réponse proportionnelle? R lancera …

1
Stationnarité - hypothèses et examen
J'examine les captures de rongeurs sur six grilles de piégeage de rongeurs permanentes mesurant 150 x 150 mètres et comprenant 121 stations de piégeage régulièrement espacées de 15 mètres. Il y a six de ces grilles de piégeage sur le site d'étude d'une superficie <1 000 hectares. Je voudrais interpoler …

1
Choisir des priors non informatifs
Je travaille sur un modèle reposant sur une vilaine fonction paramétrée faisant office de fonction de calibration sur une partie du modèle. En utilisant un paramètre bayésien, j'ai besoin d'obtenir des priors non informatifs pour les paramètres décrivant ma fonction. Je sais que dans l'idéal, je devrais dériver la référence …

2
Comment appliquer la correction de tests multiples pour le chevauchement de la liste de gènes à l'aide de R
J'ai 2 études examinant la réponse du patient au même médicament. L'étude 1 a trouvé 10 000 gènes exprimés au-dessus du fond et 500 d'entre eux sont différentiellement exprimés et appelés signature de réponse au médicament. L'étude 2 a trouvé 1 000 gènes représentant la signature de la réponse au …

2
Régression de Cox à grande échelle avec R (Big Data)
J'essaie d'exécuter une régression de Cox sur un échantillon de données de 2 000 000 lignes comme suit en utilisant uniquement R. Il s'agit d'une traduction directe d'un PHREG dans SAS. L'échantillon est représentatif de la structure de l'ensemble de données d'origine. ## library(survival) ### Replace 100000 by 2,000,000 test …

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.