Statistiques et Big Data

Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données

1
Suréchantillonnage avec des variables catégorielles
Je voudrais effectuer une combinaison de suréchantillonnage et de sous-échantillonnage afin d'équilibrer mon ensemble de données avec environ 4000 clients divisés en deux groupes, où l'un des groupes a une proportion d'environ 15%. J'ai examiné SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) et ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), mais les deux créent de …


1
Quelle est la relation entre les mesures de fiabilité de l'échelle (alpha de Cronbach, etc.) et les charges de composant / facteur?
Disons que j'ai un ensemble de données avec des scores sur un tas d'éléments de questionnaire, qui sont théoriquement composés d'un plus petit nombre d'échelles, comme dans la recherche en psychologie. Je sais qu'une approche courante consiste à vérifier la fiabilité des échelles en utilisant l'alpha de Cronbach ou quelque …

1
test anova type III pour un GLMM
Je monte un glmermodèle dans le lme4package R. Je cherche une table anova avec une valeur de p montrée ici, mais je ne trouve aucun paquet qui lui convient. Est-il possible de le faire en R? Le modèle que je monte est de la forme: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times …

2
Comment trouver des valeurs optimales pour les paramètres de réglage dans les arbres boostés?
Je me rends compte qu'il y a 3 paramètres de réglage dans le modèle de boosting trees, c'est-à-dire le nombre d'arbres (nombre d'itérations) paramètre de rétrécissement nombre de divisions (taille de chaque arbre constitutif) Ma question est: pour chacun des paramètres de réglage, comment dois-je trouver sa valeur optimale? Et …

1
Le pouvoir en protéomique?
Les subventions nécessitent souvent une analyse de puissance pour prendre en charge une taille d'échantillon proposée. En protéomique (et la plupart des -omiques), il y a de 100 à 1000 caractéristiques / variables mesurées sur 10 échantillons (peut-être 100, mais peu probable). En outre, il est connu que certaines de …




4
Aide à interpréter un complot d'interaction?
J'ai du mal à interpréter les graphiques d'interaction lorsqu'il y a une interaction entre les deux variables indépendantes. Les graphiques suivants proviennent de ce site: Ici, et sont les variables indépendantes et DV est la variable dépendante.UNEUNEABBBD VréVDV Question: Il y a interaction et effet principal de UNEUNEA , mais …




3
Incompréhension de l'estimation de Monte Carlo Pi
Je suis assez sûr de comprendre comment fonctionne l'intégration de Monte-Carlo, mais je ne comprends pas la formulation de la façon dont elle est utilisée pour estimer Pi. Je vais suivre la procédure décrite dans la 5ème diapositive de cette présentation http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf Je comprends les étapes préliminaires. Pi est égal …

1
Distribution de probabilité des fonctions des variables aléatoires?
J'ai un doute: considérons les variables aléatoires de valeur réelle et définies sur l'espace de probabilité .XXXZZZ(Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) Soit , où est une fonction à valeur réelle. Puisque est une fonction de variables aléatoires, il s'agit d'une variable aléatoire.Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z)g(⋅)g(⋅)g(\cdot)YYY Laissez soit une réalisation de .x:=X(ω)x:=X(ω)x:=X(\omega)XXX Est égal à ?P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x)P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))

En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.