Q & A pour les personnes intéressées par les statistiques, l'apprentissage automatique, l'analyse de données, l'exploration de données et la visualisation de données
Je voudrais effectuer une combinaison de suréchantillonnage et de sous-échantillonnage afin d'équilibrer mon ensemble de données avec environ 4000 clients divisés en deux groupes, où l'un des groupes a une proportion d'environ 15%. J'ai examiné SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) et ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), mais les deux créent de …
Je travaille sur la validation croisée de la prédiction de mes données avec 200 sujets et 1000 variables. Je suis intéressé par la régression des crêtes car le nombre de variables (que je veux utiliser) est supérieur au nombre d'échantillons. Je veux donc utiliser des estimateurs de retrait. Voici des …
Disons que j'ai un ensemble de données avec des scores sur un tas d'éléments de questionnaire, qui sont théoriquement composés d'un plus petit nombre d'échelles, comme dans la recherche en psychologie. Je sais qu'une approche courante consiste à vérifier la fiabilité des échelles en utilisant l'alpha de Cronbach ou quelque …
Je monte un glmermodèle dans le lme4package R. Je cherche une table anova avec une valeur de p montrée ici, mais je ne trouve aucun paquet qui lui convient. Est-il possible de le faire en R? Le modèle que je monte est de la forme: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times …
Je me rends compte qu'il y a 3 paramètres de réglage dans le modèle de boosting trees, c'est-à-dire le nombre d'arbres (nombre d'itérations) paramètre de rétrécissement nombre de divisions (taille de chaque arbre constitutif) Ma question est: pour chacun des paramètres de réglage, comment dois-je trouver sa valeur optimale? Et …
Les subventions nécessitent souvent une analyse de puissance pour prendre en charge une taille d'échantillon proposée. En protéomique (et la plupart des -omiques), il y a de 100 à 1000 caractéristiques / variables mesurées sur 10 échantillons (peut-être 100, mais peu probable). En outre, il est connu que certaines de …
J'ai une question sur la façon de modéliser le texte sur les données de comptage, en particulier comment pourrais-je utiliser la lassotechnique pour réduire les fonctionnalités. Supposons que j'ai N articles en ligne et le nombre de pages vues pour chaque article. J'ai extrait 1 gramme et 2 grammes pour …
La question dit tout. J'ai lu à la fois que l'on ne peut pas généraliser KS à une dimension égale ou supérieure à deux , et que les implémentations célèbres comme celle dans les recettes numériques sont tout simplement erronées. Pourriez-vous expliquer pourquoi?
J'ai un ensemble de données d'environ 5000 fonctionnalités. Pour ces données, j'ai d'abord utilisé le test du chi carré pour la sélection des fonctionnalités; après cela, j'ai obtenu environ 1500 variables qui ont montré une relation de signification avec la variable de réponse. Maintenant, je dois ajuster la régression logistique …
J'ai du mal à interpréter les graphiques d'interaction lorsqu'il y a une interaction entre les deux variables indépendantes. Les graphiques suivants proviennent de ce site: Ici, et sont les variables indépendantes et DV est la variable dépendante.UNEUNEABBBD VréVDV Question: Il y a interaction et effet principal de UNEUNEA , mais …
J'ai une fonction qui renvoie un temps d'attente moyen pour un internaute. Autrement dit, cela donne un temps moyen qu'un utilisateur moyen peut rester sur une page Web, étant donné la longueur des ressources Web en mots. Je veux utiliser cette fonction (et la moyenne résultante) conjointement avec une distribution …
Je recherche un algorithme de régression linéaire qui convient le mieux à des données dont la variable indépendante (x) a une erreur de mesure constante et la variable dépendante (y) a une erreur dépendante du signal. L'image ci-dessus illustre ma question.
Je veux inclure le terme et son carré (variables prédictives) dans une régression parce que je suppose que les faibles valeurs de ont un effet positif sur la variable dépendante et les valeurs élevées ont un effet négatif. Le devrait capturer l'effet des valeurs plus élevées. J'espère donc que le …
Je suis assez sûr de comprendre comment fonctionne l'intégration de Monte-Carlo, mais je ne comprends pas la formulation de la façon dont elle est utilisée pour estimer Pi. Je vais suivre la procédure décrite dans la 5ème diapositive de cette présentation http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf Je comprends les étapes préliminaires. Pi est égal …
J'ai un doute: considérons les variables aléatoires de valeur réelle et définies sur l'espace de probabilité .XXXZZZ(Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) Soit , où est une fonction à valeur réelle. Puisque est une fonction de variables aléatoires, il s'agit d'une variable aléatoire.Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z)g(⋅)g(⋅)g(\cdot)YYY Laissez soit une réalisation de .x:=X(ω)x:=X(ω)x:=X(\omega)XXX Est égal à ?P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x)P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.