Utilisez cette balise pour toute question * sur le sujet * qui (a) implique «R» en tant que partie critique de la question ou réponse attendue, et (b) n'est pas * seulement * sur la façon d'utiliser «R».
R in Action (Kabacoff, 2011) suggère la routine suivante pour tester la surdispersion dans une régression logistique: Ajuster la régression logistique en utilisant la distribution binomiale: model_binom <- glm(Species=="versicolor" ~ Sepal.Width, family=binomial(), data=iris) Ajuster la régression logistique en utilisant la distribution quasibinomiale: model_overdispersed <- glm(Species=="versicolor" ~ Sepal.Width, family=quasibinomial(), data=iris) Utilisez …
Je fais une régression linéaire en utilisant la fonction R lm: x = log(errors) plot(x,y) lm.result = lm(formula = y ~ x) abline(lm.result, col="blue") # showing the "fit" in blue mais ça ne va pas bien. Malheureusement, je ne peux pas comprendre le manuel. Quelqu'un peut-il m'orienter dans la bonne …
Est-il possible de tracer un graphique de dépendance partielle pour afficher la probabilité de classe et estimer les effets d'un prédicteur pour un modèle GBM ? Quelque chose de similaire à celui partialPlotdu randomForestpackage. Selon cet article , un tracé partiel est réalisable avec gbm. Merci d'avance pour votre aide.
J'ai des données sur les accidents de véhicules à moteur par heure de la journée. Comme vous vous en doutez, ils sont élevés en milieu de journée et culminent aux heures de pointe. geom_density par défaut de ggplot2 adoucit bien Un sous-ensemble de données, pour les collisions liées à la …
Disons que nous avons les données suivantes: set.seed(123) data <- data.frame(x = c(rnorm(50, 1, 1), rnorm(50, 5, 2)), y = c(rep('A', 50), rep('B', 50))) Ce qui donne le boxplot suivant ( boxplot(data$x ~ data$y)): Supposons maintenant que je souhaite tester si les deux échantillons ont les mêmes paramètres de localisation …
Je ne suis pas un expert, alors pardonnez-moi si une partie de la terminologie est un peu maladroite. Heureux de fournir plus d'informations si nécessaire. J'ai deux vecteurs de 50 valeurs numériques appariées dans R. Je veux effectuer un test de randomisation ou de permutation bilatéral pour déterminer si leurs …
Je me demande s'il existe un bon moyen de calculer le critère de clustering basé sur la formule BIC, pour une sortie k-means dans R? Je suis un peu confus quant à la façon de calculer ce BIC afin de pouvoir le comparer avec d'autres modèles de clustering. Actuellement, j'utilise …
Je produis un script pour créer des échantillons de bootstrap à partir de l' catsensemble de données (à partir du -MASS-package). En suivant le manuel de Davidson et Hinkley [1], j'ai effectué une régression linéaire simple et adopté une procédure fondamentale non paramétrique pour le bootstrap à partir des observations …
J'ai un grand ensemble de prédicteurs (plus de 43 000) pour prédire une variable dépendante qui peut prendre 2 valeurs (0 ou 1). Le nombre d'observations est supérieur à 45 000. La plupart des prédicteurs sont des unigrammes, des bigrammes et des trigrammes de mots, il y a donc un …
En utilisant plot.rqdans le quantregpackage de R, nous pouvons tracer la distribution d'estimation des coefficients et obtenir quelque chose comme ceci: Quelles sont les lignes rouges pointillées? Une recherche approfondie sur Google a révélé que celle du milieu est la moyenne des 99 estimations, mais ne connaît toujours pas la …
Je voudrais obtenir des intervalles de confiance de 95% pour les centroïdes sur la base de la similitude de Gower entre certains échantillons multivariés (données communautaires provenant de carottes de sédiments). Jusqu'à présent, j'ai utilisé le vegan{}package dans R pour obtenir une similitude Gower modifiée entre les cœurs (basé sur …
J'ai un ensemble de données médicales avec environ 200 variables. L'une des variables est un bio-marqueur (concentration d'une enzyme particulière). Sa distribution est asymétrique, et le problème est que les valeurs au-dessus d'un certain niveau sont censurées / coupées à ce niveau. Ainsi, alors que la moyenne de la variable …
Je me demandais si quelqu'un avait de l'expérience avec la fonction souris, comme décrit dans Souris: Imputation multivariée par équations chaînées dans R (JSS 2011 45 (3))? J'ai un ensemble de données avec un certain nombre de variables, chacune avec différents degrés de données manquantes. Ma question principale est: disons …
Nous avons un ensemble de données avec deux covariables et une variable de regroupement catégorique et nous voulons savoir s'il existe des différences significatives entre la pente ou l'ordonnée à l'origine parmi les covariables associées aux différentes variables de regroupement. Nous avons utilisé anova () et lm () pour comparer …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.