Utilisez cette balise pour toute question * sur le sujet * qui (a) implique «R» en tant que partie critique de la question ou réponse attendue, et (b) n'est pas * seulement * sur la façon d'utiliser «R».
Je suis nouveau dans la science des données et j'ai du mal à trouver des clusters dans un ensemble de données avec 200 000 lignes et 50 colonnes en R. Étant donné que les données ont des variables numériques et nominales, des méthodes comme K-means qui utilise la mesure de …
Voici mon contexte pour cette question: D'après ce que je peux dire, nous ne pouvons pas exécuter une régression ordinaire des moindres carrés dans R lors de l'utilisation de données pondérées et du surveypackage. Ici, nous devons utiliser svyglm(), qui exécute à la place un modèle linéaire généralisé (qui peut …
Mes prédictions provenant d'un modèle de régression logistique (glm dans R) ne sont pas limitées entre 0 et 1 comme je m'y attendais. Ma compréhension de la régression logistique est que vos paramètres d'entrée et de modèle sont combinés linéairement et la réponse est transformée en probabilité à l'aide de …
Si je construis une matrice 2-D entièrement composée de données aléatoires, je m'attendrais à ce que les composants PCA et SVD n'expliquent essentiellement rien. Au lieu de cela, il semble que la première colonne SVD semble expliquer 75% des données. Comment cela peut-il être? Qu'est-ce que je fais mal? Voici …
Le bildpackage semble être un excellent package pour les réponses binaires en série. Mais c'est pour un temps discret. Je voudrais spécifier une fonction lisse du temps pour la connexion du rapport de cotes de la réponse actuelle Y avec des réponses binaires mesurées à des moments antérieurs, ou au …
Je recherche un package R général, propre et rapide (c'est-à-dire en utilisant des routines C ++) pour simuler des chemins à partir d'une diffusion non linéaire non homogène comme (1) en utilisant le schéma Euler-Maruyama, le schéma Milstein (ou tout autre). Celui-ci est destiné à être intégré dans un code …
Je veux prédire la hauteur des arbres dans une certaine zone en utilisant certaines variables obtenues par télédétection. Comme la biomasse approximative, etc. Je veux d'abord utiliser une régression linéaire (je sais que ce n'est pas la meilleure idée mais c'est une étape incontournable pour mon projet). Je voulais savoir …
Le "Machine Learning For Hackers" d'O'Reilly dit que chaque composant principal représente un pourcentage de la variance. J'ai cité la partie pertinente de la page ci-dessous (chapitre 8, p.207). S'adressant à un autre expert, ils ont convenu qu'il s'agissait du pourcentage. Cependant, les 24 composants totalisent 133,2095%. Comment est-ce possible? …
Ces deux fonctions existent dans R mais je ne connais pas leurs différences. Il semble qu'ils ne retournent que les mêmes valeurs p lors de l'appel wilcox.testavec correct=FALSE, et wilcox_test(dans le paquet de pièces) avec distribution="aymptotic". Pour les autres valeurs, ils renvoient des valeurs p différentes. Renvoie également wilcox.testtoujours W …
J'essaie d'exécuter un logit bayésien sur les données ici . J'utilise bayesglm()dans le armpackage en R. Le codage est assez simple: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) donne la sortie suivante: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 …
J'essaie de modéliser certaines données en utilisant le glmnetpackage dans R. Disons que j'ai les données suivantes training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Il s'agit d'une simplification; mes données sont beaucoup plus compliquées.) …
J'aimerais effectuer un test post-hoc TukeyHSD après mon Anova bidirectionnel avec R, en obtenant un tableau contenant les paires triées groupées par différence significative. (Désolé pour le libellé, je suis encore nouveau avec les statistiques.) Je voudrais avoir quelque chose comme ça: Donc, regroupé avec des étoiles ou des lettres. …
J'essaie de faire des prédictions en utilisant un modèle de forêt aléatoire dans R. Cependant, je reçois des erreurs car certains facteurs ont des valeurs différentes dans l'ensemble de test que dans l'ensemble d'entraînement. Par exemple, un facteur Cat_2a des valeurs 34, 68, 76, etc., dans l'ensemble de test qui …
Je me demandais comment générer des données à partir d'une équation de régression de Poisson dans R? Je suis un peu confus sur la façon d'aborder le problème. Donc, si je suppose que nous avons deux prédicteurs et qui sont distribués . Et l'ordonnée à l'origine est 0 et les …
En réponse à une question sur la sélection des modèles en présence de multicolinéarité , Frank Harrell a suggéré : Mettez toutes les variables dans le modèle mais ne testez pas l'effet d'une variable ajustée pour les effets des variables concurrentes ... en compétition les uns contre les autres comme …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.