Questions marquées «regression»

Techniques d'analyse de la relation entre une (ou plusieurs) variables "dépendantes" et des variables "indépendantes".

5
Est-ce de la triche de laisser tomber les valeurs aberrantes basées sur la boîte à moustaches de l'erreur absolue moyenne pour améliorer un modèle de régression
J'ai un modèle de prédiction testé avec quatre méthodes, comme vous pouvez le voir dans la figure ci-dessous. L'attribut prédit par le modèle est compris entre 0 et 8. Vous pouvez remarquer qu'il existe une valeur aberrante supérieure et trois valeurs aberrantes inférieures indiquées par toutes les méthodes. Je me …

1
Un estimateur non biaisé du rapport de deux coefficients de régression?
Supposons que vous ajustiez une régression linéaire / logistique , dans le but d'une estimation non biaisée de . Vous êtes très confiant que et sont très positifs par rapport au bruit dans leurs estimations.a 1g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2 a1a2a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 Si vous avez la covariance …

4
La précision de la machine augmentant le gradient diminue à mesure que le nombre d'itérations augmente
J'expérimente l'algorithme de la machine de renforcement de gradient via le caretpackage en R. À l'aide d'un petit ensemble de données d'admission à l'université, j'ai exécuté le code suivant: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

1
Comprendre la décomposition QR
J'ai un exemple travaillé (en R), que j'essaie de mieux comprendre. J'utilise Limma pour créer un modèle linéaire et j'essaie de comprendre ce qui se passe pas à pas dans les calculs de changement de pli. J'essaie surtout de comprendre ce qui se passe pour calculer les coefficients. D'après ce …

1
Autres estimateurs non biaisés que le BLEU (solution OLS) pour les modèles linéaires
Pour un modèle linéaire, la solution OLS fournit le meilleur estimateur linéaire sans biais pour les paramètres. Bien sûr, nous pouvons échanger un biais pour une variance plus faible, par exemple la régression des crêtes. Mais ma question concerne l'absence de parti pris. Existe-t-il d'autres estimateurs quelque peu couramment utilisés, …

2
Question sur le compromis biais-variance
J'essaie de comprendre le compromis biais-variance, la relation entre le biais de l'estimateur et le biais du modèle, et la relation entre la variance de l'estimateur et la variance du modèle. Je suis arrivé à ces conclusions: Nous avons tendance à surajuster les données lorsque nous négligeons le biais de …

1
Régression en
J'essaie de voir s'il faut opter pour la régression de crête , LASSO , la régression en composantes principales (PCR) ou les moindres carrés partiels (PLS) dans une situation où il y a un grand nombre de variables / caractéristiques ( ) et un plus petit nombre d'échantillons ( n …

3
Prédire la variance des données hétéroscédastiques
J'essaie de faire une régression sur des données hétéroscédastiques où j'essaie de prédire les variances d'erreur ainsi que les valeurs moyennes en termes de modèle linéaire. Quelque chose comme ça: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(X,t)=σ0+cX+rét.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} En d'autres termes, les données consistent …

4
Pièges à éviter lors de la transformation des données?
J'ai réalisé une forte relation linéaire entre ma variable et après avoir doublement transformé la réponse. Le modèle était mais je l'ai transformé en améliorant de 0,19 à 0,76.XXXYYYY∼XY∼XY\sim XYX−−√∼X−−√YX∼X\sqrt{\frac{Y}{X}}\sim \sqrt{X}R2R2R^2 De toute évidence, j'ai fait une chirurgie décente sur cette relation. Quelqu'un peut-il discuter des écueils de cette démarche, …

1
Quelle est l'intuition derrière les échantillons échangeables sous l'hypothèse nulle?
Les tests de permutation (également appelés test de randomisation, test de re-randomisation ou test exact) sont très utiles et s'avèrent utiles lorsque l'hypothèse de distribution normale requise par exemple t-testn'est pas remplie et lorsque la transformation des valeurs par classement des un test non paramétrique comme Mann-Whitney-U-testcela entraînerait la perte …
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

4
Comment puis-je effectuer une régression sur des données non normales qui restent non normales une fois transformées?
J'ai quelques données (158 cas) qui ont été dérivées d'une réponse d'échelle de Likert à 21 éléments de questionnaire. Je veux / dois vraiment effectuer une analyse de régression pour voir quels éléments du questionnaire prédisent la réponse à un élément global (satisfaction). Les réponses ne sont pas normalement distribuées …

2
Signification précise et comparaison entre point influent, point de levier élevé et valeur aberrante?
De Wikipédia Les observations influentes sont celles qui ont un effet relativement important sur les prévisions du modèle de régression. De Wikipédia Les points de levier sont les observations, le cas échéant, faites à des valeurs extrêmes ou périphériques des variables indépendantes de sorte que le manque d'observations voisines signifie …




En utilisant notre site, vous reconnaissez avoir lu et compris notre politique liée aux cookies et notre politique de confidentialité.
Licensed under cc by-sa 3.0 with attribution required.