Vous devez ajuster X ainsi que Y pour le confondant
La première approche (utilisant la régression multiple) est toujours correcte. Votre deuxième approche n'est pas correcte comme vous l'avez dit, mais peut être rendue presque correcte avec un léger changement. Pour que la deuxième approche soit correcte, vous devez régresser les deuxOui et X séparément sur Z. J'aime écrireOui. Z pour les résidus de la régression de Oui sur Z et X. Z pour les résidus de la régression de X et Z. Nous pouvons interpréterOui. Z comme Y ajusté pour Z (identique à votre R) et X.Z comme X ajusté pour Z. Vous pouvez ensuite régresserY.Z sur X.Z.
Avec ce changement, les deux approches donneront le même coefficient de régression et les mêmes résidus. Cependant, la deuxième approche ne calculera toujours pas correctement les degrés de liberté résiduelsn−1 au lieu de n−2 (où nest le nombre de valeurs de données pour chaque variable). En conséquence, la statistique de test pourXde la deuxième approche sera légèrement trop grande et la valeur de p sera légèrement trop petite. Si le nombre d'observationsn est grand, alors les deux approches convergeront et cette différence n'aura pas d'importance.
Il est facile de voir pourquoi les degrés de liberté résiduels par rapport à la deuxième approche ne seront pas tout à fait corrects. Les deux approches régressentY à la fois X et Z. La première approche le fait en une seule étape tandis que la seconde approche le fait en deux étapes. Cependant, la deuxième approche "oublie" queY.Z résulte d'une régression sur Z et néglige donc de soustraire le degré de liberté de cette variable.
Le graphique variable ajouté
Sanford Weisberg (régression linéaire appliquée, 1985) recommandait le tracé Y.Z contre X.Zdans un nuage de points. Cela a été appelé un graphique variable ajouté , et il a donné une représentation visuelle efficace de la relation entreY et X après ajustement pour Z.
Si vous n'ajustez pas X, vous sous-estimez le coefficient de régression
La deuxième approche, comme vous l'avez initialement dit, régressant Y.Z sur X, est trop conservateur. Il minimisera l'importance de la relation entreY et X ajustement pour Zcar il sous-estime la taille du coefficient de régression. Cela se produit parce que vous régressezY.Z dans l'ensemble de X au lieu de simplement de la part de X qui est indépendant de Z. Dans la formule standard du coefficient de régression en régression linéaire simple, le numérateur (covariance deY.Z avec X) sera correct mais le dénominateur (la variance de X) sera trop grand. La covariable correcteX.Z a toujours une variance plus petite que X.
Pour être précis, votre méthode 2 sous-estimera le coefficient de régression partielle pour X par un facteur de 1−r2 où r est le coefficient de corrélation de Pearson entre X et Z.
Un exemple numérique
Voici un petit exemple numérique pour montrer que la méthode de la variable ajoutée représente le coefficient de régression de Y sur X correctement alors que votre deuxième approche (méthode 2) peut être arbitrairement erronée.
Nous simulons d'abord X, Z et Y:
> set.seed(20180525)
> Z <- 10*rnorm(10)
> X <- Z+rnorm(10)
> Y <- X+Z
Ici Y=X+Z donc les vrais coefficients de régression pour X et Z sont tous deux 1 et l'ordonnée à l'origine est 0.
Ensuite, nous formons les deux vecteurs résiduels R (comme mon Y.Z) et X.Z:
> R <- Y.Z <- residuals(lm(Y~Z))
> X.Z <- residuals(lm(X~Z))
La régression multiple complète avec les deux X et Y comme prédicteurs donne exactement les vrais coefficients de régression:
> coef(lm(Y~X+Z))
(Intercept) X Z
5.62e-16 1.00e+00 1.00e+00
L' approche variable ajoutée (méthode 3) donne également le coefficient deX exactement correct:
> coef(lm(R~X.Z))
(Intercept) X.Z
-6.14e-17 1.00e+00
En revanche, votre méthode 2 constate que le coefficient de régression n'est que de 0,01:
> coef(lm(R~X))
(Intercept) X
0.00121 0.01170
Votre méthode 2 sous-estime donc la taille réelle de l'effet de 99%. Le facteur de sous-estimation est donné par la corrélation entreX et Z:
> 1-cor(X,Z)^2
[1] 0.0117
Pour voir tout cela visuellement, le tracé variable ajouté deR contre X.Z montre une relation linéaire parfaite avec la pente unitaire, représentant la véritable relation marginale entre Y et X:

En revanche, l'intrigue de R vs les non ajustés Xne montre aucune relation du tout. La vraie relation a été entièrement perdue:
