Une estimation doublement robuste n'est en fait pas particulièrement difficile à mettre en œuvre dans la langue de votre choix. Tout ce que vous faites en fait, c'est contrôler les variables de deux manières, plutôt que d'une seule - l'idée étant que tant que l'un des deux modèles utilisés pour le contrôle est correct, vous avez réussi à contrôler la confusion.
À mon avis, la façon la plus simple de procéder consiste à utiliser des pondérations à probabilité inverse de traitement (IPTW) pour pondérer l'ensemble de données, puis à inclure également des variables dans un modèle de régression normal. C'est ainsi que les auteurs abordent le problème dans l'article lié ci-dessus. Il existe également d'autres options, généralement construites à partir des scores de propension utilisés pour l'appariement ou comme covariable dans le modèle.
Il existe de nombreuses introductions à IPTW dans la langue statistique que vous préférez. Je fournirais des extraits de code, mais tous les miens sont en SAS et se liraient probablement beaucoup comme les auteurs.
En bref, ce que vous faites est de modéliser la probabilité d' exposition en fonction de vos covariables en utilisant quelque chose comme la régression logistique et d'estimer la probabilité d'exposition prédite en fonction de ce modèle. Cela vous donne un score de propension. La probabilité inverse du poids de traitement est, comme son nom l'indique, 1 / score de propension. Cela produit parfois des valeurs extrêmes, de sorte que certaines personnes stabilisent le poids en substituant la probabilité marginale d'exposition (obtenue par un modèle de régression logistique du résultat et sans covariables) à 1 dans l'équation ci-dessus.
Au lieu de traiter chaque sujet de votre analyse comme 1 sujet, vous les traitez maintenant comme n copies d'un sujet, où n est leur poids. Si vous exécutez votre modèle de régression en utilisant ces pondérations et en incluant les covariables, il en résulte une estimation doublement robuste.
Une mise en garde cependant: si une estimation robuste doublement (ou triplement, etc.) vous donne plus de chances de spécifier le bon modèle de covariable, elle ne garantit pas que vous le ferez. Et plus important encore, ne peut pas vous sauver de la confusion non mesurée.