Dans le chapitre "Regression to the Mean" de "Thinking, Fast and Slow" de Daniel Kahneman, un exemple est donné et le lecteur est invité à prévoir les ventes des magasins individuels compte tenu des prévisions de ventes globales et des chiffres de ventes de l'année précédente . Par exemple (l'exemple du livre a 4 magasins, j'utilise 2 ici pour plus de simplicité):
Store 2011 2012
1 100 ?
2 500 ?
Total 600 660
Les prévisions naïves seraient de 110 et 550 pour les magasins 1 et 2, 10% d'augmentation pour chacun. Cependant, l'auteur affirme que cette approche naïve est erronée. Il est plus probable que le magasin le moins performant augmente de plus de 10% et le magasin le plus performant augmente (ou même diminue) de moins de 10%. Donc peut-être une prévision de 115 (augmentation de 15%) et 535 (augmentation de 7%) serait "plus correcte" que la prévision naïve.
Ce que je ne comprends pas, c'est comment conclure que les ventes de 100 magasins 1 sont nécessairement les magasins les moins performants? Peut-être, en raison des différences d'emplacement, les véritables moyennes chronologiques des magasins 1 et 2 sont 10 et 550, et le magasin 1 a eu une super année en 2011, et le magasin 2 a eu une année désastreuse en 2011. Alors cela n'aurait-il pas de sens prévoir une diminution pour le magasin 1 et une augmentation pour le magasin 2?
Je sais que les informations sur les séries chronologiques n'ont pas été fournies dans l'exemple d'origine, mais j'ai l'impression que la "régression vers la moyenne" fait référence à la moyenne transversale et, par conséquent, les informations sur les séries temporelles n'ont pas d'importance. Qu'est-ce que je comprends mal?