Supposons que j'ai un échantillon aléatoire .
Supposer
et
Quelle est la différence entre et ?
Supposons que j'ai un échantillon aléatoire .
Supposer
et
Quelle est la différence entre et ?
Réponses:
est une idée - elle n'existe pas vraiment dans la pratique. Mais si l'hypothèse de Gauss-Markov tient, vous donnerait cette pente optimale avec des valeurs au-dessus et en dessous sur une "tranche" verticale à la variable dépendante formant une belle distribution gaussienne normale des résidus. est l'estimation de sur la base de l'échantillon.
L'idée est que vous travaillez avec un échantillon d'une population. Votre échantillon forme un nuage de données, si vous voulez. L'une des dimensions correspond à la variable dépendante, et vous essayez d'ajuster la ligne qui minimise les termes d'erreur - dans OLS, il s'agit de la projection de la variable dépendante sur le sous-espace vectoriel formé par l'espace de colonne de la matrice de modèle. Ces estimations des paramètres de population sont notées avec lesymbole. Plus vous avez de points de données, plus les coefficients estimés sont précis, sont, et meilleure est l’estimation de ces coefficients de population idéalisés, .
Voici la différence de pente ( contre ) entre la "population" en bleu et l'échantillon en points noirs isolés:
La ligne de régression est en pointillés et en noir, tandis que la ligne de "population" synthétiquement parfaite est en bleu uni. L'abondance de points fournit un sens tactile de la normalité de la distribution des résidus.
Le symbole "chapeau" dénote généralement une estimation, par opposition à la "vraie" valeur. Donc est une estimation de . Quelques symboles ont leurs propres conventions: la variance de l'échantillon, par exemple, est souvent écrite comme, ne pas , bien que certaines personnes utilisent les deux pour distinguer les estimations biaisées des estimations non biaisées.
Dans votre cas particulier, le les valeurs sont des estimations de paramètres pour un modèle linéaire. Le modèle linéaire suppose que la variable de résultat est généré par une combinaison linéaire du s, chacun pondéré par les valeur. Dans la pratique, bien sûr, cesles valeurs sont inconnues et peuvent même ne pas exister (peut-être que les données ne sont pas générées par un modèle linéaire). Néanmoins, nous pouvons estimer les valeurs des données qui se rapprochent .
L'équation
est ce qu'on appelle le vrai modèle. Cette équation dit que la relation entre la variable et la variable peut être expliqué par une ligne . Cependant, étant donné que les valeurs observées ne suivront jamais cette équation exacte (en raison d'erreurs), unun terme d'erreur est ajouté pour indiquer les erreurs. Les erreurs peuvent être interprétées comme des écarts naturels par rapport à la relation et . Ci-dessous, je montre deux paires de et (les points noirs sont des données). En général, on peut voir que augmente augmente. Pour les deux paires, la véritable équation est
Regardons l'intrigue à gauche. La vérité et le vrai = 3. Mais en pratique, lorsque des données sont fournies, nous ne connaissons pas la vérité. Nous estimons donc la vérité. Nous estimons avec et avec . Selon les méthodes statistiques utilisées, les estimations peuvent être très différentes. Dans le cadre de la régression, les estimations sont obtenues via une méthode appelée les moindres carrés ordinaires. Ceci est également connu comme la méthode de ligne de meilleur ajustement. Fondamentalement, vous devez tracer la ligne qui correspond le mieux aux données. Je ne parle pas des formules ici, mais en utilisant la formule pour OLS, vous obtenez
et la ligne résultante de meilleur ajustement est,

Un exemple simple serait la relation entre les hauteurs des mères et des filles. Laisser taille des mères et = hauteurs des filles. Naturellement, on s'attendrait à ce que les mères plus grandes aient des filles plus grandes (en raison de la similitude génétique). Cependant, pensez-vous qu'une équation peut résumer exactement la taille d'une mère et d'une fille, de sorte que si je connais la taille de la mère, je pourrai prédire la taille exacte de la fille? Non. D'un autre côté, on pourrait résumer la relation avec l'aide d'un en moyenne énoncé .
TL DR: est la vérité de la population. Il représente la relation inconnue entre et . Comme nous ne pouvons pas toujours obtenir toutes les valeurs possibles de et , nous collectons un échantillon de la population et essayons d' estimer en utilisant les données. est notre estimation. C'est une fonction des données.n'est pas fonction des données, mais de la vérité.