8.2 一元线性回归模型及其应用

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 2 页

原书扫描页

原书 page-0110
page-0110
原书 page-0111
page-0111

文字转写

8.2 一元线性回归模型及其应用

通过前面的学习我们已经了解到,根据成对样本数据的散点图和样本相关系数,可以推断两个变量是否存在相关关系、是正相关还是负相关,以及线性相关程度的强弱等。进一步地,如果能像建立函数模型刻画两个变量之间的确定性关系那样,通过建立适当的统计模型刻画两个随机变量的相关关系,那么我们就可以利用这个模型研究两个变量之间的随机关系,并通过模型进行预测。

下面我们研究当两个变量线性相关时,如何利用成对样本数据建立统计模型,并利用模型进行预测的问题.

8.2.1 一元线性回归模型

生活经验告诉我们,儿子的身高与父亲的身高不仅线性相关,而且还是正相关,即父亲的身高较高时,儿子的身高通常也较高。为了进一步研究两者之间的关系,有人调查了某所高校14名男大学生的身高及其父亲的身高,得到的数据如表8.2-1所示。

利用前面表示数据的方法,以横轴表示父亲身高、纵轴表示儿子身高建立直角坐标系,再将表8.2-1中的成对样本数据表示为散点图,如图8.2-1所示。可以发现,散点大致分布在一条从左下角到右上角的直线附近,表明儿子身高和父亲身高线性相关。利用统计软件,求得样本相关系数为 r0.886r\approx0.886 ,表明儿子身高和父亲身高正线性相关,且相关程度较高。

思考

根据表8.2-1中的数据,儿子身高和父亲身高这两个变量之间的关系可以用函数模型刻画吗?

在表 8.2-1 的数据中,存在父亲身高相同,而儿子身高不同的情况。例如,第 6 个和第 8 个观测的父亲身高均为 172 cm,而对应的儿子身高分别为 176 cm 和 174 cm;同样,第 3,4 两个观测中,儿子身高都是 170 cm,而父亲身高分别为 173 cm 和 169 cm。可见儿子身高和父亲身高之间不是函数关系,也就不能用函数模型刻画。

图 8.2-1 中的散点大致分布在一条直线附近,表明儿子身高和父亲身高这两个变量之间有较强的线性相关关系,因此我们可以用一次函数来刻画父亲身高对儿子身高的影响,而把影响儿子身高的其他因素,如母亲身高、生活环境、饮食习惯等作为随机误差,得到刻画两个变量之间关系的线性回归模型。其中,随机误差是一个随机变量。

xx 表示父亲身高,YY 表示儿子身高,ee 表示随机误差。假定随机误差 ee 的均值为 0,方差为与父亲身高无关的定值 σ2\sigma^2,则它们之间的关系可以表示为

\left\{ \begin{array}{l} Y = b x + a + e, \\ E (e) = 0, D (e) = \sigma^ {2}. \end{array} \right.\tag{1}

为什么假设 E(e)=0E(e) = 0 ,而不假设其为某个不为0的常数?

我们称(1)式为 YY 关于 xx 的一元线性回归模型(simple linear regression model)。其中,YY 称为因变量或响应变量,xx 称为自变量或解释变量;aabb 为模型的未知参数,aa 称为截距参数,bb 称为斜率参数;eeYYbx+abx + a 之间的随机误差。模型中的 YY 也是随机变量,其值虽然不能由变量 xx 的值确定,但是却能表示为 bx+abx + aee 的和(叠加),前一部分由 xx 所确定,后一部分是随机的。如果 e=0e = 0,那么 YYxx 之间的关系就可用一元线性函数模型来描述。

对于父亲身高 xx 和儿子身高 YY 的一元线性回归模型(1),可以解释为父亲身高为 xix_{i} 的所有男大学生的身高组成一个子总体,该子总体的均值为 bxi+abx_{i} + a ,即该子总体的均值与父亲身高是线性函数关系。而对于父亲身高为 xix_{i} 的某一名男大学生,他的身高 yiy_{i} 并不一定为 bxi+abx_{i} + a ,它仅是该子总体中的一个观测值,这个观测值与均值有一个误差项 ei=yi(bxi+a)e_{i} = y_{i} - (bx_{i} + a)

思考

你能结合具体实例解释产生模型(1)中随机误差项的原因吗?

在研究儿子身高与父亲身高的关系时,产生随机误差 ee 的原因有:

(1)除父亲身高外,其他可能影响儿子身高的因素,比如母亲身高、生活环境、饮食习惯和锻炼时间等;

(2) 在测量儿子身高时, 由于测量工具、测量精度所产生的测量误差;

(3)实际问题中,我们不知道儿子身高和父亲身高的相关关系是什么,可以利用一元线性回归模型来近似这种关系,这种近似也是产生随机误差 ee 的原因.