8.2.2 一元线性回归模型参数的最小二乘估计

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 17 页

原书扫描页

原书 page-0112
page-0112
原书 page-0113
page-0113
原书 page-0114
page-0114
原书 page-0115
page-0115
原书 page-0116
page-0116
原书 page-0117
page-0117
原书 page-0118
page-0118
原书 page-0119
page-0119
原书 page-0120
page-0120
原书 page-0121
page-0121
原书 page-0122
page-0122
原书 page-0123
page-0123
原书 page-0124
page-0124
原书 page-0125
page-0125
原书 page-0126
page-0126
原书 page-0127
page-0127
原书 page-0128
page-0128

文字转写

  1. 说明函数模型与回归模型的区别,并分别举出两个应用函数模型和回归模型的例子.

  2. 在一元线性回归模型(1)中,参数 bb 的含义是什么?

  3. 将图 8.2-1 中的点按父亲身高的大小次序用折线连起来,所得到的图象是一个折线图,可以用这条折线表示儿子身高和父亲身高之间的关系吗?

8.2.2 一元线性回归模型参数的最小二乘估计

在一元线性回归模型中,表达式 Y=bx+a+eY = bx + a + e 刻画的是变量 YY 与变量 xx 之间的线性相关关系,其中参数 aabb 未知,需要根据成对样本数据进行估计。由模型的建立过程可知,参数 aabb 刻画了变量 YY 与变量 xx 的线性关系,因此通过成对样本数据估计这两个参数,相当于寻找一条适当的直线,使表示成对样本数据的这些散点在整体上与这条直线最接近。

探究

利用散点图8.2-1找出一条直线,使各散点在整体上与此直线尽可能接近.

有的同学可能会想,可以采用测量的方法,先画出一条直线,测量出各点与它的距离,然后移动直线,到达一个使距离的和最小的位置。测量出此时的斜率和截距,就可得到一条直线,如图8.2-2所示。

有的同学可能会想,可以在图中选择这样的两点画直线,使得直线两侧的点的个数基本相同,把这条直线作为所求直线,如图8.2-3所示.

还有的同学会想,在散点图中多取几对点,确定出几条直线的方程,再分别求出这些直线的斜率、截距的平均数,将这两个平均数作为所求直线的斜率和截距如图8.2-4所示.

同学们不妨去实践一下,看看这些方法是不是真的可行.

上面这些方法虽然有一定的道理,但比较难操作,我们需要另辟蹊径.

先进一步明确我们面临的任务:从成对样本数据出发,用数学的方法刻画“从整体上看,各散点与直线最接近”.

通常,我们会想到利用点到直线 y=bx+ay=bx+a 的“距离”来刻画散点与该直线的接近程度,然后用所有“距离”之和刻画所有样本观测数据与该直线的接近程度。我们设满足一元线性回归模型的两个变量的 n 对样本数据为 (x1,y1)(x_{1}, y_{1})(x2,y2)(x_{2}, y_{2})\cdots(xn,yn)(x_{n}, y_{n})

yi=bxi+a+ei(i=1,2,,n)y_{i}=bx_{i}+a+e_{i}(i=1,2,\cdots,n) ,得 yi(bxi+a)=ei\left|y_{i}-(bx_{i}+a)\right|=\left|e_{i}\right| 。显然 ei\left|e_{i}\right| 越小,表示点 (xi,yi)(x_{i},y_{i}) 与点 (xi,bxi+a)(x_{i},bx_{i}+a) 的“距离”越小,即样本数据点离直线 y=bx+ay=bx+a 的竖直距离越小,如图 8.2-5 所示。特别地,当 ei=0e_{i}=0 时,表示点 (xi,yi)(x_{i},y_{i}) 在这条直线上。 因此,可以用这 n 个竖直距离之和

i=1nyi(bxi+a)\sum_ {i = 1} ^ {n} \left| y _ {i} - (b x _ {i} + a) \right|

来刻画各样本观测数据与直线 y=bx+ay=bx+a 的 “整体接近程度”.

在实际应用中,因为绝对值使得计算不方便,所以人们通常用各散点到直线的竖直距离的平方之和

Q=i=1n(yibxia)2Q = \sum_ {i = 1} ^ {n} (y _ {i} - b x _ {i} - a) ^ {2}

来刻画 “整体接近程度”.

在上式中, xix_{i}yi(i=1,2,3,,n)y_{i}(i=1,2,3,\cdots,n) 是已知的成对样本数据,所以Q由a和b所决定,即它是a和b的函数。因为Q还可以表示为 i=1nei2\sum_{i=1}^{n}e_{i}^{2} ,即它是随机误差的平方和,这个和当然越小越好,所以我们取使Q达到最小的a和b的值,作为截距和斜率的估计值。

下面利用成对样本数据求使 Q 取最小值的 a, b.

x=1ni=1nxi\overline{x} = \frac{1}{n}\sum_{i = 1}^{n}x_{i}y=1ni=1nyi\overline{y} = \frac{1}{n}\sum_{i = 1}^{n}y_{i} .因为

Q(a,b)=i=1n(yibxia)2=i=1n[yibxi(ybx)+(ybx)a]2=i=1n[(yiy)b(xix)+(ybx)a]2=i=1n[(yiy)b(xix)]2+2i=1n[(yiy)b(xix)]×[(ybx)a]+n[(ybx)a]2,\begin{array}{r l} Q (a, b) & = \sum_ {i = 1} ^ {n} (y _ {i} - b x _ {i} - a) ^ {2} \\ & = \sum_ {i = 1} ^ {n} \left[ y _ {i} - b x _ {i} - (\overline {{y}} - b \overline {{x}}) + (\overline {{y}} - b \overline {{x}}) - a \right] ^ {2} \\ & = \sum_ {i = 1} ^ {n} \left[ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) + (\overline {{y}} - b \overline {{x}}) - a \right] ^ {2} \\ & = \sum_ {i = 1} ^ {n} \left[ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \right] ^ {2} + 2 \sum_ {i = 1} ^ {n} \left[ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \right] \times \\ & \quad \left[ (\overline {{y}} - b \overline {{x}}) - a \right] + n \left[ (\overline {{y}} - b \overline {{x}}) - a \right] ^ {2}, \end{array}

注意到

i=1n[(yiy)b(xix)](ybxa)=(ybxa)i=1n[(yiy)b(xix)]=(ybxa)[i=1n(yiy)bi=1n(xix)]=(ybxa)[(nyny)b(nxnx)]=0,\begin{array}{l} \sum_ {i = 1} ^ {n} \big [ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \big ] (\overline {{y}} - b \overline {{x}} - a) \\ = (\overline {{y}} - b \overline {{x}} - a) \sum_ {i = 1} ^ {n} \big [ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \big ] \\ = (\overline {{y}} - b \overline {{x}} - a) \big [ \sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) - b \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) \big ] \\ = (\overline {{y}} - b \overline {{x}} - a) \big [ (n \overline {{y}} - n \overline {{y}}) - b (n \overline {{x}} - n \overline {{x}}) \big ] \\ = 0, \end{array}

所以

Q(a,b)=i=1n[(yiy)b(xix)]2+n(ybxa)2.Q (a, b) = \sum_ {i = 1} ^ {n} \left[ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \right] ^ {2} + n (\overline {{y}} - b \overline {{x}} - a) ^ {2}.

上式右边各项均为非负数,且前 nn 项与 aa 无关.所以,要使 QQ 取到最小值,n(ybxa)2n(\overline{y} - b\overline{x} - a)^2 的值应为0,即 a=ybxa = \overline{y} - b\overline{x}.此时

Q(a,b)=i=1n[(yiy)b(xix)]2=b2i=1n(xix)22bi=1n(xix)(yiy)+i=1n(yiy)2.\begin{array}{r l} Q (a, b) & = \sum_ {i = 1} ^ {n} \left[ (y _ {i} - \overline {{y}}) - b (x _ {i} - \overline {{x}}) \right] ^ {2} \\ & = b ^ {2} \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2} - 2 b \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) (y _ {i} - \overline {{y}}) + \sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) ^ {2}. \end{array}

上式是关于 bb 的二次函数,因此要使 QQ 取得最小值,当且仅当 bb 的取值为

b^=i=1n(xix)(yiy)i=1n(xix)2.\hat {b} = \frac {\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) (y _ {i} - \overline {{y}})}{\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}}.

综上,当 a,ba, b 的取值为

\left\{ \begin{array}{l} \hat {b} = \frac {\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) (y _ {i} - \overline {{y}})}{\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}}, \\ \hat {a} = \overline {{y}} - \hat {b} \overline {{x}} \end{array} \right.\tag{2}

时,Q 达到最小.

我们将 y^=b^x+a^\hat{y}=\hat{b}x+\hat{a} 称为 Y 关于 x 的经验回归方程,也称经验回归函数或经验回归公式,其图形称为经验回归直线。这种求经验回归方程的方法叫做最小二乘法 ^{①} ,求得的 b^\hat{b}a^\hat{a} 叫做 b,a 的最小二乘估计(least squares estimate)。

对于表 8.2-1 中的数据,利用公式(2)可以计算出 b^=0.839,a^=28.957\hat{b}=0.839,\quad\hat{a}=28.957 ,得到儿子身高 Y 关于父亲身高 x 的经验回归方程为

y^=0.839x+28.957,\hat {y} = 0. 8 3 9 x + 2 8. 9 5 7,

相应的经验回归直线如图 8.2-6 所示.

• •

①这里的“二乘”是平方的意思.

• •

利用统计软件求经验回归模型,Excel 软件可以用数据分析中的“回归”分析工具或通过“添加趋势线”得到;R 软件可以用函数 lm 计算参数的最小二乘估计结果.

思考

x=176x = 176 时,y^177\hat{y} \approx 177。如果一位父亲的身高为 176 cm176 \mathrm{~cm},他儿子长大成人后的身高一定是 177 cm177 \mathrm{~cm} 吗?为什么?

显然不一定,因为还有其他影响儿子身高的因素,父亲身高不能完全决定儿子身高。不过,我们可以作出推测,当父亲身高为 176cm176\mathrm{cm} 时,儿子身高一般在 177cm177\mathrm{cm} 左右。

实际上,如果把这所学校父亲身高为 176cm176 \, cm 的所有儿子身高作为一个子总体,那么 177cm177 \, cm 是这个子总体的均值的估计值.

这里的经验回归方程 y^=0.839x+28.957\hat{y}=0.839x+28.957 ,其斜率可以解释为父亲身高每增加1 cm,其儿子身高平均增加0.839 cm。分析模型还可以发现,高个子父亲有生高个子儿子的趋势,但一群高个子父亲的儿子们的平均身高要低于父亲们的平均身高,例如

x=185(cm),y^=184.172(cm);x = 1 8 5 (\mathrm{cm}), \text {则} \hat {y} = 1 8 4. 1 7 2 (\mathrm{cm});

矮个子父亲有生矮个子儿子的趋势,但一群矮个子父亲的儿子们的平均身高要高于父亲们的平均身高,例如

• •

英国著名统计学家高尔顿(F. Galton,1822—1911)把这种后代的身高向中间值靠近的趋势称为“回归现象”。后来,人们把由一个或多个变量的变化去推测另一个变量的变化的方法称为回归分析。

根据模型,父亲身高为多少时,长大成人的儿子的平均身高与父亲的一样?你怎么看这个判断?

x=170(cm),y^=171.587(cm).x = 1 7 0 (\mathrm{cm}), \text {则} \hat {y} = 1 7 1. 5 8 7 (\mathrm{cm}).

对于响应变量 Y,通过观测得到的数据称为观测值,通过经验回归方程得到的 y^\hat{y} 称为预测值,观测值减去预测值称为残差。残差是随机误差的估计结果,通过对残差的分析可以判断模型刻画数据的效果,以及判断原始数据中是否存在可疑数据等,这方面工作称为残差分析。

例如,对于表 8.2-1 中的第 6 个观测,父亲身高为 172 cm,其儿子身高的观测值为

y6=176(cm),y _ {6} = 1 7 6 (\mathrm{cm}),

预测值为

y^6=0.839×172+28.957=173.265(cm),\hat {y} _ {6} = 0. 8 3 9 \times 1 7 2 + 2 8. 9 5 7 = 1 7 3. 2 6 5 (\mathrm{cm}),

残差为

176173.265=2.735(cm).1 7 6 - 1 7 3. 2 6 5 = 2. 7 3 5 (\mathrm{cm}).

类似地,可以得到其他的残差,如表 8.2-2 所示.

为了使数据更加直观,用父亲身高作为横坐标,残差作为纵坐标,可以画出残差图,如图 8.2-7 所示.

观察表8.2-2可以看到,残差有正有负,残差的绝对值最大是4.413。观察残差的散点图可以发现,残差比较均匀地分布在横轴的两侧。说明残差比较符合一元线性回归模型的假定,是均值为0、方差为 σ2\sigma^2 的随机变量的观测值。可见,通过观察残差图可以直观判断模型是否满足一元线性回归模型的假设。

一般地,建立经验回归方程后,通常需要对模型刻画数据的效果进行分析。借助残差分析还可以对模型进行改进,使我们能根据改进模型作出更符合实际的预测与决策。

思考

观察图8.2-8中四幅残差图,你认为哪一个残差满足一元线性回归模型中对随机误差的假定?

根据一元线性回归模型中对随机误差的假定,残差应是均值为0、方差为 σ2\sigma^2 的随机变量的观测值。在图8.2-8中,图(1)显示残差与观测时间有线性关系,应将时间变量纳入模型;图(2)显示残差与观测时间有非线性关系,应在模型中加入时间的非线性函数部分;图(3)说明残差的方差不是一个常数,随观测时间变大而变大;图(4)的残差比较均匀地分布在以取值为0的横轴为对称轴的水平带状区域内。可见,在图8.2-8中,只有图(4)满足一元线性回归模型对随机误差的假设。

练习

  1. 对一元线性回归模型参数 aabb 的估计中,有人认为:“估计方法不止一种,根据不同的样本观测数据到直线‘整体接近程度’的定义,可以得到参数 aabb 不同的估计,只要‘整体接近程度’定义合理即可.”你觉得这个说法对吗?

  2. 假如女儿身高 yy (单位: cm\mathrm{cm} )关于父亲身高 xx (单位: cm\mathrm{cm} )的经验回归方程为 y^=0.81x+25.82\hat{y} = 0.81x + 25.82 已知父亲身高为 175 cm175~\mathrm{cm},请估计女儿的身高.

  3. 根据8.1.1节表8.1-1中的数据,建立人体的脂肪含量关于年龄的经验回归方程,画出残差图,描述残差图的特点.

  4. 计算表 8.2-2 中的所有残差之和,你能发现什么规律?

  5. 假设变量 x 与变量 Y 的 n 对观测数据为 (x1,y1)(x_{1}, y_{1}) , (x2,y2)(x_{2}, y_{2}) , \cdots , (xn,yn)(x_{n}, y_{n}) ,两个变量满足一元线性回归模型

{Y=bx+e,E(e)=0,D(e)=σ2.\left\{ \begin{array}{l} Y = b x + e, \\ E (e) = 0, D (e) = \sigma^ {2}. \end{array} \right.

请写出参数 b 的最小二乘估计.

例 经验表明,一般树的胸径(树的主干在地面以上 1.3m1.3\mathrm{m} 处的直径)越大,树就越高。由于测量树高比测量胸径困难,因此研究人员希望由胸径预测树高。在研究树高与胸径之间的关系时,某林场收集了某种树的一些数据(表8.2-3),试根据这些数据建立树高关于胸径的经验回归方程。

分析:因为要由胸径预测树高,所以要以成对样本数据的胸径为横坐标、树高为纵坐标画出散点,进而得到散点图,再根据散点图推断树高与胸径是否线性相关。如果是,再

利用公式(2)计算出 b^\hat{b}a^\hat{a} 即可.

解:以胸径为横坐标、树高为纵坐标作散点图,得到图 8.2-9.

在图 8.2-9 中,散点大致分布在一条从左下角到右上角的直线附近,表明两个变量线性相关,并且是正相关,因此可以用一元线性回归模型刻画树高与胸径之间的关系.

用 d 表示胸径,h 表示树高,根据最小二乘法,计算可得经验回归方程为

h^=0.2493d+14.84,\hat {h} = 0. 2 4 9 3 d + 1 4. 8 4,

相应的经验回归直线如图 8.2-10 所示.

根据经验回归方程,由表 8.2-3 中胸径的数据可以计算出树高的预测值(精确到 0.1)以及相应的残差,如表 8.2-4 所示.

以胸径为横坐标,残差为纵坐标,作残差图,得到图8.2-11.

观察残差表和残差图,可以看到,残差的绝对值最大是0.8,所有残差分布在以横轴为对称轴、宽度小于2的带状区域内。可见经验回归方程较好地刻画了树高与胸径的关系,我们可以根据经验回归方程由胸径预测树高。

问题 人们常将男子短跑 100m100\mathrm{m} 的高水平运动员称为“百米飞人”。表8.2-5给出了1968年之前男子短跑 100m100\mathrm{m} 世界纪录产生的年份和世界纪录的数据。试依据这些成对数据,建立男子短跑 100m100\mathrm{m} 世界纪录关于纪录产生年份的经验回归方程。

以成对数据中的世界纪录产生年份为横坐标,世界纪录为纵坐标作散点图,得到图8.2-12.

在图 8.2-12 中,散点看上去大致分布在一条直线附近,似乎可用一元线性回归模型建立经验回归方程.

YY 表示男子短跑 100m100\mathrm{m} 的世界纪录,tt 表示纪录产生的年份,利用一元线性回归模型

{Y=bt+a+e,E(e)=0,D(e)=σ2\left\{ \begin{array}{l} Y = b t + a + e, \\ E (e) = 0, D (e) = \sigma^ {2} \end{array} \right.

来刻画世界纪录和世界纪录产生年份之间的关系. 根据最小二乘法, 由表中的数据得到经验回归方程为

\hat {y} _ {1} = - 0. 0 2 0 3 3 7 4 3 t + 4 9. 7 6 9 1 3 0 3 1.\tag{①}

将经验回归直线叠加到散点图,得到图 8.2-13.

观察

从图 8.2-13 中可以看到,经验回归方程①较好地刻画了散点的变化趋势.请再仔细观察图形,你能看出其中存在的问题吗?

以经验回归直线为参照,可以发现经验回归方程的不足之处,以及散点的更为精细的分布特征。例如,第一个世界纪录所对应的散点远离经验回归直线,并且前后两时间段中的散点都在经验回归直线的上方,中间时间段的散点都在经验回归直线的下方。这说明散点并不是随机分布在经验回归直线的周围,而是围绕着经验回归直线有一定的变化规律,即成对样本数据呈现出明显的非线性相关的特征。

思考

你能对模型进行修改,以使其更好地反映散点的分布特征吗?

仔细观察图8.2-12,可以发现散点更趋向于落在中间下凸且递减的某条曲线附近。回顾已有的函数知识,可以发现函数 y=lnxy = -\ln x 的图象具有类似的形状特征。注意到 100m100\mathrm{m} 短跑的第一个世界纪录产生于1896年,因此可以认为散点是集中在曲线

y=f(t)=c1+c2ln(t1895)y = f (t) = c _ {1} + c _ {2} \ln (t - 1 8 9 5)

的周围,其中 c1c_{1}c2c_{2} 为未知的参数,且 c2<0c_{2}<0 .

用上述函数刻画数据变化的趋势,这是一个非线性经验回归函数,其中 c1c_{1}c2c_{2} 是待定参数。现在问题转化为如何利用成对数据估计参数 c1c_{1}c2c_{2}

为了利用一元线性回归模型估计参数 c1c_{1}c2c_{2},我们引进一个中间变量 xx,令 x=ln(t1895)x = \ln (t - 1895)。通过 x=ln(t1895)x = \ln (t - 1895),将年份变量数据进行变换,得到新的成对数据(精确到0.01),如表8.2-6所示。

如果表8.2-6对应的散点图呈现出很强的线性相关特征,我们就可以借助一元线性回归模型和新的成对数据,对参数 c1c_{1}c2c_{2} 作出估计,进而可以得到 YY 关于 tt 的非线性经验回归方程.

在直角坐标系中画出表8.2-6中成对数据的散点图,如图8.2-14所示,散点的分布呈现出很强的线性相关特征.

{Y=c2x+c1+u,E(u)=0,D(u)=δ2\left\{ \begin{array}{l} Y = c _ {2} x + c _ {1} + u, \\ E (u) = 0, D (u) = \delta^ {2} \end{array} \right.

拟合表 8.2-6 中的成对数据,得到经验回归方程

\hat {y} _ {2} = - 0. 4 2 6 4 3 9 8 x + 1 1. 8 0 1 2 6 5 3,\tag{*}

再在图 8.2-14 中画出(*)式所对应的经验回归直线,得到图 8.2-15.

图8.2-15表明,经验回归方程(*)对于表8.2-6中的成对数据具有非常好的拟合精度。将图8.2-15与图8.2-13进行对比,可以发现 xxYY 之间的线性相关程度比原始样本数据的线性相关程度强得多。

x=ln(t1 895)x=\ln(t-1\ 895) 代入(*)式,得到由创纪录年份预报世界纪录的经验回归方程

\hat {y} _ {2} = - 0. 4 2 6 4 3 9 8 \ln (t - 1 8 9 5) + 1 1. 8 0 1 2 6 5 3.\tag{②}

在同一直角坐标系中画出成对数据散点图、非线性经验回归方程②的图象(蓝色)以及经验回归方程①的图象(红色),如图8.2-16所示。我们发现,散点图中各散点都非常靠近②的图象,表明非线性经验回归方程②对于原始数据的拟合效果远远好于经验回归方程①。

下面通过残差来比较这两个经验回归方程对数据刻画的好坏. 在表 8.2-5 中,用 tit_{i} 表示编号为 i 的年份数据,用 yiy_{i} 表示编号为 i 的纪录数据,则经验回归方程①和②的残差计算公式分别为

e^i=yi+0.02033743ti49.76913031,i=1,2,,8;\hat {e} _ {i} = y _ {i} + 0. 0 2 0 3 3 7 4 3 t _ {i} - 4 9. 7 6 9 1 3 0 3 1, i = 1, 2, \dots , 8;

u^i=yi+0.4264398ln(ti1895)11.8012653,i=1,2,,8.\hat {u} _ {i} = y _ {i} + 0. 4 2 6 4 3 9 8 \ln (t _ {i} - 1 8 9 5) - 1 1. 8 0 1 2 6 5 3, i = 1, 2, \dots , 8.

两个经验回归方程的残差(精确到0.001)如表8.2-7所示。观察各项残差的绝对值,发现经验回归方程②远远小于①,即经验回归方程②的拟合效果要远远好于①。

在一般情况下,直接比较两个模型的残差比较困难,因为在某些散点上一个模型的残差的绝对值比另一个模型的小,而另一些散点的情况则相反.可以通过比较残差的平方和来比较两个模型的效果.由

Q1=i=18(e^i)20.669,Q2=i=18(u^i)20.004,Q _ {1} = \sum_ {i = 1} ^ {8} \left(\hat {e} _ {i}\right) ^ {2} \approx 0. 6 6 9, Q _ {2} = \sum_ {i = 1} ^ {8} \left(\hat {u} _ {i}\right) ^ {2} \approx 0. 0 0 4,

可知 Q2Q_{2} 小于 Q1Q_{1} ,因此在残差平方和最小的标准下,非线性回归模型

{Y=c2ln(t1895)+c1+u,E(u)=0,D(u)=δ2\left\{ \begin{array}{l} Y = c _ {2} \ln (t - 1 8 9 5) + c _ {1} + u, \\ E (u) = 0, D (u) = \delta^ {2} \end{array} \right.

的拟合效果要优于一元线性回归模型的拟合效果.

也可以用决定系数 R2R^2 来比较两个模型的拟合效果,R2R^2 的计算公式为

R2=1i=1n(yiy^i)2i=1n(yiy)2.R ^ {2} = 1 - \frac {\sum_ {i = 1} ^ {n} (y _ {i} - \hat {y} _ {i}) ^ {2}}{\sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) ^ {2}}.

R2R^2 表达式中,i=1n(yiy)2\sum_{i=1}^{n}(y_i - \overline{y})^2 与经验回归方程无关,残差平方和 i=1n(yiy^i)2\sum_{i=1}^{n}(y_i - \hat{y}_i)^2 与经验回归方程有关。因此 R2R^2 越大,表示残差平方和越小,即模型的拟合效果越好;R2R^2 越小,表示残差平方和越大,即模型的拟合效果越差。

由表 8.2-7 容易算出经验回归方程①和②的 R2R^{2} 分别约为 0.7325 和 0.9983,因此经验回归方程②的刻画效果比经验回归方程①的好很多.

另外,我们还可以用新的观测数据来检验模型的拟合效果。事实上,我们还有1968年之后的男子短跑 100m100\mathrm{m} 世界纪录数据,如表8.2-8所示。

在散点图 8.2-12 中,绘制表 8.2-8 中的散点(绿色),再添加经验回归方程①所对应的经验回归直线(红色),以及经验回归方程②所对应的经验回归曲线(蓝色),得到图 8.2-17.显然绿色散点分布在蓝色经验回归曲线的附近,远离红色经验回归直线,表明经验回归方程②对于新数据的预报效果远远好于①.

思考

在上述问题情境中,男子短跑 100m100\mathrm{m} 世界纪录和纪录产生年份之间呈现出对数关系,能借助于样本相关系数刻画这种关系的强弱吗?

在使用经验回归方程进行预测时,需要注意下列问题:

(1)经验回归方程只适用于所研究的样本的总体。例如,根据我国父亲身高与儿子身高的数据建立的经验回归方程,不能用来描述美国父亲身高与儿子身高之间的关系。同样,根据生长在南方多雨地区的树高与胸径的数据建立的经验回归方程,不能用来描述北方干旱地区的树高与胸径之间的关系。

(2)经验回归方程一般都有时效性。例如,根据20世纪80年代的父亲身高与儿子身高的数据建立的经验回归方程,不能用来描述现在的父亲身高与儿子身高之间的关系。

(3)解释变量的取值不能离样本数据的范围太远。一般解释变量的取值在样本数据范围内,经验回归方程的预报效果会比较好,超出这个范围越远,预报的效果越差。

(4)不能期望经验回归方程得到的预报值就是响应变量的精确值。事实上,它是响应变量的可能取值的平均值。

练习

  1. 在回归分析中,分析残差能够帮助我们解决哪些问题?

  2. 1997—2006 年我国的国内生产总值(GDP)的数据(摘自《中国统计年鉴—2017》)如下:

(1) 作 GDP 和年份的散点图, 根据该图猜想它们之间的关系可以用什么模型描述;

(2)建立年份为解释变量,GDP为响应变量的一元线性回归模型,并计算残差;

(3)根据你得到的一元线性回归模型,预测2017年的GDP,看看你的预测值与实际的GDP的误差是多少;

(4)你认为这个模型能较好地刻画 GDP 和年份的关系吗?请说明理由.

(5)随着时间的发展,又收集到2007—2016年的GDP数据(摘自《中国统计年鉴—2017》)如下:

建立年份(1997—2016)为解释变量,GDP 为响应变量的经验回归方程,并预测 2017 年的 GDP,与实际的 GDP 误差是多少?你能发现什么?

习题8.2

复习巩固

  1. 如果散点图中所有的散点都落在一条斜率为非0的直线上,请回答下列问题:

(1) 解释变量和响应变量的关系是什么?

(2) R2R^2 是多少?

  1. 一个车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了10次试验,收集数据如表所示.

(1) 画出散点图;

(2) 建立加工时间关于零件数的一元线性回归模型;

(3) 关于加工零件的个数与加工时间, 你能得出什么结论?

  1. 根据8.1.2节例2中某城市居民年收入与A商品销售额的数据:

(1)建立 A 商品销售额关于居民年收入的一元线性回归模型;

(2) 如果这座城市居民的年收入为 40 亿元,估计 A 商品的销售额是多少.

综合运用

  1. 人口问题是关乎国计民生的大问题. 下表是 1949—2016 年我国的人口总数(摘自《中国统计年鉴—2017》).

(1) 画出散点图;

(2) 建立总人口数关于年份的一元线性回归模型;

(3)直接用上面建立的回归模型预测2020年的我国人口总数,得到的结果合理吗?为什么?

  1. 在某地区的一段时间内观测到的不小于某震级 xx 的地震数 NN 的数据如下表:

拓广探索

  1. 生活中有许多变量之间的关系是值得我们去研究的。例如,数学成绩、物理成绩和化学成绩两两之间是相关的吗?哪两个学科成绩之间相关性更大,你能解释其中的原因吗?语文成绩对数学成绩有影响吗?等等,请用你们班的某次考试成绩,研究它们之间的关系。如果它们之间有关系,请建立统计模型进行分析。

阅读与思考

回归与相关

回归分析法和相关分析法是统计学中的两种重要方法,前者用于由一个或多个变量的变化去推测另一个变量的变化,后者研究随机变量间的相关关系,它们是由英国科学家高尔顿创立的。

高尔顿的科研兴趣十分广泛,在地理学、气象学、统计学、心理学、人类学等众多领域都有建树。他在遗传学的研究中发现了一个令人困惑的问题。通常,高个子的人会和高个子的人结婚,矮个子的人会和矮个子的人结婚,而人类的遗传是把上一代的优势性状传递给下一代。这样,在人群中,高个子、矮个子的比例都应逐渐增多,而中等个子的比例应逐渐下降。但事实并非如此,为什么呢?这个问题一直萦绕在他的心头。

1875年,为了确定豌豆尺寸的遗传规律,他将自己精心挑选的490粒甜豌豆按照尺寸大小分成7组,在7个不同地区各种植70粒(每组10粒)。豌豆成熟后,他仔细测量了新豌豆(子代)的尺寸,并与豌豆种子(母代)的尺寸进行比较。数据分析发现,母代尺寸大的子代尺寸较大,母代尺寸小的子代尺寸也较小。但无论尺寸大小,都有子代向母代的平均值(7种尺寸豌豆的平均值)靠近的趋势。

这一结论在遗传学上是否具有普遍性呢?能否用它来解释人的个子高矮的遗传现象呢?为此,在1885年,高尔顿随机选取了205对夫妇及其928个成年子女的身高数据进行研究。由于男女身高存在差异,他采用女子身高乘1.08的方法将女子身高换算成男子身高。他将父母的平均身高称为“中亲身高”,用

a×1.08+b2\frac {a \times 1 . 0 8 + b}{2}

进行计算,其中 aa 为母亲身高,bb 为父亲身高。记中亲身高为 XX(母代变量),子女身高为 YY(子代变量),分析 XXYY 的数据,他惊奇地发现,XXYY 的平均值均为 173.4 cm173.4 \mathrm{~cm}。在此基础上,他还发现:当中亲身高大于平均值时,他们的子女相对较高,但与父母相比还是矮一些,例如,当中亲身高为 181.6 cm181.6 \mathrm{~cm} 时,他们子女的平均身高仅为 177.5 cm177.5 \mathrm{~cm};当中亲身高小于平均值时,他们的子女相对较矮,但比父母又要高一些,例如,当中亲身高为 166.4 cm166.4 \mathrm{~cm} 时,他们子女的平均身高为 169.4 cm169.4 \mathrm{~cm}。这表明,子女身高有向平均值“回归”的倾向。1886年,高尔顿将这一研究成果写成了论文《遗传身高向平均身高的回归》,文中正式引入了“回归”这个概念。1888年,高尔顿发表了统计史上第一篇有关相关系数值的论文,文中用到了一种用图形估计相关系数值的方法。

高尔顿提出的回归和相关思想是开创性的,但他的工作做得还不够彻底。后来,埃奇沃思(F. Y. Edgeworth,1845—1926)和皮尔逊(K. Pearson,1857—1936)等一批学者加入到研究中来,使回归和相关理论得到了完善与发展。埃奇沃思不仅给出了常见的样本相关系数的公式,还赋予“回归”以纯数学的意义,为这一方法的广泛应用奠定了基础。皮尔逊则系统整理和完善了当时的已有成果,用极大似然法对相关系数的估计问题做了改进,并把相关和回归方法运用到生物测量数据,推动了这一方法在生物领域的应用。

回归和相关方法的创立,为统计方法增添了重要的工具,推动了统计学的应用和发展,标志着统计学描述时代的结束和推断时代的开始。随着时代的发展,“回归”一词的内涵得到了极大扩展,它可以泛指在任何情况下自变量与因变量之间的统计关系;回归分析、相关分析也在科学研究的各个方面得到广泛应用,成为探索变量之间关系的重要方法。

请你进一步查阅资料,了解回归与相关的发展和应用.