9.2.4 总体离散程度的估计

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 9 页

原书扫描页

原书 page-0218
page-0218
原书 page-0219
page-0219
原书 page-0220
page-0220
原书 page-0221
page-0221
原书 page-0222
page-0222
原书 page-0223
page-0223
原书 page-0224
page-0224
原书 page-0225
page-0225
原书 page-0226
page-0226

文字转写

当年,统计学家就是利用上述方法估计德军每月生产的坦克数的。

你还能想出其他估计德军每月生产的坦克数的方法吗?例如,用样本编号的平均数作为每月生产坦克编号的平均数等,比较一下哪种方法更合理。

9.2.4 总体离散程度的估计

平均数、中位数和众数为我们提供了一组数据的集中趋势的信息,这是概括一组数据的特征的有效方法。但仅知道集中趋势的信息,很多时候还不能使我们做出有效决策,下面的问题就是一个例子。

问题 3 有两位射击运动员在一次射击测试中各射靶 10 次,每次命中的环数如下:

如果你是教练,你如何对两位运动员的射击情况作出评价?如果这是一次选拔性考核,你应当如何作出选择?

通过简单的排序和计算,可以发现甲、乙两名运动员射击成绩的平均数、中位数、众数都是7.从这个角度看,两名运动员之间没有差别.但从图9.2-13中看,甲的成绩比较分散,乙的成绩相对集中,即甲的成绩波动幅度比较大,而乙的成绩比较稳定.可见,他们的射击成绩是存在差异的.那么,如何度量成绩的这种差异呢?

一种简单的度量数据离散程度的方法就是用极差.根据甲、乙运动员的10次射击成

绩,可以得到

甲命中环数的极差=104=6,\text {甲命中环数的极差} = 1 0 - 4 = 6,

乙命中环数的极差=95=4.\text {乙命中环数的极差} = 9 - 5 = 4.

可以发现甲的成绩波动范围比乙的大。极差在一定程度上刻画了数据的离散程度。但因为极差只使用了数据中最大、最小两个值的信息,对其他数据的取值情况没有涉及,所以极差所含的信息量很少。

我们知道,如果射击的成绩很稳定,那么大多数的射击成绩离平均成绩不会太远;相反,如果射击的成绩波动幅度很大,那么大多数的射击成绩离平均成绩会比较远。因此,我们可以通过这两组射击成绩与它们的平均成绩的“平均距离”来度量成绩的波动幅度。

思考

如何定义“平均距离”?

假设一组数据是 x1,x2,,xnx_{1}, x_{2}, \cdots, x_{n} ,用 x\overline{x} 表示这组数据的平均数。我们用每个数据与平均数的差的绝对值作为“距离”,即

xix(i=1,2,,n)\mid x _ {i} - \overline {{x}} \mid (i = 1, 2, \dots , n)

作为 xix_{i}xˉ\bar{x} 的 “距离”. 可以得到这组数据 x1,x2,,xnx_{1}, x_{2}, \cdots, x_{n}xˉ\bar{x} 的 “平均距离” 为

1ni=1nxix.\frac {1}{n} \sum_ {i = 1} ^ {n} \mid x _ {i} - \overline {{x}} \mid .

为了避免式中含有绝对值,通常改用平方来代替,即

\frac {1}{n} \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}.\tag{1}

我们称(1)式为这组数据的方差(variance)。有时为了计算方差的方便,我们还把方差写成以下形式

你还能想出其他刻画数据离散程度的办法吗?

1ni=1nxi2x2.\frac {1}{n} \sum_ {i = 1} ^ {n} x _ {i} ^ {2} - \overline {{x}} ^ {2}.

由于方差的单位是原始数据的单位的平方,与原始数据不一致。为了使二者单位一致,我们对方差开平方,取它的算术平方根,即

\sqrt {\frac {1}{n} \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}}.\tag{2}

我们称(2)式为这组数据的标准差(standard deviation).

想一想,为什么用“平均距离”刻画离散程度,用“总距离”行吗?

● ●

可以使用计算器求一组数据的方差. 需要注意的是, 计算器可能按 1n1i=1n(xixˉ)2\frac{1}{n-1}\sum_{i=1}^{n}(x_{i}-\bar{x})^{2} 计算方差, 此时需要乘 n1n\frac{n-1}{n} 进行调整.

标准差的取值范围是什么?标准差为0的一组数据有什么特点?

如果总体中所有个体的变量值分别为 Y1Y_{1}Y2Y_{2}\cdotsYNY_{N} ,总体平均数为 Y\overline{Y} ,则称

S2=1Ni=1N(YiY)2S ^ {2} = \frac {1}{N} \sum_ {i = 1} ^ {N} (Y _ {i} - \overline {{Y}}) ^ {2}

为总体方差, S=S2S=\sqrt{S^{2}} 为总体标准差。与总体均值类似,总体方差也可以写成加权的形式。如果总体的 N 个变量值中,不同的值共有 k(kN)k(k\leqslant N) 个,不妨记为 Y1,Y2,,YkY_{1}, Y_{2}, \cdots, Y_{k} ,其中 YiY_{i} 出现的频数为 fi(i=1,2,,k)f_{i}(i=1, 2, \cdots, k) ,则总体方差为

S2=1Ni=1kfi(YiY)2.S ^ {2} = \frac {1}{N} \sum_ {i = 1} ^ {k} f _ {i} (Y _ {i} - \overline {{Y}}) ^ {2}.

如果一个样本中个体的变量值分别为 y1y_{1}y2y_{2}\cdotsyny_{n} ,样本平均数为 y\overline{y} ,则称

s2=1ni=1n(yiy)2s ^ {2} = \frac {1}{n} \sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) ^ {2}

为样本方差, s=s2s=\sqrt{s^{2}} 为样本标准差.

标准差刻画了数据的离散程度或波动幅度,标准差越大,数据的离散程度越大;标准差越小,数据的离散程度越小。显然,在刻画数据的分散程度上,方差和标准差是一样的。但在解决实际问题中,一般多采用标准差。

在实际问题中,总体平均数和总体标准差都是未知的。就像用样本平均数估计总体平均数一样,通常我们也用样本标准差去估计总体标准差。在随机抽样中,样本标准差依赖于样本的选取,具有随机性。

在问题 3 中,我们可以根据标准差来判断两名运动员的成绩的离散程度,计算可得

s=2,s1.095.s _ {\text {甲}} = 2, s _ {\text {乙}} \approx 1. 0 9 5.

s>ss_{甲} > s_{乙} 可知,甲的成绩离散程度大,乙的成绩离散程度小。由此可以估计,乙比甲的射击成绩稳定。

如果要从这两名选手中选择一名参加比赛,要看一下他们的平均成绩在所有参赛选手中的位置。如果两人都排在前面,就选成绩稳定的乙选手,否则可以选甲。

例 6 在对树人中学高一年级学生身高的调查中,采用样本量比例分配的分层随机抽样,如果不知道样本数据,只知道抽取了男生 23 人,其平均数和方差分别为 170.6 和 12.59,抽取了女生 27 人,其平均数和方差分别为 160.6 和 38.62。你能由这些数据计算出总样本的方差,并对高一年级全体学生的身高方差作出估计吗?

解:把男生样本记为 x1x_{1}x2x_{2} ,…, x23x_{23} ,其平均数记为 x\overline{x} ,方差记为 sx2s_{x}^{2} ;把女生样本记为 y1y_{1}y2y_{2} ,…, y27y_{27} ,其平均数记为 y\overline{y} ,方差记为 sy2s_{y}^{2} ;把总样本数据的平均数记为 z\overline{z} ,方差记为 s2s^{2} .

根据方差的定义,总样本方差为

s2=150[i=123(xiz)2+j=127(yjz)2]s ^ {2} = \frac {1}{5 0} \bigl [ \sum_ {i = 1} ^ {2 3} (x _ {i} - \overline {{z}}) ^ {2} + \sum_ {j = 1} ^ {2 7} (y _ {j} - \overline {{z}}) ^ {2} \bigr ]

=150[i=123(xix+xz)2+j=127(yjy+yz)2].= \frac {1}{5 0} [ \sum_ {i = 1} ^ {2 3} (x _ {i} - \overline {{x}} + \overline {{x}} - \overline {{z}}) ^ {2} + \sum_ {j = 1} ^ {2 7} (y _ {j} - \overline {{y}} + \overline {{y}} - \overline {{z}}) ^ {2} ].

i=123(xix)=i=123xi23x=0\sum_{i=1}^{23}(x_i - \overline{x}) = \sum_{i=1}^{23} x_i - 23\overline{x} = 0,可得

i=1232(xix)(xz)=2(xz)i=123(xix)=0.\sum_ {i = 1} ^ {2 3} 2 (x _ {i} - \overline {{x}}) (\overline {{x}} - \overline {{z}}) = 2 (\overline {{x}} - \overline {{z}}) \sum_ {i = 1} ^ {2 3} (x _ {i} - \overline {{x}}) = 0.

同理可得

j=1272(yjy)(yz)=0.\sum_ {j = 1} ^ {2 7} 2 (y _ {j} - \overline {{y}}) (\overline {{y}} - \overline {{z}}) = 0.

因此,

\begin{array}{r l} s ^ {2} & = \frac {1}{5 0} \left[ \sum_ {i = 1} ^ {2 3} (x _ {i} - \overline {{x}}) ^ {2} + \sum_ {i = 1} ^ {2 3} (\overline {{x}} - \overline {{z}}) ^ {2} + \sum_ {j = 1} ^ {2 7} (y _ {j} - \overline {{y}}) ^ {2} + \sum_ {j = 1} ^ {2 7} (\overline {{y}} - \overline {{z}}) ^ {2} \right] \\ & = \frac {1}{5 0} \left\{2 3 \left[ s _ {x} ^ {2} + (\overline {{x}} - \overline {{z}}) ^ {2} \right] + 2 7 \left[ s _ {y} ^ {2} + (\overline {{y}} - \overline {{z}}) ^ {2} \right] \right\}. \end{array}\tag{①}

x=170.6,y=160.6\overline{x}=170.6,\quad\overline{y}=160.6 ,根据按比例分配分层随机抽样总样本平均数与各层样本平均数的关系,可得总样本平均数为

z=2323+27x+2723+27y=23×170.6+27×160.650=165.2.\begin{array}{r l} \overline {{z}} & = \frac {2 3}{2 3 + 2 7} \overline {{x}} + \frac {2 7}{2 3 + 2 7} \overline {{y}} \\ & = \frac {2 3 \times 1 7 0 . 6 + 2 7 \times 1 6 0 . 6}{5 0} \\ & = 1 6 5. 2. \end{array}

把已知的男生、女生样本平均数和方差的取值代入①,可得

s2=150{23×[12.59+(170.6165.2)2]+27×[38.62+(160.6165.2)2]}=51.4862.\begin{array}{r l} s ^ {2} = & \frac {1}{5 0} \{2 3 \times [ 1 2. 5 9 + (1 7 0. 6 - 1 6 5. 2) ^ {2} ] + 2 7 \times [ 3 8. 6 2 + (1 6 0. 6 - 1 6 5. 2) ^ {2} ] \} \\ = & 5 1. 4 8 6 2. \end{array}

我们可以计算出总样本的方差为 51.4862,并据此估计高一年级学生身高的总体方差为 51.4862.

样本标准差刻画了数据离平均数波动的幅度大小,平均数和标准差一起能反映数据取值的信息。例如,根据9.2.1节中100户居民用户的月均用水量数据,可以计算出样本平均数 x=8.79\overline{x}=8.79 ,样本标准差 s6.20s\approx6.20

xs=2.59,x+s=14.99,x2s=3.61,x+2s=21.19.\begin{array}{c} \overline {{x}} - s = 2. 5 9, \overline {{x}} + s = 1 4. 9 9, \\ \overline {{x}} - 2 s = - 3. 6 1, \overline {{x}} + 2 s = 2 1. 1 9. \end{array}

如图9.2-14所示,可以发现,这100个数据中大部分落在区间 [xs,x+s]=[2.59,14.99][\overline{x} - s, \overline{x} + s] = [2.59, 14.99] 内,在区间 [x2s,x+2s]=[3.61,21.19][\overline{x} - 2s, \overline{x} + 2s] = [-3.61, 21.19] 外的只有7个.也就是说,绝大部分数据落在 [x2s,x+2s][\overline{x} - 2s, \overline{x} + 2s] 内.

练习

  1. 不经过计算,你能给下列各组数的方差排序吗?

(1) 5, 5, 5, 5, 5, 5, 5, 5;

(2) 4, 4, 4, 5, 5, 5, 6, 6, 6;

(3) 3, 3, 4, 4, 5, 6, 6, 7, 7;

(4) 2, 2, 2, 2, 5, 8, 8, 8, 8.

  1. 数据 x1,x2,,xnx_{1}, x_{2}, \cdots, x_{n} 的方差为 sx2s_{x}^{2} ,数据 y1,y2,,yny_{1}, y_{2}, \cdots, y_{n} 的方差为 sy2,a,bs_{y}^{2}, a, b 为常数。证明:

(1)如果 y1=x1+b,y2=x2+b,,yn=xn+by_{1}=x_{1}+b,\quad y_{2}=x_{2}+b,\quad\cdots,\quad y_{n}=x_{n}+b ,那么 sy2=sx2s_{y}^{2}=s_{x}^{2} ;

(2) 如果 y1=ax1y_{1}=ax_{1}y2=ax2y_{2}=ax_{2}\cdotsyn=axny_{n}=ax_{n} ,那么 sy2=a2sx2s_{y}^{2}=a^{2}s_{x}^{2} .

  1. 农场种植的甲、乙两种水稻,在面积相等的两块稻田中连续6年的产量如下:

哪种水稻的产量比较稳定?

  1. 一个小商店从一家公司购进 21 袋白糖,每袋白糖的标准质量是 500 g,为了了解这些白糖的质量情况,称出各袋白糖的质量(单位:g)如下:

(1) 21 袋白糖的平均质量 xˉ\bar{x} 是多少?标准差 s 是多少?

(2) 质量位于 xs\overline{x}-sx+s\overline{x}+s 之间有多少袋白糖?所占的百分比是多少?

  1. 某学校有高中学生 500 人,其中男生 320 人,女生 180 人。有人为了获得该校全体高中学生的身高信息,采用分层抽样的方法抽取样本,并观测样本的指标值(单位:cm),计算得男生样本的均值为 173.5,方差为 17,女生样本的均值为 163.83,方差为 30.03。

(1)根据以上信息,能够计算出总样本的均值和方差吗?为什么?

(2)如果已知男、女样本量按比例分配,你能计算出总样本的均值和方差各为多少吗?

(3)如果已知男、女的样本量都是25,你能计算出总样本的均值和方差各为多少吗?它们分别作为总体均值和方差的估计合适吗?为什么?

习题9.2

复习巩固

  1. 棉花的纤维长度是棉花质量的重要指标. 在一批棉花中随机抽测了 60 根棉花的纤维长度(单位:mm),按从小到大排序结果如下:

(1)请你选择合适的组距,作出这个样本的频率分布直方图,分析这批棉花纤维长度分布的特征;

(2) 请你估计这批棉花的第 5, 95 百分位数.

  1. 甲、乙两台机床同时生产一种零件,在10天中,两台机床每天生产的次品数分别为:

01022031242311021101\begin{array}{c c c c c c c c c c c} \text {甲} & 0 & 1 & 0 & 2 & 2 & 0 & 3 & 1 & 2 & 4 \\ \text {乙} & 2 & 3 & 1 & 1 & 0 & 2 & 1 & 1 & 0 & 1 \end{array}

分别计算这两组数据的平均数和标准差,从计算结果看,哪台机床的性能更好?

  1. 在去年的足球联赛上,一队每场比赛平均失球数是1.5,全年比赛失球个数的标准差为1.1;二队每场比赛平均失球数是2.1,全年失球个数的标准差是0.4。你认为下列说法中哪一种是正确的,为什么?

(1)平均说来一队比二队防守技术好;

(2) 二队比一队技术水平更稳定;

(3)一队在防守中有时表现较差,有时表现又非常好;

(4) 二队很少不失球.

  1. 数据 x1,x2,,xnx_{1}, x_{2}, \cdots, x_{n} 的方差和标准差分别为 sx2,sxs_{x}^{2}, s_{x} ,数据 y1,y2,,yny_{1}, y_{2}, \cdots, y_{n} 的方差和标准差分别为 sy2,sys_{y}^{2}, s_{y} 。若 y1=ax1+b,y2=ax2+b,,yn=axn+by_{1} = ax_{1} + b, y_{2} = ax_{2} + b, \cdots, y_{n} = ax_{n} + b 成立,a, b 为常数,证明: sy2=a2sx2,sy=asxs_{y}^{2} = a^{2}s_{x}^{2}, s_{y} = |a|s_{x}

  2. 数据 x1,x2,,xnx_{1}, x_{2}, \cdots, x_{n} 的方差 s2=0s^{2}=0 ,证明:所有的 xi(i=1,2,,n)x_{i}(i=1, 2, \cdots, n) 都相同.

  1. 以往的招生统计数据显示,某所大学录取的新生高考总分的中位数基本上稳定在 550 分。你的一位高中校友在今年的高考中得了 520 分,你是立即劝阻他报考这所大学,还是先进一步查阅一下这所大学以往招生的其他统计信息?解释一下你的选择。

  2. 甲、乙两个班级,一次数学考试的分数排序如下:

请你就这次考试成绩,对两个班级的数学学习情况进行评价.

  1. 有一种鱼的身体吸收汞,一定量身体中汞的含量超过其体重的 1.00×1061.00 \times 10^{-6} 的鱼被人食用后,就会对人体产生危害。在 30 条鱼的样本中发现的汞含量(乘百万分之一)如下: 0.07 0.24 0.95 0.98 1.02 0.98 1.37 1.40 0.39 1.02 1.44 1.58 0.54 1.08 0.61 0.72 1.20 1.14 1.62 1.68 1.85 1.20 0.81 0.82 0.84 1.29 1.26 2.10 0.91 1.31

(1)请用合适的统计图描述上述数据,并分析这30条鱼的汞含量的分布特点;

(2) 求出上述样本数据的平均数和标准差;

(3) 从实际情况看, 许多鱼的汞含量超标的原因是这些鱼在出售之前没有被检测过. 你认为每批这种鱼的平均汞含量都比 1.00×1061.00 \times 10^{-6} 大吗?

(4)在上述样本中,有多少条鱼的汞含量在以平均数为中心、2倍标准差的范围内?

  1. 在一次人才招聘会上,有一家公司的招聘员告诉你,“我们公司的收入水平很高”“去年,在50名员工中,最高年收入达到了200万,员工年收入的平均数是10万”,而你的预期是获得9万元年薪.

(1) 你是否能够判断年薪为 9 万元的员工在这家公司算高收入者?

(2) 如果招聘员继续告诉你,“员工年收入的变化范围是从 3 万到 200 万”,这个信息是否足以使你作出自己是否受聘的决定?为什么?

(3)如果招聘员继续给你提供了如下信息,员工收入的第一四分位数为4.5万,第三四分位数为9.5万,你又该如何使用这条信息来作出是否受聘的决定?

(4)根据(3)中招聘员提供的信息,你能估计出这家公司员工收入的中位数是多少吗?为什么平均数比估计出的中位数高很多?

  1. 有 20 种不同的零食,每 100 g100 \mathrm{~g} 可食部分包含的能量(单位:kJ\mathrm{kJ})如下:

110 120 123 165 432 190 174 235 428 318

249 280 162 146 210 120 123 120 150 140

(1)以上述 20 个数据组成总体,求总体平均数与总体标准差.

(2) 设计恰当的随机抽样方法,从总体中抽取一个容量为 7 的样本,求样本的平均数与标准差.

(3)利用上面的抽样方法,再抽取容量为7的样本,计算样本的平均数和标准差。这个样本的平均数和标准差与(2)中的结果一样吗?为什么?

(4)利用(2)中的随机抽样方法,分别从总体中抽取一个容量为10,13,16,19的样本,求样本的平均数与标准差。分析样本量与样本的平均数和标准差对总体的估计效果之间有什么关系。

拓广探索

  1. 已知总体划分为3层,通过分层随机抽样,各层抽取的样本量、样本平均数和样本方差分别为: l,x,s12;m,y,s22;n,z,s32l, \overline{x}, s_{1}^{2}; m, \overline{y}, s_{2}^{2}; n, \overline{z}, s_{3}^{2} . 记总的样本平均数为 w\overline{w} ,样本方差为 s2s^{2} ,证明:

(1)w=ll+m+nx+ml+m+ny+nl+m+nz;(\text {1}) \overline {{w}} = \frac {l}{l + m + n} \overline {{x}} + \frac {m}{l + m + n} \overline {{y}} + \frac {n}{l + m + n} \overline {{z}};

s ^ {2} = \frac {1}{l + m + n} \left\{l \left[ s _ {1} ^ {2} + (\overline {{x}} - \overline {{w}}) ^ {2} \right] + m \left[ s _ {2} ^ {2} + (\overline {{y}} - \overline {{w}}) ^ {2} \right] + n \left[ s _ {3} ^ {2} + (\overline {{z}} - \overline {{w}}) ^ {2} \right] \right\} \tag {2}

  1. 调查本班每名同学的家庭在同一周的用电量,从中你能发现什么信息?写一份简短的统计报告,说明你发现的信息.

? 阅读与思考

大数据

“大数据”正在改变着世界,改变着人们的思维方式和行为方式,“大数据”造福于人类的事例不胜枚举。例如,在医疗方面,医院利用大量病人的临床医疗信息,通过大数据分析,可以极大提高病情诊断水平;在教育方面,通过对学生的测试成绩进行分析、追踪,可以提高评估学生学习状况的准确性,有效提高教学质量;在能源方面,通过分析气象数据,可以找出建设风电场的最佳地点,更高效地利用风力能源,更有效地降低成本。

同学们知道吗,从2016年12月29日到2017年1月4日,一周之内,神秘棋手“大师(Master)”以60连胜的战绩战胜所有对手,其中包括当时中日韩的围棋顶级职业棋手柯洁、井山裕太、朴廷桓以及聂卫平、常昊等一代传奇。实际上,“大师”就是2016年3月以4:1的总比分战胜围棋世界冠军李世石九段的谷歌围棋人工智能“阿尔法狗(AlphaGo)”。阿尔法狗的神速进步,根本在于大数据的积累及洞察,将人类智慧经验变成了具体化、可视化、能精准判断、可以快速学习运用的方式,从而使自己的行为不断优化,水平越来越高。所以可以说阿尔法狗“横扫世界围棋界”,本质是大数据深度运用后的效果。

信息化时代,人们越来越意识到数据的重要性,越来越强调依托数据和数据分析结果做出决策。可以毫不夸张地说,大数据已经开启了一次重大的时代转型。

请同学们查阅图书或互联网,了解大数据的有关内容,包括大数据产生的社会背景,大数据研究的内容和重要结果,大数据方法在某一领域的具体应用等,体会大数据对当代社会发展的作用.