9.1.2 分层随机抽样

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 5 页

原书扫描页

原书 page-0188
page-0188
原书 page-0189
page-0189
原书 page-0190
page-0190
原书 page-0191
page-0191
原书 page-0192
page-0192

文字转写

练习

  1. 为了合理调配电力资源,某市欲了解全市 50 000 户居民的日用电量。若通过简单随机抽样从中抽取了 300 户进行调查,得到其日用电量的平均数为 5.5kWh5.5 \, kW \cdot h ,则可以推测全市居民用户日用电量的平均数(). (A) 一定为 5.5kWh5.5 \, kW \cdot h (B) 高于 5.5kWh5.5 \, kW \cdot h (C) 低于 5.5kWh5.5 \, kW \cdot h (D) 约为 5.5kWh5.5 \, kW \cdot h

  2. 在学生身高的调查中,小明和小华分别独立进行了简单随机抽样调查。小明调查的样本平均数为166.4,样本量为100;小华调查的样本平均数为164.7,样本量为200。你更愿意把哪个值作为总体平均数的估计?是不是你选的值一定比另一个更接近总体平均数?说说你的理由。

  3. 找一组数据作为总体,自行设定样本量,进行多次简单随机抽样。观察样本量对估计总体平均数的影响,并试着解释其中的原因。

9.1.2 分层随机抽样

抽样调查最核心的问题是样本的代表性。简单随机抽样是使总体中每一个个体都有相等的机会被抽中,但因为抽样的随机性,有可能会出现比较“极端”的样本。例如,在对树人中学高一年级学生身高的调查中,可能出现样本中50个个体大部分来自高个子或矮个子的情形。这种“极端”样本的平均数会大幅度地偏离总体平均数,从而使估计出现较大误差。

能否利用总体中的一些额外信息对抽样方法进行改进呢?

问题 3 在树人中学高一年级的 712 名学生中,男生有 326 名,女生有 386 名。能否利用这个辅助信息改进简单随机抽样方法,减少“极端”样本的出现,从而提高对整个年级平均身高的估计效果呢?

我们知道,影响身高的因素有很多,性别是其中的一个主要因素。高中男生的身高普遍高于女生的身高,而相同性别的身高差异相对较小。我们可以利用性别和身高的这种关系,把高一年级学生分成男生和女生两个身高有明显差异的群体,对两个群体分别进行简单随机抽样,然后汇总作为总体的一个样本。由于在男生和女生两个群体中都抽取了相应的个体,这样就能有效地避免“极端”样本。

思考

对男生、女生分别进行简单随机抽样,样本量在男生、女生中应如何分配?

自然地,为了使样本的结构与总体的分布相近,人数多的群体应多抽一些,人数少的群体应少抽一些。因此,按男生、女生在全体学生中所占的比例进行分配是一种比较合理

的方式,即

男生样本量=男生人数全体学生数×总样本量,\text {男生样本量} = \frac {\text {男生人数}}{\text {全体学生数}} \times \text {总样本量},

女生样本量=女生人数全体学生数×总样本量.\text {女生样本量} = \frac {\text {女生人数}}{\text {全体学生数}} \times \text {总样本量}.

这样无论是男生还是女生,每个学生被抽到的概率都相等。当总样本量为 50 时,可以计算出从男生、女生中分别应抽取的人数为

n=326712×5023,n _ {\text {男}} = \frac {3 2 6}{7 1 2} \times 5 0 \approx 2 3,

n=386712×5027.n _ {\text {女}} = \frac {3 8 6}{7 1 2} \times 5 0 \approx 2 7.

我们按上述方法抽取了一个容量为 50 的样本,其观测数据(单位:cm)如下:男生

173.0174.0166.0172.0170.0165.0165.0168.0164.0173.0172.0173.0175.0168.0170.0172.0176.0175.0168.0173.0167.0170.0175.0\begin{array}{l l l l l l l l l l} 1 7 3. 0 & 1 7 4. 0 & 1 6 6. 0 & 1 7 2. 0 & 1 7 0. 0 & 1 6 5. 0 & 1 6 5. 0 & 1 6 8. 0 & 1 6 4. 0 & 1 7 3. 0 \\ 1 7 2. 0 & 1 7 3. 0 & 1 7 5. 0 & 1 6 8. 0 & 1 7 0. 0 & 1 7 2. 0 & 1 7 6. 0 & 1 7 5. 0 & 1 6 8. 0 & 1 7 3. 0 \\ 1 6 7. 0 & 1 7 0. 0 & 1 7 5. 0 \end{array}

女生

163.0164.0161.0157.0162.0165.0158.0155.0164.0162.5154.0154.0164.0149.0159.0161.0170.0171.0155.0148.0172.0162.5158.0155.5157.0163.0172.0\begin{array}{c c c c c c c c c c} 1 6 3. 0 & 1 6 4. 0 & 1 6 1. 0 & 1 5 7. 0 & 1 6 2. 0 & 1 6 5. 0 & 1 5 8. 0 & 1 5 5. 0 & 1 6 4. 0 & 1 6 2. 5 \\ 1 5 4. 0 & 1 5 4. 0 & 1 6 4. 0 & 1 4 9. 0 & 1 5 9. 0 & 1 6 1. 0 & 1 7 0. 0 & 1 7 1. 0 & 1 5 5. 0 & 1 4 8. 0 \\ 1 7 2. 0 & 1 6 2. 5 & 1 5 8. 0 & 1 5 5. 5 & 1 5 7. 0 & 1 6 3. 0 & 1 7 2. 0 \end{array}

通过计算,得出男生和女生身高的样本平均数分别为 170.6,160.6。根据男生、女生身高的样本平均数以及他们各自的人数,可以估计总体平均数为

170.6×326+160.6×386712165.2,\frac {1 7 0 . 6 \times 3 2 6 + 1 6 0 . 6 \times 3 8 6}{7 1 2} \approx 1 6 5. 2,

即估计树人中学高一年级学生的平均身高在 165.2cm165.2 \, cm 左右.

上面我们按性别变量,把高一学生划分为男生、女生两个身高差异较小的子总体分别进行抽样,进而得到总体的估计。一般地,按一个或多个变量把总体划分成若干个子总体,每个个体属于且仅属于一个子总体,在每个子总体中独立地进行简单随机抽样,再把所有子总体中抽取的样本合在一起作为总样本,这样的抽样方法称为分层随机抽样(stratified random sampling),每一个子总体称为层。在分层随机抽样中,如果每层样本量都与层的大小成比例,那么称这种样本量的分配方式为比例分配。

在分层随机抽样中,如果层数分为2层,第1层和第2层包含的个体数分别为M和N,抽取的样本量分别为m和n.我们用 X1X_{1}X2X_{2} ,…, XMX_{M} 表示第1层各个个体的变量值,用 x1x_{1}x2x_{2} ,…, xmx_{m} 表示第1层样本的各个个体的变量值;用 Y1Y_{1}Y2Y_{2} ,…, YNY_{N} 表示第2层各个个体的变量值,用 y1y_{1}y2y_{2} ,…, yny_{n} 表示第2层样本的各个个体的变量值,则

第 1 层的总体平均数和样本平均数分别为

X=X1+X2++XMM=1Mi=1MXi,x=x1+x2++xmm=1mi=1mxi.\overline {{X}} = \frac {X _ {1} + X _ {2} + \cdots + X _ {M}}{M} = \frac {1}{M} \sum_ {i = 1} ^ {M} X _ {i}, \overline {{x}} = \frac {x _ {1} + x _ {2} + \cdots + x _ {m}}{m} = \frac {1}{m} \sum_ {i = 1} ^ {m} x _ {i}.

第 2 层的总体平均数和样本平均数分别为

Y=Y1+Y2++YNN=1Ni=1NYi,y=y1+y2++ynn=1ni=1nyi.\overline {{Y}} = \frac {Y _ {1} + Y _ {2} + \cdots + Y _ {N}}{N} = \frac {1}{N} \sum_ {i = 1} ^ {N} Y _ {i}, \overline {{y}} = \frac {y _ {1} + y _ {2} + \cdots + y _ {n}}{n} = \frac {1}{n} \sum_ {i = 1} ^ {n} y _ {i}.

总体平均数和样本平均数分别为

W=i=1MXi+i=1NYiM+N,w=i=1mxi+i=1nyim+n.\overline {{W}} = \frac {\sum_ {i = 1} ^ {M} X _ {i} + \sum_ {i = 1} ^ {N} Y _ {i}}{M + N}, \overline {{w}} = \frac {\sum_ {i = 1} ^ {m} x _ {i} + \sum_ {i = 1} ^ {n} y _ {i}}{m + n}.

由于用第1层的样本平均数 x\overline{x} 可以估计第1层的总体平均数 X\overline{X},用第2层的样本平均数 y\overline{y} 可以估计第2层的总体平均数 Y\overline{Y},因此我们可以用

M×x+N×yM+N=MM+Nx+NM+Ny\frac {M \times \overline {{x}} + N \times \overline {{y}}}{M + N} = \frac {M}{M + N} \overline {{x}} + \frac {N}{M + N} \overline {{y}}

估计总体平均数 W\overline{W} .

在比例分配的分层随机抽样中,

mM=nN=m+nM+N,\frac {m}{M} = \frac {n}{N} = \frac {m + n}{M + N},

可得

MM+Nx+NM+Ny=mm+nx+nm+ny=w.\frac {M}{M + N} \overline {{x}} + \frac {N}{M + N} \overline {{y}} = \frac {m}{m + n} \overline {{x}} + \frac {n}{m + n} \overline {{y}} = \overline {{w}}.

因此,在比例分配的分层随机抽样中,我们可以直接用样本平均数 w\overline{w} 估计总体平均数 W\overline{W} .

探究

与考察简单随机抽样估计效果类似,小明也想通过多次抽样考察一下分层随机抽样的估计效果。他用比例分配的分层随机抽样方法,从高一年级的学生中抽取了10个样本量为50的样本,计算出样本平均数如表9.1-2所示。与上一小节“探究”中相同样本量的简单随机抽样的结果比较,小明有了一个重要的发现。你是否也有所发现?

我们把分层随机抽样的平均数与上一小节样本量为 50 的简单随机抽样的平均数用图形表示(图 9.1-4),其中红线表示整个年级学生身高的平均数.

从试验结果看,分层随机抽样的样本平均数围绕总体平均数波动,与简单随机抽样的结果比较,分层随机抽样并没有明显优于简单随机抽样。但相对而言,分层随机抽样的样本平均数波动幅度更均匀,简单随机抽样中出现了一个(第2个)偏离总体平均数的幅度比较大的样本平均数,即出现了比较“极端”的样本,而分层随机抽样没有出现。

实际上,在个体之间差异较大的情形下,只要选取的分层变量合适,使得各层间差异明显、层内差异不大,分层随机抽样的效果一般会好于简单随机抽样,也好于很多其他抽样方法。分层随机抽样的组织实施也比简单随机抽样方便,而且除了能得到总体的估计外,还能得到每层的估计。

在实际抽样调查中,由于实际问题的复杂性,除了要考虑获得的样本的代表性,还要考虑调查实施中人力、物力、时间等因素,因此通常会把多种抽样方法组合起来使用。例如,在分层抽样中,不同的层内除了用简单随机抽样外,还可以用其他的抽样方法,有时层内还需要再进行分层,等等。

探究

如果要了解某电视节目在你所在地区(城市、乡镇或村庄)的收视率,你能帮忙设计一个抽样方案吗?结合你所在地区的实际情况,和同学展开讨论。

练习

  1. 数据 x1x_{1}x2x_{2} ,…, xmx_{m} 的平均数为 xˉ\bar{x} ,数据 y1y_{1}y2y_{2} ,…, yny_{n} 的平均数为 yˉ\bar{y} ,证明:

i=1mxi+i=1nyim+n=mm+nx+nm+ny.\frac {\sum_ {i = 1} ^ {m} x _ {i} + \sum_ {i = 1} ^ {n} y _ {i}}{m + n} = \frac {m}{m + n} \overline {{x}} + \frac {n}{m + n} \overline {{y}}.

  1. 有人说:“如果抽样方法设计得好,用样本进行视力调查与对 24 300 名学生进行视力普查的结果差不多。而且对于想要掌握学生视力状况的教育部门来说,节省了人力、物力和财力,抽样调查更可

取。”你认为这种说法有道理吗?为什么?

  1. 高二年级有男生 490 人,女生 510 人,张华按男生、女生进行分层,通过分层随机抽样的方法,得到男生、女生的平均身高分别为 170.2 cm 和 160.8 cm.

(1)如果张华在各层中按比例分配样本,总样本量为100,那么在男生、女生中分别抽取了多少名?在这种情况下,请估计高二年级全体学生的平均身高.

(2)如果张华从男生、女生中抽取的样本量分别为30和70,那么在这种情况下,如何估计高二年级全体学生的平均身高更合理?

  1. 要调查全市普通高中高一年级学生中患色盲的比例,小明根据性别对总体进行分层,用分层随机抽样的方法进行调查。请你查阅有关资料,说说这样的分层是否合理。你觉得在选择分层变量时应注意什么?

? 阅读与思考

如何得到敏感性问题的诚实反应

通过调查获取数据的基本方式是询问,调查问卷是询问的依据,也是信息的载体。无论是面对面的调查,如入户调查,还是非面对面的调查,如电话调查、网络调查等,调查问卷都是必需的。问卷设计十分重要,好的问卷是收集高质量数据的基础。

在统计调查中,问卷的设计是一门很大的学问。例如,调查问题的措辞会对被调查者产生影响,举例来说,在“你在多大程度上喜欢吸烟”和“你在多大程度上不喜欢吸烟”这两种问法中,前者会比后者给出更为肯定的答案。再如,问题在问卷中的位置也会对调查者产生影响。一般地,比较容易的、不涉及个人的问题应当排在比较靠前的位置,较难的、涉及个人的问题应排得比较靠后,等等。

对一些敏感性问题,例如学生在考试中有无作弊、某人是否偷税漏税等,更要精心设计问卷及调查方法,设法消除被调查者的顾虑,使他们能够如实回答问题。否则,被调查者往往会拒绝回答,或不提供真实情况。下面我们用一个例子来说明对敏感性问题的调查方法。

某地区的公共卫生部门为了调查本地区中学生的吸烟情况,对随机抽出的200名学生进行了调查。调查中使用了两个问题。

问题1:你父亲的公历生日日期是不是奇数?

问题 2:你是否经常吸烟?

调查者设计了一个随机化装置,这是一个装有大小、形状和质量完全一样的50个白球和50个红球的袋子。每个被调查者随机从袋中摸取1个球(摸出的球再放回袋中),摸到白球的学生如实回答第一个问题,摸到红球的学生如实回答第二个问题,回答“是”的人往一个盒子中放一个小石子,回答“否”的人什么都不要做。由于问题的答案只有“是”和“否”,而且回答的是哪个问题也是别人不知道的,因此被调查者可以毫无顾虑地给出符合实际情况的答案。