9.1.1 简单随机抽样

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 7 页

原书扫描页

原书 page-0181
page-0181
原书 page-0182
page-0182
原书 page-0183
page-0183
原书 page-0184
page-0184
原书 page-0185
page-0185
原书 page-0186
page-0186
原书 page-0187
page-0187

文字转写

随着社会的发展,抽样调查的应用范围越来越广泛。下面我们研究两种基本的抽样方法——简单随机抽样和分层随机抽样。

9.1.1 简单随机抽样

抽样调查的目的是了解总体的情况。例如,抽样调查一批待售袋装牛奶的细菌数是否超标,其目的是要了解整批牛奶的细菌含量超标情况,而不只是局限在抽查到的那几袋牛奶的情况。因此,通过抽样调查了解总体的情况,自然希望抽取的样本数据能很好地反映总体的情况,即样本含有和总体基本相同的信息。

探究

假设口袋中有红色和白色共1000个小球,除颜色外,小球的大小、质地完全相同。你能通过抽样调查的方法估计袋中红球所占的比例吗?

这里袋中所有小球是调查的总体,每一个小球是个体,小球的颜色是所关心的变量。我们可以从袋中随机地摸出一个球,记录颜色后放回,摇匀后再摸出一个球,如此重复 nn 次。根据初中的概率知识可知,随着摸球次数的增加,摸到红球的频率会逐渐稳定于摸到红球的概率,即口袋中红球所占的比例。因此,我们可以通过放回摸球,用频率估计出红球的比例。

在有放回地摸球中,同一个小球有可能被摸中多次,极端情况是每次摸到同一个小球,而被重复摸中的小球只能提供同一个小球的颜色信息。如果我们采用不放回摸球,即从袋中摸出一个球后不再放回袋中,每次摸球都在余下的球中随机摸取,这样就可以避免同一个小球被重复摸中。特别地,当样本量 n=1000n = 1000 时,不放回摸球已经把袋中的所有球取出,这就完全了解了袋中红球的比例,而有放回摸球一般还不能对袋中红球的比例作出准确的判断。

一般地,设一个总体含有 NNNN 为正整数)个个体,从中逐个抽取 nn1n<N1 \leqslant n < N)个个体作为样本,如果抽取是放回的,且每次抽取时总体内的各个个体被抽到的概率都相等,我们把这样的抽样方法叫做放回简单随机抽样;如果抽取是不放回的,且每次抽取时总体内未进入样本的各个个体被抽到的概率都相等,我们把这样的抽样方法叫做不放回简

● ●

从总体中,逐个不放回地随机抽取 n 个个体作为样本,一次性批量随机抽取 n 个个体作为样本,两种方法是等价的.

单随机抽样. 放回简单随机抽样和不放回简单随机抽样统称为简单随机抽样(simple random sampling). 通过简单随机抽样获得的样本称为简单随机样本.

与放回简单随机抽样比较,不放回简单随机抽样的效率更高,因此实践中人们更多采用不放回简单随机抽样。除非特殊声明,本章所称的简单随机抽样指不放回简单随机抽样。

问题1 一家家具厂要为树人中学高一年级制作课桌椅,他们事先想了解全体高一年级学生的平均身高,以便设定可调节课桌椅的标准高度。已知树人中学高一年级有712名学生,如果要通过简单随机抽样的方法调查高一年级学生的平均身高,应该怎样抽取样本?

在这个问题中,树人中学全部高一年级的学生构成调查的总体,每一位学生是个体,学生的身高是调查的变量。与“探究”栏目中估计红球的比例类似,我们可以对高一年级进行简单随机抽样,用抽出的样本的平均身高估计高一年级学生的平均身高。实现简单随机抽样的方法有很多,抽签法和随机数法是比较常用的两种方法。

1. 抽签法

先给 712 名学生编号,例如按 1~712 进行编号。然后把所有编号写在外观、质地等无差别的小纸片(也可以是卡片、小球等)上作为号签,并将这些小纸片放在一个不透明的盒里,充分搅拌。最后从盒中不放回地逐个抽取号签,使与号签上的编号对应的学生进入样本,直到抽足样本所需要的人数。

抽签法简单易行,但当总体较大时,操作起来比较麻烦。因此,抽签法一般适用于总体中个体数不多的情形。

2. 随机数法

先给 712 名学生编号,例如按 1~712 进行编号。用随机数工具产生 1~712 范围内的整数随机数,把产生的随机数作为抽中的编号,使与编号对应的学生进入样本。重复上述过程,直到抽足样本所需要的人数。

如果生成的随机数有重复,即同一编号被多次抽到,可以剔除重复的编号并重新产生随机数,直到产生的不同编号个数等于样本所需要的人数.

(1) 用随机试验生成随机数

准备 10 个大小、质地一样的小球,小球上分别写上数字 0,1,2,…,9,把它们放入一个不透明的袋中。从袋中有放回摸取 3 次,每次摸取前充分搅拌,并把第一、二、三

为什么要给学生编号?编号用学号可以吗?

比较随机数法与抽签法,它们各有什么优点和缺点?

● ●

一般说来,在计算器或计算机软件没有特殊设定的情况下,它们生成的随机数都是可重复的。为了确认你使用的计算器或计算机软件的情况,可以查阅它的说明书,也可以通过测试它能否生成3个整数随机数1或2来进行判断。

次摸到的数字分别作为百、十、个位数,这样就生成了一个三位随机数。如果这个三位数在 17121\sim 712 范围内,就代表对应编号的学生被抽中,否则舍弃编号。这样产生的随机数可能会有重复。

(2) 用信息技术生成随机数

①用计算器生成随机数

进入计算器的计算模式(不同的计算器型号可能会有不同),调出生成随机数的函数并设置参数,例如 RandInt#(1,712),按 “=” 键即可生成 1~712 范围内的整数随机数。重复按 “=” 键,可以生成多个随机数。这样产生的随机数可能会有重复。

②用电子表格软件生成随机数

在电子表格软件的任一单元格中,输入 “=RANDBETWEEN(1,712)”,即可生成一个 1~712 范围内的整数随机数。再利用电子表格软件的自动填充功能,可以快速生成大量的随机数(图 9.1-1)。这样产生的随机数可能会有重复。

图 9.1-1

③用 R 统计软件生成随机数

在 R 软件的控制台中,输入 “sample(1:712,50,replace=F)”,按回车键,就可以得到 50 个 1~712 范围内的不重复的整数随机数(图 9.1-2).

图 9.1-2

● ●

R 软件是免费的统计软件,该软件具有比较强大的数据处理、绘图和分析等统计功能,在统计学研究和学习中被广泛使用.

随着信息技术的发展,人们越来越多地利用计算器、数学软件、统计软件等工具来生成随机数。尤其是一些统计软件,可以非常方便地按要求生成各种随机数。用信息技术工具产生随机数最大的优点是方便、快捷。

思考

用简单随机抽样方法抽取样本,样本量是否越大越好?

我们知道,在重复试验中,试验次数越多,频率接近概率的可能性越大。与此类似,用简单随机抽样的方法抽取学生,样本量越大,样本中不同身高的比例接近总体中相应身高的比例的可能性也越大,样本的平均身高接近总体的平均身高的可能性也越大。即对于样本的代表性,一般说来,样本量大的会好于样本量小的。尤其是样本量不大时,增加样本量可以较好地提高估计的效果。但是,在实际抽样中,样本量的增大会导致调查的人力、费用、时间等成本的增加。因此,抽样调查中样本量的选择要根据实际问题的需要,并不一定是越大越好。

• •

在简单随机抽样调查中,当样本量和总体一样大时,就是全面调查了。

练习

  1. 在以下调查中,总体、个体各是什么?哪些适合用全面调查?哪些适合用抽样调查?

(1)调查一个班级学生每周的体育锻炼时间;

(2) 调查一个地区结核病的发病率;

(3)调查一批炮弹的杀伤半径;

(4) 调查一个水库所有鱼中草鱼所占的比例.

请你再举一些不宜用全面调查的例子,并说明理由.

  1. 如图,由均匀材质制成的一个正二十面体(每个面都是正三角形),将 20 个面平分成 10 组,第 1 组标上 0,第 2 组标上 1,…,第 10 组标上 9. (1)投掷正二十面体,若把朝上一面的数字作为投掷结果,则出现 0, 1, 2, …, 9 是等可能的吗?

(2) 三个正二十面体分别涂上红、黄、蓝三种颜色,分别代表百位、十位、个位,同时投掷可以产生一个三位数(百位为 0 的也看作三位数),它是 000~999 范围内的随机数吗?

(第2题)

  1. 实验室的笼子里共有 100 只小白鼠,现要从中抽取 10 只作试验用。下列两种情况是否属于简单随机抽样?请说明理由。

(1)每次不经任何挑选地抓一只,抓满10只为止;

(2)将笼中的100只小白鼠按 11001\sim 100 编号,任意选出编号范围内的10个不重复数字,把相应编号

的小白鼠作为试验用的小白鼠.

  1. 如果计算器只能生成 [0,1)[0, 1) 内的随机数,你有办法把它转化为 11001 \sim 100 范围内的整数随机数吗?转化为 17121 \sim 712 范围内的整数随机数呢?

  2. 在抽样调查中,请你说说通过“随机”选择样本的优、缺点.

下面是用随机数法从树人中学高一年级学生中抽取的一个容量为 50 的简单随机样本,他们的身高变量值(单位:cm)如下:

由这些样本观测数据,我们可以计算出样本的平均数为164.3。据此,可以估计树人中学高一年级学生的平均身高为 164.3cm164.3\mathrm{cm} 左右。

上面我们通过简单随机抽样得到部分学生的平均身高,并把样本平均身高作为树人中学高一年级所有学生平均身高的估计值.

一般地,总体中有 N 个个体,它们的变量值分别为 Y1,Y2,,YNY_{1}, Y_{2}, \cdots, Y_{N} ,则称

Y=Y1+Y2++YNN=1Ni=1NYi\overline {{Y}} = \frac {Y _ {1} + Y _ {2} + \cdots + Y _ {N}}{N} = \frac {1}{N} \sum_ {i = 1} ^ {N} Y _ {i}

为总体均值(population mean),又称总体平均数。如果总体的 N 个变量值中,不同的值共有 k(kN)k (k \leqslant N) 个,不妨记为 Y1,Y2,,YkY_{1}, Y_{2}, \cdots, Y_{k} ,其中 YiY_{i} 出现的频数 fi(i=1,2,,k)f_{i} (i = 1, 2, \cdots, k) ,则总体均值还可以写成加权平均数的形式

Y=1Ni=1kfiYi.\overline {{Y}} = \frac {1}{N} \sum_ {i = 1} ^ {k} f _ {i} Y _ {i}.

如果从总体中抽取一个容量为 n 的样本,它们的变量值分别为 y1y_{1}y2y_{2}\cdotsyny_{n} ,则称

y=y1+y2++ynn=1ni=1nyi\overline {{y}} = \frac {y _ {1} + y _ {2} + \cdots + y _ {n}}{n} = \frac {1}{n} \sum_ {i = 1} ^ {n} y _ {i}

为样本均值(sample mean),又称样本平均数.在简单随机抽样中,我们常用样本平均数 y\overline{y} 去估计总体平均数 Y\overline{Y}

• •

∑为求和符号,读音为/sigmə/,主要用于多项式求和.

i=1NYi=Y1+Y2++YN.\sum_ {i = 1} ^ {N} Y _ {i} = Y _ {1} + Y _ {2} + \dots + Y _ {N}.

很多科学型计算器都具有求平均数的功能. 只要输入数据, 按相应的键, 就可以快速求出平均数.

探究

小明想考察一下简单随机抽样的估计效果。他从树人中学医务室得到了高一年级学生身高的所有数据,计算出整个年级学生的平均身高为 165.0cm165.0\mathrm{cm} 。然后,小明用简单随机抽样的方法,从这些数据中抽取了样本量为50和100的样本各10个,分别计算出样本平均数,如表9.1-1所示。从小明多次抽样所得的结果中,你有什么发现?

为了更方便地观察数据,以便我们分析样本平均数的特点以及与总体平均数的关系,我们把这20次试验的平均数用图形表示出来,如图9.1-3所示。图中的红线表示树人中学高一年级全体学生身高的平均数。

从试验结果看,不管样本量为50,还是为100,不同样本的平均数往往是不同的。由于样本的选取是随机的,因此样本平均数也具有随机性,这与总体平均数是一个确定的数不同。虽然在所有20个样本平均数中,与总体平均数完全一致的很少,但除了样本量为50的第2个样本外,样本平均数偏离总体平均数都不超过 1cm1\mathrm{cm},即大部分样本平均数离总体平均数不远,在总体平均数附近波动。比较样本量为50和样本量为100的样本平均数,还可以发现样本量为100的波动幅度明显小于样本量为50的,这与我们对增加样本量可以提高估计效果的认识是一致的。

总体平均数是总体的一项重要特征。另外,某类个体在总体中所占的比例也是人们关心的一项总体特征,例如全部产品中合格品所占的比例、赞成某项政策的人在整个人群中所占的比例等。

问题 2 眼睛是心灵的窗口,保护好视力非常重要。树人中学在 “全国爱眼日” 前,想通过简单随机抽样的方法,了解一下全校 2174 名学生中视力不低于 5.0 的学生所占的比例,你觉得该怎么做?

在这个问题中,全校学生构成调查的总体,每一位学生是个体,学生的视力是考察的变量。为了便于问题的描述,我们记“视力不低于5.0”为1,“视力低于5.0”为0,则第 i(i=1,2,,2 174)i(i=1,2,\cdots,2\ 174) 个学生的视力变量值为

Yi={1,视力不低于5.0,0,视力低于5.0.Y _ {i} = \left\{ \begin{array}{l l} 1, & \text {视力不低于} 5. 0, \\ 0, & \text {视力低于} 5. 0. \end{array} \right.

于是,在全校学生中,“视力不低于5.0”的人数就是 Y1+Y2++Y2174Y_{1}+Y_{2}+\cdots+Y_{2174} 。可以发现,在总体中,“视力不低于5.0”的人数所占的比例P就是学生视力变量的总体平均数

P=Y1+Y2++Y21742174=Y.P = \frac {Y _ {1} + Y _ {2} + \cdots + Y _ {2 1 7 4}}{2 1 7 4} = \overline {{Y}}.

类似地,若抽取容量为 n 的样本,把它们的视力变量值分别记为 y1y_{1}y2y_{2}\cdotsyny_{n} ,则在样本中,“视力不低于 5.0”的人数所占的比例 p 就是学生视力变量的样本平均数

p=y1+y2++ynn=y.p = \frac {y _ {1} + y _ {2} + \cdots + y _ {n}}{n} = \overline {{y}}.

我们可以用样本平均数 y\overline{y} 估计总体平均数 Y\overline{Y} ,用样本中的比例p估计总体中的比例P.

现在,我们从树人中学所有学生中抽取一个容量为 50 的简单随机样本,其视力变量取值如下:

1101001011100011010001110110111 1 0 1 0 0 1 0 1 1 \quad 1 0 0 0 1 1 0 1 0 0 \quad 0 1 1 1 0 1 1 0 1 1

110110101000100111001 1 0 1 1 0 1 0 1 0 \quad 0 0 1 0 0 1 1 1 0 0

由样本观测数据,我们可以计算出样本平均数为

\overline {{y}} = 0. 5 4.\tag{R}

据此,我们估计在树人中学全体学生中,“视力不低于5.0”的比例约为0.54.

简单随机抽样方法简单、直观,用样本平均数估计总体平均数也比较方便。简单随机抽样是一种基本抽样方法,是其他抽样方法的基础。但在实际应用中,简单随机抽样有一定的局限性。例如,当总体很大时,简单随机抽样给所有个体编号等准备工作非常费事,甚至难以做到;抽中的个体往往很分散,要找到样本中的个体并实施调查会遇到很多困难;简单随机抽样没有利用其他辅助信息,估计效率不是很高;等等。因此,在规模较大的调查中,直接采用简单随机抽样的并不多,一般是把简单随机抽样和其他抽样方法组合使用。