8.3 列联表与独立性检验

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 4 页

原书扫描页

原书 page-0129
page-0129
原书 page-0130
page-0130
原书 page-0131
page-0131
原书 page-0132
page-0132

文字转写

8.3 列联表与独立性检验

前面两节所讨论的变量,如人的身高、树的胸径、树的高度、短跑 100m100 \, m 世界纪录和创纪录的时间等,都是数值变量。数值变量的取值为实数,其大小和运算都有实际含义。

在现实生活中,人们经常需要回答一定范围内的两种现象或性质之间是否存在关联性或相互影响的问题。例如,就读不同学校是否对学生的成绩有影响,不同班级学生用于体育锻炼的时间是否有差别,吸烟是否会增加患肺癌的风险,等等。本节将要学习的独立性检验方法为我们提供了解决这类问题的方案。

在讨论上述问题时,为了表述方便,我们经常会使用一种特殊的随机变量,以区别不同的现象或性质,这类随机变量称为分类变量。分类变量的取值可以用实数表示,例如,学生所在的班级可以用1,2,3等表示,男性、女性可以用1,0表示,等等。在很多时候,这些数值只作为编号使用,并没有通常的大小和运算意义。本节我们主要讨论取值于 {0,1}\{0,1\} 的分类变量的关联性问题。

8.3.1 分类变量与列联表

如何利用统计数据判断一对分类变量之间是否具有关联性呢?对于这样的统计问题,有时可以利用普查数据,通过比较相关的比率给出问题的准确回答,但在大多数情况下,需要借助概率的观点和方法。我们先看下面的具体问题。

问题 为了有针对性地提高学生体育锻炼的积极性,某中学需要了解性别因素是否对本校学生体育锻炼的经常性有影响,为此对学生是否经常锻炼的情况进行了普查。全校学生的普查数据如下:523名女生中有331名经常锻炼;601名男生中有473名经常锻炼。你能利用这些数据,说明该校女生和男生在体育锻炼的经常性方面是否存在差异吗?

这是一个简单的统计问题. 最直接的解答方法是, 比较经常锻炼的学生在女生和男生中的比率. 为了方便, 我们设

f0=经常锻炼的女生数女生总数,f1=经常锻炼的男生数男生总数.f _ {0} = \frac {\text {经常锻炼的女生数}}{\text {女生总数}}, f _ {1} = \frac {\text {经常锻炼的男生数}}{\text {男生总数}}.

那么,只要求出 f0f_{0}f1f_{1} 的值,通过比较这两个值的大小,就可以知道女生和男生在锻

炼的经常性方面是否有差异.由所给的数据,经计算得到

f0=3315230.633,f1=4736010.787.f _ {0} = \frac {3 3 1}{5 2 3} \approx 0. 6 3 3, f _ {1} = \frac {4 7 3}{6 0 1} \approx 0. 7 8 7.

f1f00.7870.633=0.154f _ {1} - f _ {0} \approx 0. 7 8 7 - 0. 6 3 3 = 0. 1 5 4

可知,男生经常锻炼的比率比女生高出 15.4 个百分点,所以该校的女生和男生在体育锻炼的经常性方面有差异,而且男生更经常锻炼.

上面的问题还可以通过建立一个古典概型,使用条件概率的语言,给出另外一种解答方法。用 Ω\Omega 表示该校全体学生构成的集合,这是我们所关心的对象的总体。考虑以 Ω\Omega 为样本空间的古典概型,并定义一对分类变量 XXYY 如下:对于 Ω\Omega 中的每一名学生,分别令

X={0,该生为女生,1,该生为男生,Y={0,该生不经常锻炼,1,该生经常锻炼.X = \left\{ \begin{array}{l l} 0, & \text {该生为女生,} \\ 1, & \text {该生为男生,} \end{array} \quad Y = \left\{ \begin{array}{l l} 0, & \text {该生不经常锻炼,} \\ 1, & \text {该生经常锻炼.} \end{array} \right. \right.

我们希望通过比较条件概率 P(Y=1X=0)P(Y=1 \mid X=0)P(Y=1X=1)P(Y=1 \mid X=1) 回答上面的问题。按照条件概率的直观解释,如果从该校女生和男生中各随机选取一名学生,那么该女生属于经常锻炼群体的概率是 P(Y=1X=0)P(Y=1 \mid X=0) ,而该男生属于经常锻炼群体的概率是 P(Y=1X=1)P(Y=1 \mid X=1) 。因此,“性别对体育锻炼的经常性没有影响”可以描述为

P(Y=1X=0)=P(Y=1X=1);P (Y = 1 \mid X = 0) = P (Y = 1 \mid X = 1);

而 “性别对体育锻炼的经常性有影响” 可以描述为

P(Y=1X=0)P(Y=1X=1).P (Y = 1 \mid X = 0) \neq P (Y = 1 \mid X = 1).

为了清楚起见,我们用表格整理数据,如表 8.3-1 所示.

我们用 {X=0,Y=1}\{X=0, Y=1\} 表示事件 {X=0}\{X=0\}{Y=1}\{Y=1\} 的积事件,用 {X=1,Y=1}\{X=1, Y=1\} 表示事件 {X=1}\{X=1\}{Y=1}\{Y=1\} 的积事件。根据古典概型和条件概率的计算公式,我们有

P(Y=1X=0)=n(X=0,Y=1)n(X=0)=3315230.633,P (Y = 1 \mid X = 0) = \frac {n (X = 0 , Y = 1)}{n (X = 0)} = \frac {3 3 1}{5 2 3} \approx 0. 6 3 3,

P(Y=1X=1)=n(X=1,Y=1)n(X=1)=4736010.787.P (Y = 1 \mid X = 1) = \frac {n (X = 1 , Y = 1)}{n (X = 1)} = \frac {4 7 3}{6 0 1} \approx 0. 7 8 7.

P(Y=1X=1)P(Y=1 \mid X=1) 大于 P(Y=1X=0)P(Y=1 \mid X=0) 可以作出判断,在该校的学生中,性别对体育锻炼的经常性有影响,即该校的女生和男生在体育锻炼的经常性方面存在差异,而且男生更经常锻炼.

在实践中,由于保存原始数据的成本较高,人们经常按研究问题的需要,将数据分类统计,并做成表格加以保存。我们将如表8.3-1这种形式的数据统计表称为 2×22 \times 2 列联表(contingency table)。2×22 \times 2 列联表给出了成对分类变量数据的交叉分类频数。以表8.3-1为例,它包含了 XXYY 的如下信息:最后一行的前两个数分别是事件 {Y=0}\{Y = 0\}{Y=1}\{Y = 1\} 中样本点的个数;最后一列的前两个数分别是事件 {X=0}\{X = 0\}{X=1}\{X = 1\} 中样本点的个数;中间的四个格中的数是表格的核心部分,给出了事件 {X=x,Y=y}\{X = x, Y = y\}x,y=0,1x, y = 0, 1)中样本点

的个数;右下角格中的数是样本空间中样本点的总数.

在上面问题的两种解答中,使用了学校全部学生的调查数据,利用这些数据能够完全确定解答问题所需的比率和条件概率。然而,对于大多数实际问题,我们无法获得所关心的全部对象的数据,因此无法准确计算出有关的比率或条件概率。在这种情况下,上述古典概型和条件概率的观点为我们提供了一个解决问题的思路。比较简单的做法是利用随机抽样获得一定数量的样本数据,再利用随机事件发生的频率稳定于概率的原理对问题答案作出推断。

将所关心的对象的全体看成古典概型的样本空间,就可以用概率的语言刻画相关的问题,进而用频率稳定于概率的原理推断问题的答案。很多统计方法都是基于这种思想建立起来的。

例 1 为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取 88 名学生。通过测验得到了如下数据:甲校 43 名学生中有 10 名数学成绩优秀;乙校 45 名学生中有 7 名数学成绩优秀。试分析两校学生中数学成绩优秀率之间是否存在差异。

解:用 Ω\Omega 表示两所学校的全体学生构成的集合。考虑以 Ω\Omega 为样本空间的古典概型。对于 Ω\Omega 中每一名学生,定义分类变量 XXYY 如下:

X={0,该生来自甲校,1,该生来自乙校,Y={0,该生数学成绩不优秀,1,该生数学成绩优秀.X = \left\{ \begin{array}{l l} 0, & \text {该生来自甲校,} \\ 1, & \text {该生来自乙校,} \end{array} \quad Y = \left\{ \begin{array}{l l} 0, & \text {该生数学成绩不优秀,} \\ 1, & \text {该生数学成绩优秀.} \end{array} \right. \right.

我们将所给数据整理成表 8.3-2.

表8.3-2是关于分类变量 XXYY 的抽样数据的 2×22 \times 2 列联表:最后一行的前两个数分别是事件 {Y=0}\{Y = 0\}{Y=1}\{Y = 1\} 的频数;最后一列的前两个数分别是事件 {X=0}\{X = 0\}{X=1}\{X = 1\} 的频数;中间的四个格中的数是事件 {X=x,Y=y}(x,y=0,1)\{X = x, Y = y\} (x, y = 0, 1) 的频数;右下角格中的数是样本容量。因此,甲校学生中数学成绩不优秀和数学成绩优秀的频率分别为

33430.767410430.2326;\frac {3 3}{4 3} \approx 0. 7 6 7 4 \text {和} \frac {1 0}{4 3} \approx 0. 2 3 2 6;

乙校学生中数学成绩不优秀和数学成绩优秀的频率分别为

38450.84447450.1556.\frac {3 8}{4 5} \approx 0. 8 4 4 4 \text {和} \frac {7}{4 5} \approx 0. 1 5 5 6.

我们可以用等高堆积条形图直观地展示上述计算结果,如图8.3-1所示.

• •

利用统计软件画条形图,Excel 软件可以通过插入图表,从图表类型中选取条形图;R 软件可以用函数 barplot.

在图8.3-1中,左边的蓝色和红色条的高度分别是甲校学生中数学成绩不优秀和数学成绩优秀的频率;右边的蓝色和红色条的高度分别是乙校学生中数学成绩不优秀和数学成绩优秀的频率。通过比较发现,两个学校学生抽样数据中数学成绩优秀的频率存在差异,甲校的频率明显高于乙校的频率。依据频率稳定于概率的原理,我们可以推断 P(Y=1X=0)>P(Y=1X=1)P(Y = 1 \mid X = 0) > P(Y = 1 \mid X = 1) 。也就是说,如果从甲校和乙校各随机选取一名学生,那么甲校学生数学成绩优秀的概率大于乙校学生数学成绩优秀的概率。因此,可以认为两校学生的数学成绩优秀率存在差异,甲校学生的数学成绩优秀率比乙校学生的高。

思考

你认为“两校学生的数学成绩优秀率存在差异”这一结论是否有可能是错误的?

事实上,“两校学生的数学成绩优秀率存在差异”这个结论是根据两个频率间存在差异推断出来的。有可能出现这种情况:在随机抽取的这个样本中,两个频率间确实存在差异,但两校学生的数学成绩优秀率实际上是没有差别的。这就是说,样本的随机性导致了两个频率间出现较大差异。在这种情况下,我们推断出的结论就是错误的。后面我们将讨论犯这种错误的概率大小问题。

练习

  1. 成语 “名师出高徒” 可以解释为 “知名老师指导出高水平学生的概率较大”,即老师的名声与学生的水平之间有关联。你能举出更多的描述生活中两种属性或现象之间关联的成语吗?