8.3.2 独立性检验

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 22 页

原书扫描页

原书 page-0133
page-0133
原书 page-0134
page-0134
原书 page-0135
page-0135

本页支撑以下实体

1

引本页作教材出处的知识图谱实体——由实体 frontmatter 的 textbook_pages 反向派生,本页源文件里没有任何清单(ADR-0002)。

考过本页内容的真题

1

由「教材页 ← 实体 ← 攻略」两跳派生——攻略声明「本题 → 实体」、实体声明「实体 → 教材页」,本站不写第二份「页 → 题」清单(ADR-0016)。

原书 page-0136
page-0136

本页支撑以下实体

1

引本页作教材出处的知识图谱实体——由实体 frontmatter 的 textbook_pages 反向派生,本页源文件里没有任何清单(ADR-0002)。

考过本页内容的真题

1

由「教材页 ← 实体 ← 攻略」两跳派生——攻略声明「本题 → 实体」、实体声明「实体 → 教材页」,本站不写第二份「页 → 题」清单(ADR-0016)。

原书 page-0137
page-0137
原书 page-0138
page-0138
原书 page-0139
page-0139
原书 page-0140
page-0140
原书 page-0141
page-0141
原书 page-0142
page-0142
原书 page-0143
page-0143
原书 page-0144
page-0144
原书 page-0145
page-0145
原书 page-0146
page-0146
原书 page-0147
page-0147
原书 page-0148
page-0148
原书 page-0149
page-0149
原书 page-0150
page-0150
原书 page-0151
page-0151
原书 page-0152
page-0152
原书 page-0153
page-0153
原书 page-0154
page-0154

文字转写

  1. 例1中的随机抽样数据是否足够确定与 XXYY 有关的所有概率和条件概率?为什么?

  2. 根据有关规定,香烟盒上必须印上“吸烟有害健康”的警示语。那么

(1) 吸烟是否对每位烟民一定会引发健康问题?

(2) 有人说吸烟不一定引起健康问题, 因此可以吸烟. 这种说法对吗?

  1. 假设在本小节“问题”中,只是随机抽取了44名学生,按照性别和体育锻炼情况整理为如下的列联表:

单位:人

(2) 说明你的推断结论是否可能犯错,并解释原因.

8.3.2 独立性检验

前面我们通过 2×22 \times 2 列联表整理成对分类变量的样本观测数据,并根据随机事件频率的稳定性推断两个分类变量之间是否有关联。对于随机样本而言,因为频率具有随机性,频率与概率之间存在误差,所以我们的推断可能犯错误,而且在样本容量较小时,犯错误的可能性会较大。因此,需要找到一种更为合理的推断方法,同时也希望能对出现错误推断的概率有一定的控制或估算。

考虑以 Ω\Omega 为样本空间的古典概型. 设 XXYY 为定义在 Ω\Omega 上,取值于 {0,1}\{0, 1\} 的成对分类变量. 我们希望判断事件 {X=1}\{X = 1\}{Y=1}\{Y = 1\} 之间是否有关联. 注意到 {X=0}\{X = 0\}{X=1}\{X = 1\}, {Y=0}\{Y = 0\}{Y=1}\{Y = 1\} 都是互为对立事件,与前面的讨论类似,我们需要判断下面的假定关系

H0:P(Y=1X=0)=P(Y=1X=1)H _ {0}: P (Y = 1 \mid X = 0) = P (Y = 1 \mid X = 1)

是否成立,通常称 H0H_0 为零假设或原假设(null hypothesis)。这里,P(Y=1X=0)P(Y = 1 \mid X = 0) 表示从 {X=0}\{X = 0\} 中随机选取一个样本点,该样本点属于 {X=0,Y=1}\{X = 0, Y = 1\} 的概率;而 P(Y=1X=1)P(Y = 1 \mid X = 1) 表示从 {X=1}\{X = 1\} 中随机选取一个样本点,该样本点属于 {X=1,Y=1}\{X = 1, Y = 1\} 的概率。

由条件概率的定义可知,零假设 H0H_{0} 等价于

P(X=0,Y=1)P(X=0)=P(X=1,Y=1)P(X=1),\frac {P (X = 0 , Y = 1)}{P (X = 0)} = \frac {P (X = 1 , Y = 1)}{P (X = 1)},

P (X = 0, Y = 1) P (X = 1) = P (X = 1, Y = 1) P (X = 0).\tag{①}

注意到 {X=0}\{X=0\}{X=1}\{X=1\} 为对立事件,于是 P(X=0)=1P(X=1)P(X=0)=1-P(X=1) 。再由概率的性质,我们有

P(X=0,Y=1)=P(Y=1)P(X=1,Y=1).P (X = 0, Y = 1) = P (Y = 1) - P (X = 1, Y = 1).

由此推得①式等价于

P(X=1)P(Y=1)=P(X=1,Y=1).P (X = 1) P (Y = 1) = P (X = 1, Y = 1).

因此,零假设 H0H_{0} 等价于 {X=1}\{X=1\}{Y=1}\{Y=1\} 独立.

根据已经学过的概率知识,下面的四条性质彼此等价:

{X=0}{Y=0}独立;{X=0}{Y=1}独立;\{X = 0 \} \text {与} \{Y = 0 \} \text {独立}; \{X = 0 \} \text {与} \{Y = 1 \} \text {独立};

{X=1}{Y=0}独立;{X=1}{Y=1}独立.\{X = 1 \} \text {与} \{Y = 0 \} \text {独立}; \{X = 1 \} \text {与} \{Y = 1 \} \text {独立}.

如果这些性质成立,我们就称分类变量 XXYY 独立.这相当于下面四个等式成立:

\begin{array}{l} P (X = 0, Y = 0) = P (X = 0) P (Y = 0); \\ P (X = 0, Y = 1) = P (X = 0) P (Y = 1); \\ P (X = 1, Y = 0) = P (X = 1) P (Y = 0); \\ P (X = 1, Y = 1) = P (X = 1) P (Y = 1). \end{array}\tag{②}

因此,我们可以用概率语言,将零假设改述为

H0H_{0} :分类变量 X 和 Y 独立.

假定我们通过简单随机抽样得到了 X 和 Y 的抽样数据列联表,如表 8.3-3 所示.

表 8.3-3 是关于分类变量 X 和 Y 的抽样数据的 2×22 \times 2 列联表:最后一行的前两个数分别是事件 {Y=0}\{Y=0\}{Y=1}\{Y=1\} 的频数;最后一列的前两个数分别是事件 {X=0}\{X=0\}{X=1}\{X=1\} 的频数;中间的四个数 a, b, c, d 是事件 {X=x,Y=y}\{X=x, Y=y\} (x, y=0, 1) 的频数;右下角格中的数 n 是样本容量.

对于随机样本,表8.3-3中的频数 a,b,c,da, b, c, d 都是随机变量,而表8.3-2中的相应数据是这些随机变量的一次观测结果.

思考

如何基于②中的四个等式及列联表8.3-3中的数据,构造适当的统计量,对成对分类变量 XXYY 是否相互独立作出推断?

在零假设 H0H_0 成立的条件下,根据频率稳定于概率的原理,由②中的第一个等式,我们可以用概率 P(X=0)P(X = 0)P(Y=0)P(Y = 0) 对应的频率的乘积

(a+b)(a+c)n2\frac {(a + b) (a + c)}{n ^ {2}}

估计概率 P(X=0,Y=0)P(X=0, Y=0) ,而把

(a+b)(a+c)n\frac {(a + b) (a + c)}{n}

视为事件 {X=0,Y=0}\{X=0, Y=0\} 发生的频数的期望值(或预期值)。这样,该频数的观测值 a 和期望值 (a+b)(a+c)n\frac{(a+b)(a+c)}{n} 应该比较接近。

综合②中的四个式子,如果零假设 H0H_0 成立,下面四个量的取值都不应该太大:

\begin{array}{l} \left| a - \frac {(a + b) (a + c)}{n} \right|, \left| b - \frac {(a + b) (b + d)}{n} \right|, \\ \left| c - \frac {(c + d) (a + c)}{n} \right|, \left| d - \frac {(c + d) (b + d)}{n} \right|. \end{array}\tag{③}

反之,当这些量的取值较大时,就可以推断 H0H_0 不成立.

显然,分别考虑③中的四个差的绝对值很困难。我们需要找到一个既合理又能够计算分布的统计量,来推断 H0H_0 是否成立。一般来说,若频数的期望值较大,则③中相应的差的绝对值也会较大;而若频数的期望值较小,则③中相应的差的绝对值也会较小。为了合理地平衡这种影响,我们将四个差的绝对值取平方后分别除以相应的期望值再求和,得到如下的统计量:

χ2=(a(a+b)(a+c)n)2(a+b)(a+c)n+(b(a+b)(b+d)n)2(a+b)(b+d)n+(c(c+d)(a+c)n)2(c+d)(a+c)n+(d(c+d)(b+d)n)2(c+d)(b+d)n.\begin{array}{l} \chi^ {2} = \frac {\left(a - \frac {(a + b) (a + c)}{n}\right) ^ {2}}{\frac {(a + b) (a + c)}{n}} + \frac {\left(b - \frac {(a + b) (b + d)}{n}\right) ^ {2}}{\frac {(a + b) (b + d)}{n}} + \\ \frac {\left(c - \frac {(c + d) (a + c)}{n}\right) ^ {2}}{\frac {(c + d) (a + c)}{n}} + \frac {\left(d - \frac {(c + d) (b + d)}{n}\right) ^ {2}}{\frac {(c + d) (b + d)}{n}}. \end{array}

该表达式可化简为

\chi^ {2} = \frac {n (a d - b c) ^ {2}}{(a + b) (c + d) (a + c) (b + d)}.\tag{1}

统计学家建议,用随机变量 χ2\chi^2 取值的大小作为判断零假设 H0H_0 是否成立的依据,当它比较大时推断 H0H_0 不成立,否则认为 H0H_0 成立。那么,究竟 χ2\chi^2 大到什么程度,可以推断 H0H_0 不成立呢?或者说,怎样确定判断 χ2\chi^2 大小的标准呢?

根据小概率事件在一次试验中不大可能发生的规律,上面的想法可以通过确定一个与 H0H_0 相矛盾的小概率事件来实现。在假定 H0H_0 的条件下,对于有放回简单随机抽样,当样本容量 nn 充分大时,统计学家得到了 χ2\chi^2 的近似分布。忽略 χ2\chi^2 的实际分布与该近似分布的误差后,对于任何小概率值 α\alpha ,可以找到相应的正实数 xαx_{\alpha} ,使得下面关系成立:

P (\chi^ {2} \geqslant x _ {\alpha}) = \alpha .\tag{④}

我们称 xαx_{\alpha}α\alpha 的临界值,这个临界值就可作为判断 χ2\chi^2 大小的标准。概率值 α\alpha 越小,临界值 xαx_{\alpha} 越大。当总体很大时,抽样有、无放回对 χ2\chi^2 的分布影响较小。因此,在应用中往往不严格要求抽样必须是有放回的。

由④式可知,只要把概率值 α\alpha 取得充分小,在假设 H0H_0 成立的情况下,事件 {χ2xα}\{\chi^2 \geqslant x_\alpha\} 是不大可能发生的。根据这个规律,如果该事件发生,我们就可以推断 H0H_0 不成立。不过这个推断有可能犯错误,但犯错误的概率不会超过 α\alpha

基于小概率值 α\alpha 的检验规则是:

χ2xα\chi^{2}\geqslant x_{\alpha} 时,我们就推断 H0H_{0} 不成立,即认为X和Y不独立,该推断犯错误的概率不超过 α\alpha ;

χ2<xα\chi^{2}<x_{\alpha} 时,我们没有充分证据推断 H0H_{0} 不成立,可以认为X和Y独立.

这种利用 χ2\chi^{2} 的取值推断分类变量 X 和 Y 是否独立的方法称为 χ2\chi^{2} 独立性检验,读作“卡方独立性检验”,简称独立性检验(test of independence).

表 8.3-4 给出了 χ2\chi^{2} 独立性检验中 5 个常用的小概率值和相应的临界值.

例如,对于小概率值 α=0.05\alpha = 0.05 ,我们有如下的具体检验规则:

(1)当 χ2x0.05=3.841\chi^2 \geqslant x_{0.05} = 3.841 时,我们推断 H0H_0 不成立,即认为 XXYY 不独立,该推断犯错误的概率不超过0.05;

(2) 当 χ2<x0.05=3.841\chi^{2}<x_{0.05}=3.841 时,我们没有充分证据推断 H0H_{0} 不成立,可以认为 X 和 Y 独立.

例2 依据小概率值 α=0.1\alpha = 0.1χ2\chi^2 独立性检验,分析例1中的抽样数据,能否据此推断两校学生的数学成绩优秀率有差异?

解:零假设为

H0H_{0} :分类变量 X 与 Y 相互独立,即两校学生的数学成绩优秀率无差异.

根据表 8.3-2 中的数据,计算得到

χ2=88×(33×710×38)243×45×71×170.837<2.706=x0.1.\chi^ {2} = \frac {8 8 \times (3 3 \times 7 - 1 0 \times 3 8) ^ {2}}{4 3 \times 4 5 \times 7 1 \times 1 7} \approx 0. 8 3 7 < 2. 7 0 6 = x _ {0. 1}.

根据小概率值 α=0.1\alpha=0.1χ2\chi^{2} 独立性检验,没有充分证据推断 H0H_{0} 不成立,因此可以认为 H0H_{0} 成立,即认为两校的数学成绩优秀率没有差异.

思考

例 1 和例 2 都是基于同一组数据的分析,但却得出了不同的结论,你能说明其中的原因吗?

事实上,如前所述,例1只是根据一个样本的两个频率间存在差异得出两校学生数学成绩优秀率有差异的结论,并没有考虑由样本随机性可能导致的错误,所以那里的推断依据不太充分。在例2中,我们用 χ2\chi^2 独立性检验对零假设 H0H_0 进行了检验。通过计算,发现 χ20.837\chi^2 \approx 0.837 小于 α=0.1\alpha = 0.1 所对应的临界值2.706,因此认为没有充分证据推断 H0H_0 不成立,

所以接受 H0H_0 ,推断出两校学生的数学成绩优秀率没有显著差异的结论.这个检验结果意味着,抽样数据中两个频率的差异很有可能是由样本随机性导致的.因此,只根据频率的差异得出两校学生的数学成绩优秀率有差异的结论是不可靠的.

由此可见,相对于简单比较两个频率的推断,用 χ2\chi^{2} 独立性检验得到的结果更理性、更全面,理论依据也更充分.

当我们接受零假设 H0H_0 时,也可能犯错误. 我们不知道犯这类错误的概率 pp 的大小,但是知道,若 α\alpha 越大,则 pp 越小.

例3 某儿童医院用甲、乙两种疗法治疗小儿消化不良。采用有放回简单随机抽样的方法对治疗情况进行检查,得到了如下数据:抽到接受甲种疗法的患儿67名,其中未治愈15名,治愈52名;抽到接受乙种疗法的患儿69名,其中未治愈6名,治愈63名。试根据小概率值 α=0.005\alpha = 0.005 的独立性检验,分析乙种疗法的效果是否比甲种疗法好。

解:零假设为

H0H_{0} :疗法与疗效独立,即两种疗法效果没有差异.

将所给数据进行整理,得到两种疗法治疗数据的列联表,如表 8.3-5 所示.

根据列联表中的数据,经计算得到

χ2=136×(15×6352×6)267×69×21×1154.881<7.879=x0.005.\chi^ {2} = \frac {1 3 6 \times (1 5 \times 6 3 - 5 2 \times 6) ^ {2}}{6 7 \times 6 9 \times 2 1 \times 1 1 5} \approx 4. 8 8 1 < 7. 8 7 9 = x _ {0. 0 0 5}.

根据小概率值 α=0.005\alpha = 0.005 的独立性检验,没有充分证据推断 H0H_0 不成立,因此可以认为 H0H_0 成立,即认为两种疗法效果没有差异.

观察

在表8.3-5中,若对调两种疗法的位置或对调两种疗效的位置,则表达式(1)中 a,b,c,da, b, c, d 的赋值都会相应地改变。这样做会影响 χ2\chi^2 取值的计算结果吗?

例 4 为研究吸烟是否与肺癌有关,某肿瘤研究所采取有放回简单随机抽样的方法,调查了 9 965 人,得到成对样本观测数据的分类统计结果,如表 8.3-6 所示。依据小概率值 α=0.001\alpha=0.001 的独立性检验,分析吸烟是否会增加患肺癌的风险。

解:零假设为

H0H_{0} :吸烟与患肺癌之间无关联.

根据列联表中的数据,经计算得到

χ2=9965×(7775×4942×2099)27817×2148×9874×9156.632>10.828=x0.001.\chi^ {2} = \frac {9 9 6 5 \times (7 7 7 5 \times 4 9 - 4 2 \times 2 0 9 9) ^ {2}}{7 8 1 7 \times 2 1 4 8 \times 9 8 7 4 \times 9 1} \approx 5 6. 6 3 2 > 1 0. 8 2 8 = x _ {0. 0 0 1}.

根据小概率值 α=0.001\alpha=0.001 的独立性检验,我们推断 H0H_{0} 不成立,即认为吸烟与患肺癌有关联,此推断犯错误的概率不大于 0.001.

根据表 8.3-6 中的数据计算,不吸烟者中不患肺癌和患肺癌的频率分别为

777578170.99464278170.0054;\frac {7 7 7 5}{7 8 1 7} \approx 0. 9 9 4 6 \text {和} \frac {4 2}{7 8 1 7} \approx 0. 0 0 5 4;

吸烟者中不患肺癌和患肺癌的频率分别为

209921480.97724921480.0228.\frac {2 0 9 9}{2 1 4 8} \approx 0. 9 7 7 2 \text {和} \frac {4 9}{2 1 4 8} \approx 0. 0 2 2 8.

0.02280.00544.2\frac {0 . 0 2 2 8}{0 . 0 0 5 4} \approx 4. 2

可见,在被调查者中,吸烟者患肺癌的频率是不吸烟者患肺癌的频率的4倍以上。于是,根据频率稳定于概率的原理,我们可以认为吸烟者患肺癌的概率明显大于不吸烟者患肺癌的概率,即吸烟更容易引发肺癌。

总结上面的例子,应用独立性检验解决实际问题大致应包括以下几个主要环节:

(1)提出零假设 H0H_{0} :X 和 Y 相互独立,并给出在问题中的解释.

(2) 根据抽样数据整理出 2×22 \times 2 列联表,计算 χ2\chi^{2} 的值,并与临界值 xαx_{\alpha} 比较.

(3) 根据检验规则得出推断结论.

(4)在 XXYY 不独立的情况下,根据需要,通过比较相应的频率,分析 XXYY 间的影响规律.

注意,上述几个环节的内容可以根据不同情况进行调整。例如,在有些时候,分类变量的抽样数据列联表是问题中给定的。

思考

独立性检验的思想类似于我们常用的反证法,你能指出二者之间的相同和不同之处吗?

简单地说,反证法是在某种假设 H0H_0 之下,推出一个矛盾结论,从而证明 H0H_0 不成立;而独立性检验是在零假设 H0H_0 之下,如果出现一个与 H0H_0 相矛盾的小概率事件,就推断 H0H_0 不成立,且该推断犯错误的概率不大于这个小概率。另外,在全部逻辑推理正确的情况下,反证法不会犯错误,但独立性检验会犯随机性错误。

独立性检验的本质是比较观测值与期望值之间的差异,由 χ2\chi^{2} 所代表的这种差异的大小是通过确定适当的小概率值进行判断的。这是一种非常重要的推断方法,不仅有相当广泛的应用,也开启了人类认识世界的一种新的思维方式。

练习

  1. 对于例3中的抽样数据,采用小概率值 α=0.05\alpha = 0.05 的独立性检验,分析乙种疗法的效果是否比甲种疗法好.

  2. 根据同一抽查数据推断两个分类变量之间是否有关联,应用不同的小概率值,是否会得出不同的结论?为什么?

  3. 为考察某种药物 A 对预防疾病 B 的效果,进行了动物试验,根据 105 个有放回简单随机样本的数据,得到如下列联表:

单位:只

依据 α=0.05\alpha=0.05 的独立性检验,分析药物 A 对预防疾病 B 的有效性.

  1. 从某学校获取了容量为 400 的有放回简单随机样本,将所得数学和语文期末考试成绩的样本观测数据整理如下:

单位:人

依据 α=0.05\alpha = 0.05 的独立性检验,能否认为数学成绩与语文成绩有关联?

习题8.3

复习巩固

  1. 为什么必须基于成对样本数据推断两个分类变量之间是否有关联?

  2. 为什么 χ2\chi^2 独立性检验方法不适用于普查数据?

  3. 等高堆积条形图在两个分类变量之间关联性的研究中能够起到什么作用?

  4. 对于已经获取的成对样本数据,检验结论“两个变量之间有关联”的实际含义是什么?检验结论“两个变量之间没有关联”的实际含义又是什么?

综合运用

  1. 为了研究高三年级学生的性别和身高是否大于 170 cm170 \mathrm{~cm} 的关联性,调查了某中学所有高三年级的学生,整理得到如下列联表:

单位:人

请画出列联表的等高堆积条形图,判断该中学高三年级学生的性别和身高是否有关联。如果结论是性别与身高有关联,请解释它们之间如何相互影响。

  1. 第5题中的身高变量是数值型变量还是分类变量?为什么?

  2. 从第 5 题的高三学生中获取容量为 40 的有放回简单随机样本,由样本数据整理得到如下列联表:

单位:人

(1)依据 α=0.05\alpha=0.05 的独立性检验,能否认为该中学高三年级学生的性别与身高有关联?解释所得结论的实际含义.

(2) 得到的结论与第 5 题的一致吗?如果不一致,你认为原因是什么.

  1. 调查某医院一段时间内婴儿出生的时间和性别的关联性,得到如下的列联表:

单位:人

拓广探索

  1. 对例 1 列联表 8.3-2 中的数据,依据 α=0.1\alpha=0.1 的独立性检验,我们已经知道独立性检验的结论是学校和成绩无关。如果表 8.3-2 中所有数据都扩大为原来的 10 倍,在相同的检验标准下,再用独立性检验推断学校和数学成绩之间的关联性,结论还一样吗?请你试着解释其中的原因。

小结

一、本章知识结构

二、回顾与思考

在必修课程中学习过用样本观测数据推断变量的统计特征的方法,本章我们学习用成对样本观测数据推断两个变量之间关系的方法。贯穿本章的主要思想依然是通过样本估计总体的思想。

对两个数值型变量,通过样本散点图可以直观描述它们之间的相关关系,通过样本相关系数可以定量地度量它们之间线性相关的程度,进而推断两个变量之间的相关关系。对两个相关的变量,我们常常用回归模型刻画一个变量对另一个变量的影响,不同的相关关系用不同的回归模型。一元线性回归模型主要用于刻画线性相关的两个变量之间的关系,通常根据样本数据,用最小二乘法估计出模型的参数,得到经验回归模型。通过分析残差可以对模型进行评价和改进,使模型不断完善。如果模型比较好地刻画了两个变量的关系,我们就可以根据自变量的取值去预测因变量的取值,进而帮助我们决策。

对于两个分类变量,可以通过 2×22 \times 2 列联表反映两个变量之间的有关统计信息,据此我们可以从直观上推断两个变量是否有关联。独立性检验是对变量之间的关联性进行统计推断,这种推断基于小概率原理,这与基于逻辑矛盾的反证法有所不同。为了使拒绝零假设犯错误的概率更小,就要取更小的概率值 α\alpha

回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,采用了归纳推理的方法,所以得出的结论都可能犯错误,这是用样本估计总体所得出的统计结论的一个特点,体现了统计学的特性。事实上,统计学面向随机现象,探究或然性下的规律性,即使是同样的数据,也允许人们根据自己对数据背景的理解,采用不同的推断方法进行分析,得出不同的推断结论,其判断结论的准则是“好”与“坏”。当然,所采用的方法越好,所得结论犯错误的概率越小。所以,面对具体问题,我们要尽量选择合适的、好的统计方法。

请你带着下面的问题,复习一下全章的内容吧!

  1. 举例说明成对数据是如何形成的.

  2. 举例说明什么叫相关关系,它与函数关系有什么区别?

  3. 借助样本相关系数和回归模型,可以刻画两个变量的非线性相关程度的高低吗?

  4. 一元线性回归模型中,模型参数 aabb 的统计意义是什么?

  5. 最小二乘原理是什么?你能说一说它的基本思想吗?

  6. 举例说明用条件概率的语言刻画两个分类变量关联性的关键点是什么?

  7. 分类变量和数值变量有何本质不同?

  8. 独立性检验的基本思想是什么?它和反证法有何异同?

  9. 若依据 α=0.05\alpha = 0.05 的独立性检验,结论是两个变量之间有关联,如何解释这个结论?如果是两个变量之间没有关联,又该如何解释这个结论?

  10. 通过本章的学习,你对统计方法和确定性方法的差异性有哪些新的认识?

复习参考题8

复习巩固

  1. 变量 xxyy 的成对样本数据的散点图如下图所示,据此可以推断变量 xxyy 之间( ).

(A) 很可能存在负相关

(B) 一定存在正相关

(C) 很可能存在正相关

(D) 一定不存在负相关

  1. 根据变量 Y 和 x 的成对样本数据,由一元线性回归模型 {Y=bx+a+e,E(e)=0,D(e)=σ2\left\{\begin{aligned} Y &= bx + a + e, \\ E(e) &= 0, D(e) &= \sigma^{2} \end{aligned}\right. 得到经验回归模型 y^=b^x+a^\hat{y} = \hat{b}x + \hat{a} ,对应的残差如图所示。模型误差().

(A) 满足一元线性回归模型的所有假设

(B) 不满足一元线性回归模型的 E(e)=0E(e) = 0 的假设

(C) 不满足一元线性回归模型的 D(e)=σ2D(e) = \sigma^2 的假设

(D) 不满足一元线性回归模型的 E(e)=0E(e) = 0D(e)=σ2D(e) = \sigma^2 的假设

  1. 根据分类变量 xxyy 的成对样本数据,计算得到 χ2=2.974\chi^2 = 2.974。依据 α=0.05\alpha = 0.05 的独立性检验,结论为( ).

(A) 变量 x 与 y 不独立

(B) 变量 xxyy 不独立,这个结论犯错误的概率不超过0.05

(C) 变量 xxyy 独立

(D) 变量 xxyy 独立,这个结论犯错误的概率不超过0.05

4.8.3节例4中推断吸烟与患肺癌是有关联的,能用一元线性回归模型建立它们之间的关系吗?为什么?

综合运用

  1. 根据8.1.2节例3中的数据,建立臂展关于身高的经验回归模型,画出残差图,描述残差图的特点.

  2. 下表是 1896—2016 年男子三级跳远奥运会冠军的成绩,请分析这组数据,能用一元线性回归模型刻画这组数据吗?

  3. 汽车轮胎凹槽深度是影响汽车刹车的因素,汽车行驶会导致轮胎胎面磨损。某实验室通过试验测得行驶里程与某品牌轮胎凹槽深度的数据,请根据数据建立轮胎凹槽深度和汽车行驶里程的关系,并解释模型的含义。

  1. 为考察某种药物预防疾病的效果,进行动物试验,得到如下列联表:

单位:只

拓广探索

  1. 气象部门由每天的最高气温的数据,得到每月最高气温的平均数,简称平均高温。下表是2017年31个城市1月和7月的平均高温数据。

(1) 画出并观察各城市 1 月与 7 月的平均高温的散点图,你认为 1 月与 7 月的平均高温有线性趋势吗?描述散点图的特点.

(2) 结合地理知识并用统计方法分析表中的数据,解释这两个月平均高温的关系.

建立统计模型进行预测

在现实世界中有许多随机现象需要研究。已有的学习告诉我们,研究随机现象,就是要在明确研究对象和问题的基础上,通过收集数据、整理数据、提取信息、构建数学模型,再利用模型进行推断,得出结论。通过这样的研究所得出的结论,可以为我们作出决策提供有力的依据。

下面我们看一个通过建立统计模型进行随机现象的分析和决策的实际事例.

背景 大气污染物 PM2.5PM_{2.5} (大气中直径小于或等于 2.5μm2.5 \mu m 的颗粒物)的浓度超过一定的限度会影响人的身体健康。为了研究 PM2.5PM_{2.5} 的浓度是否受到汽车流量、气候状况等因素的影响,研究人员选择了 24 个社会经济发展水平相近的城市,在每个城市选择一个交通点建立监测点,统计每个监测点 24 h 内过往的汽车流量(单位:千辆),同时在低空相同的高度测定每个监测点该时间段的平均气温(单位:℃)、风速(单位:m/s)、空气湿度(绝对湿度,单位: g/m3g/m^{3} )以及空气中 PM2.5PM_{2.5} 的平均浓度(单位: μg/m3\mu g/m^{3} ),得到的数据如表 1 所示。

我们希望通过这些数据,定量探究与 PM2.5PM_{2.5} 浓度相关的影响因素,为作出控制空气污染的决策提供依据.

建立统计模型进行预测的一般流程如图 1 所示. 我们按照这个流程,对上述问题进行研究.

图1

一、问题背景分析

影响 PM2.5PM_{2.5} 浓度的因素很多,原因也比较复杂,我们甚至不能确切地了解 PM2.5PM_{2.5} 产生的原因,但我们可以先从简单的问题入手开展研究.

例如,如果只考虑 PM2.5\mathrm{PM}_{2.5} 浓度与汽车流量的关系,我们可以以汽车流量为自变量,PM2.5\mathrm{PM}_{2.5} 浓度为因变量,采用回归分析的方法进行研究.

这时,我们需要考虑以下三个方面的问题:

  1. 统计描述,即直观描述成对样本数据的统计相关性。例如,PM2.5\mathrm{PM}_{2.5} 浓度是否随汽车流量的增加而增加?PM2.5\mathrm{PM}_{2.5} 浓度与汽车流量的关系是线性关系还是非线性关系?如果汽车流量每增加100辆,PM2.5\mathrm{PM}_{2.5} 浓度平均增加多少?等等。

  2. 统计建模与推断,即建立回归模型,检验并估计模型参数。例如,PM2.5\mathrm{PM}_{2.5} 浓度是否随汽车流量的变化而变化?汽车流量对 PM2.5\mathrm{PM}_{2.5} 浓度的影响有多大?汽车流量对 PM2.5\mathrm{PM}_{2.5} 浓度的影响是否具有统计学意义?等等。

  3. 统计应用,即利用模型进行统计预测或控制。例如,如何由汽车流量预测大气中 PM2.5PM_{2.5} 的浓度?如何通过控制汽车流量达到控制空气中 PM2.5PM_{2.5} 浓度的目的?等等。

二、建立统计模型

1. 绘制散点图

绘制散点图是进行回归分析的第一步,可以直观地考察两个变量之间的关系,为我们分析两个变量之间的关系类型提供帮助.

以汽车流量为横轴、PM2.5\mathrm{PM}_{2.5} 浓度为纵轴绘制散点图。为了研究方便,我们使用R软件。首先将表1中的数据建立一个“csv”文件,例如建立“pm25.csv”文件(图2)。然后在工作区域中输入 “w=read.csv(“pm25.csv”)”,读入数据。再用 “plot(PM2.5浓度~汽车流量,w)” 函数,画出散点图(图3)。

图 2

由图 3 可以发现, PM2.5PM_{2.5} 浓度随着汽车流量的增加呈线性增长趋势,但在汽车流量相近时, PM2.5PM_{2.5} 的浓度有时相差很大,说明 PM2.5PM_{2.5} 浓度除了受汽车流量的影响外,可能还受到其他一些已知或未知的因素(如风速、空气温度、空气湿度等)影响。因此 PM2.5PM_{2.5} 浓度与汽车流量之间是一种相关关系。

2. 建立线性回归方程

一元线性回归模型为 {Y=bx+a+e,E(e)=0,D(e)=σ2,\left\{\begin{aligned}Y&=bx+a+e,\\ E(e)&=0,\quad D(e)=\sigma^{2},\end{aligned}\right. 根据样本数据,利用最小二乘法对模型参数a,b进行估计,得到经验回归模型 y^=b^x+a^\hat{y}=\hat{b}x+\hat{a} .

在 R 软件的工作区域输入 “a=lm(PM2.5 浓度~汽车流量,w)”,建立 PM2.5PM_{2.5} 浓度与汽车流量之间的回归方程并进行相关的分析。我们可以用 “abline(a)” 画出回归直线(图 4),用 “summary(a)” 输出回归结果(图 5)。这样,我们得到了 PM2.5PM_{2.5} 浓度关于汽车流量的回归方程

\hat {y} = 1 3 8. 6 0 x - 9 9. 6 9.\tag{①}

图 5

3. 回归结果分析

(1) 回归系数估计的输出结果如下:

在输出结果中,估计量(Estimate)对应的列是回归系数 aabb 的估计值,即 a^=99.69\hat{a} = -99.69b^=138.60\hat{b} = 138.60 。由 b^=138.60\hat{b} = 138.60 ,说明 PM2.5\mathrm{PM}_{2.5} 浓度随着汽车流量的增加而增加,汽车流量每增加100辆(0.1千辆),空气中的 PM2.5\mathrm{PM}_{2.5} 浓度平均可能增加 13.86μg/m313.86\mu \mathrm{g} / \mathrm{m}^3

汽车流量对应的 tt 值(tt value)是检验回归系数 bb 是否为0的指标。结果显示:tt 统计量的值为6.721,自由度 n2=22n - 2 = 22。给定显著性水平 α=0.05\alpha = 0.05,临界值 t0.025(22)=2.074t_{0.025}(22) = 2.074。由于 t=6.721>t0.025(22)t = 6.721 > t_{0.025}(22),表明 bb 显著地不为0,说明汽车流量是影响 PM2.5\mathrm{PM}_{2.5} 浓度的一个显著性因素。或者根据 pp(Pr(>t))9.37×107<0.05(Pr(>|t|))9.37 \times 10^{-7} < 0.05,也说明汽车流量是影响 PM2.5\mathrm{PM}_{2.5} 浓度的一个显著性因素。

(2) 线性关系显著性检验的输出结果如下:

在输出结果中,F 统计量(F-statistics)是检验两变量线性关系显著性的指标。结果显示:F 统计量的值为 45.17,分子自由度 df=1,分母自由度 df=n-2=22。给定显著性水平 α=0.05\alpha=0.05 ,临界值 F0.05(1,22)=4.301F_{0.05}(1,22)=4.301 ,由于 F=45.17>F0.05(1,22)F=45.17>F_{0.05}(1,22) ,或 p 值 (p-value)9.366×107<0.05(p\text{-value})9.366\times10^{-7}<0.05 ,表明 PM2.5PM_{2.5} 浓度与汽车流量的线性关系是显著的。可以认为 PM2.5PM_{2.5} 浓度与汽车流量之间的回归方程①具有统计学意义。

(3) 决定系数和调整的决定系数的输出结果如下:

决定系数 R2R^2 是回归分析中重要的统计量,R2R^2 数值的大小反映了自变量对回归的贡献,也就是在因变量的总变异中回归关系所能解释的百分比。决定系数也反映了回归模型的拟合效果。当自变量与因变量均为随机变量时,决定系数等于样本相关系数 rr 的平方。其中调整的决定系数 R=0.6576=65.76%R' = 0.6576 = 65.76\%,说明 PM2.5\mathrm{PM}_{2.5} 浓度总变异的 65.76%65.76\% 与汽车流量有关。

三、模型的应用

回归模型的重要应用之一是预测,在给定 xx 值时,根据回归方程,计算 YY 的预测值 y^\hat{y}. 我国规定空气中 PM2.5\mathrm{PM}_{2.5} 浓度的安全标准为年平均浓度 35μg/m335\mu \mathrm{g} / \mathrm{m}^324h24\mathrm{h} 平均浓度 75μg/m375\mu \mathrm{g} / \mathrm{m}^3 . 当汽车流量为1300辆,即 x=1.3x = 1.3 时, y^=80.49\hat{y} = 80.49 ,说明 PM2.5\mathrm{PM}_{2.5} 浓度在安全标准附近;当汽车流量为 2 300 辆,即 x=2.3 时, y^=219.09\hat{y}=219.09 ,说明 PM2.5PM_{2.5} 浓度严重超标,需要预警和采取措施进行干预.

某城市为使 PM2.5PM_{2.5} 浓度的平均值在 60~120,拟对汽车流量作适当控制,可以利用回归方程得到汽车流量。当 y^1=60\hat{y}_{1}=60 时, x1=1.152x_{1}=1.152 ;当 y^2=120\hat{y}_{2}=120 时, x2=1.585x_{2}=1.585 。因此要使该城市的 PM2.5PM_{2.5} 浓度的平均值控制在 60~120,24 h 的汽车流量就要控制在 1152~1585 辆。

四、数学建模活动的选题

请同学们仿照上述过程,开展建立统计模型进行预测的活动。可以从下列选题中选择一个,继续研究 PM2.5PM_{2.5} 浓度与各相关因素的关系(可借助信息技术工具如 R 软件,Excel,图形计算器等):

  1. 依照上面的研究方法与过程,研究影响 PM2.5PM_{2.5} 浓度的其他因素(如气温、空气湿度、风速等)与 PM2.5PM_{2.5} 浓度的回归模型;

  2. 影响 PM2.5PM_{2.5} 浓度的各因素之间是否独立,这些因素的选择是否合理;

  3. PM2.5\mathrm{PM}_{2.5} 浓度实际上是受到多个因素的影响,你可以在上述研究的基础上,利用信息技术工具,采用多元线性回归模型进行预测或控制,使分析更加客观和精确.

也可以根据自己的兴趣,与老师协商后确定一个课题进行研究.

五、数学建模活动的要求

1. 组建合作团队

数学建模实践活动需要团队协作。首先在班级中组成 353\sim 5 人的研究小组,每位同学参加其中一个小组。在小组内,要确定一个课题负责人,使每位成员都有明确的分工。拟定研究课题、确定研究方案、规划研究步骤、编制研究手册。然后在班里进行一次开题报告。

2. 开展研究活动

根据开题报告所规划的研究流程,通过背景分析、数据收集、数据分析、数学建模、获得结论等过程,完成课题研究。在研究过程中,可以借助信息技术解决问题。

3. 撰写研究报告

以小组为单位,撰写一份研究报告.

4. 交流展示

(1)对同一个课题,先由3~4个小组进行小组交流,每个小组都展示自己的研究成果,相互借鉴、取长补短。在小组报告的基础上形成大组的研究报告。选定代表,制作向全班汇报的演示文稿。

(2)与老师一起进行全班研究成果展示与交流,在各大组代表作研究报告的基础上,通过质疑、辩论、评价,总结成果,分享体会,分析不足。开展自我评价、同学间相互评价和老师评价,完成本次数学建模活动。

说明:数学建模可能需要用到一些数学软件工具,还有可能涉及一些课外的知识,同学们可以通过阅读一些课外的学习材料获得相关的知识。

六、数学建模活动研究报告的参考形式

____年级____班

完成时间:____

  1. 课题名称

  2. 课题组成员及分工

  3. 选题的意义

  4. 研究计划(包括对选题的分析、解决问题的思路等)

  5. 研究过程(包括收集数据、分析数据、建立模型、求解模型的过程,以及过程中出现的难点、解决方案等)

  6. 研究结果

  7. 收获与体会

  8. 对此研究的评价(由评价小组或老师填写)

后记

本册教科书是人民教育出版社课程教材研究所中学数学课程教材研究开发中心依据教育部《普通高中数学课程标准(2017年版)》编写的,经国家教材委员会2019年审查通过。

本册教科书的编写,集中反映了我国十余年来普通高中课程改革的成果,吸取了2004年版《普通高中课程标准实验教科书·数学(A版)》的编写经验,凝聚了参与课改实验的教育专家、学科专家、教材编写专家、教研人员和一线教师,以及教材设计装帧专家的集体智慧。本册教科书的编写者还有李增沪、张伟等;本书插图绘制为王俊宏。

我们感谢2004年版《普通高中课程标准实验教科书·数学(A版)》的主编刘绍学,副主编钱珮玲、章建跃,以及所有编写人员。我们感谢所有对教科书的编写、出版、试教等提供过帮助与支持的同仁和社会各界朋友。

本册教科书出版之前,我们通过多种渠道与教科书选用作品(包括照片、画作)的作者进行了联系,得到了他们的大力支持。对此,我们表示衷心的感谢!恳请未联系到的作者与我们联系,以便及时支付稿酬。

我们真诚地希望广大教师、学生及家长在使用本册教科书的过程中提出宝贵意见。我们将集思广益,不断修订,使教科书趋于完善。

联系方式

电话:010-58758866

电子邮箱:[email protected]

人民教育出版社 课程教材研究所

中学数学课程教材研究开发中心

2019年4月

PUTONG GAOZHONG JIAOKESHU SHUXUE 人薇薇® 绿色印刷产品 定价:00.00元 258h 978-1-137-1-138-2 9178711743<598>2>