7.5 正态分布

人教 A 版 · 原始扫描 + 转写(未校订)· 本节 10 页

原书扫描页

原书 page-0088
page-0088
原书 page-0089
page-0089
原书 page-0090
page-0090
原书 page-0091
page-0091
原书 page-0092
page-0092
原书 page-0093
page-0093
原书 page-0094
page-0094
原书 page-0095
page-0095
原书 page-0096
page-0096
原书 page-0097
page-0097

文字转写

7.5 正态分布

现实中,除了前面已经研究过的离散型随机变量外,还有大量问题中的随机变量不是离散型的,它们的取值往往充满某个区间甚至整个实轴,但取一点的概率为0,我们称这类随机变量为连续型随机变量(continuous random variable)。下面我们看一个具体问题。

问题 自动流水线包装的食盐,每袋标准质量为 400g400\mathrm{g}. 由于各种不可控制的因素,任意抽取一袋食盐,它的质量与标准质量之间或多或少会存在一定的误差(实际质量减去标准质量). 用 XX 表示这种误差,则 XX 是一个连续型随机变量. 检测人员在一次产品检验中,随机抽取了100袋食盐,获得误差 XX (单位:g\mathrm{g}) 的观测值如下:

(1) 如何描述这 100 个样本误差数据的分布?

(2) 如何构建适当的概率模型刻画误差 X 的分布?

根据已学的统计知识,可用频率分布直方图描述这组误差数据的分布,如图 7.5-1 所示。频率分布直方图中每个小矩形的面积表示误差落在相应区间内的频率,所有小矩形的面积之和为 1。

观察图形可知:误差观测值有正有负,并大致对称地分布在 X=0 的两侧,而且小误差比大误差出现得更频繁.

随着样本数据量越来越大,让分组越来越多,组距越来越小,由频率的稳定性可知,频率分布直方图的轮廓就越来越稳定,接近一条光滑的钟形曲线,如图 7.5-2 所示.

根据频率与概率的关系,可用图7.5-3中的钟形曲线(曲线与水平轴之间的区域的面积为1)来描述袋装食盐质量误差的概率分布。例如,任意抽取一袋食盐,误差落在 [2,1][-2, -1] 内的概率,可用图中黄色阴影部分的面积表示。

由函数知识可知,图 7.5-3 中的钟形曲线是一个函数. 那么,这个函数是否存在解析式呢?

答案是肯定的. 在数学家的不懈努力下, 找到了以下刻画随机误差分布的解析式:

f(x)=1σ2πe(xμ)22σ2,xR.f (x) = \frac {1}{\sigma \sqrt {2 \pi}} \mathrm{e} ^ {- \frac {(x - \mu) ^ {2}}{2 \sigma^ {2}}}, x \in \mathbf {R}.

其中 μR,σ>0\mu\in R,\quad\sigma>0 为参数.

显然,对任意的 xRx \in \mathbf{R}f(x)>0f(x) > 0,它的图象在 xx 轴的上方。可以证明 xx 轴和曲线之间的区域的面积为 1。我们称 f(x)f(x) 为正态密度函数,称它的图象为正态密度曲线,简称正态曲线,如图 7.5-4 所示。若随机变量 XX 的概率分布密度函数为 f(x)f(x),则称随机变量 XX 服从正态分布 (normal distribution),记为 XN(μ,σ2)X \sim N(\mu, \sigma^2)。特别地,当 μ=0\mu = 0σ=1\sigma = 1 时,称随机变量 XX 服从标准正态分布。

图7.5-4

XN(μ,σ2)X \sim N(\mu, \sigma^2),则如图7.5-4所示,XX 取值不超过 xx 的概率 P(Xx)P(X \leqslant x) 为图中区域 AA 的面积,而 P(aXb)P(a \leqslant X \leqslant b) 为图中区域 BB 的面积.

● ●

早在 1733 年,法国数学家棣莫弗(A. De Moivre,1667—1754)在研究二项概率的近似计算时,已提出了正态密度函数的形式,但当时只是作为一个数学表达式。直到德国数学家高斯(C. F. Gauss,1777—1855)提出“正态误差”的理论后,正态密度函数才取得“概率分布”的身份。因此,人们也称正态分布为高斯分布。

• •

P(Xx)P(X \leqslant x) 只能通过数值积分近似计算. 可以查正态分布表或利用计算机软件计算. Excel 中对应的函数为 NORM. DIST.

正态分布在概率和统计中占有重要地位,它广泛存在于自然现象、生产和生活实践之中。在现实生活中,很多随机变量都服从或近似服从正态分布。例如,某些物理量的测量误差,某一地区同年龄人群的身高、体重、肺活量等,一定条件下生长的小麦的株高、穗长、单位面积产量,自动流水线生产的各种产品的质量指标(如零件的尺寸、纤维的纤度、电容器的电容),某地每年7月的平均气温、平均湿度、降水量等,一般都近似服从正态分布。

观察

观察正态曲线及相应的密度函数,你能发现正态曲线的哪些特点?

由 X 的密度函数及图象可以发现,正态曲线还有以下特点:

(1) 曲线是单峰的,它关于直线 x=μx = \mu 对称;

(2) 曲线在 x=μx=\mu 处达到峰值 1σ2π\frac{1}{\sigma\sqrt{2\pi}} ;

(3) 当 x\left|x\right| 无限增大时,曲线无限接近 x 轴.

思考

一个正态分布由参数 μ\muσ\sigma 完全确定,这两个参数对正态曲线的形状有何影响?它们反映正态分布的哪些特征?

我们知道,函数 y=f(xμ)y = f(x - \mu) 的图象可由 y=f(x)y = f(x) 的图象平移得到。因此,在参数 σ\sigma 取固定值时,正态曲线的位置由 μ\mu 确定,且随着 μ\mu 的变化而沿 xx 轴平移,如图7.5-5所示。

图7.5-5

图 7.5-6

μ\mu 取定值时,因为正态曲线的峰值 1σ2π\frac{1}{\sigma\sqrt{2\pi}}σ\sigma 成反比,而且对任意的 σ>0\sigma > 0 ,正态曲线与 xx 轴之间的区域的面积总为1.因此,当 σ\sigma 较小时,峰值高,正态曲线“瘦高”,表示随机变量 XX 的分布比较集中;当 σ\sigma 较大时,峰值低,正态曲线“矮胖”,表示随机变量 XX 的分布比较分散,如图7.5-6所示.

观察图 7.5-5 和图 7.5-6 可以发现,参数 μ\mu 反映了正态分布的集中位置, σ\sigma 反映了随机变量的分布相对于均值 μ\mu 的离散程度。实际上,我们有

XN(μ,σ2)X \sim N(\mu, \sigma^{2}) ,则 E(X)=μE(X) = \muD(X)=σ2D(X) = \sigma^{2} .

• •

在实际问题中,参数 μ,σ\mu,\sigma 可以分别用样本均值和样本标准差来估计.

例 李明上学有时坐公交车,有时骑自行车。他各记录了50次坐公交车和骑自行车所花的时间,经数据分析得到:坐公交车平均用时 30min30\mathrm{min},样本方差为36;骑自行车平均用时 34min34\mathrm{min},样本方差为4。假设坐公交车用时 XX 和骑自行车用时 YY 都服从正态分布。

(1) 估计 X, Y 的分布中的参数;

(2)根据(1)中的估计结果,利用信息技术工具画出 X 和 Y 的分布密度曲线;

(3)如果某天有 38min38\mathrm{min} 可用,李明应选择哪种交通工具?如果某天只有 34min34\mathrm{min} 可用,又应该选择哪种交通工具?请说明理由.

分析:对于第(1)问,正态分布由参数 μ\muσ\sigma 完全确定,根据正态分布参数的意义,可以分别用样本均值和样本标准差来估计。对于第(3)问,这是一个概率决策问题,首先要明确决策的准则,在给定的时间内选择不迟到概率大的交通工具;然后结合图形,根据概率的表示,比较概率的大小,作出判断。

解:(1)随机变量 XX 的样本均值为30,样本标准差为6;随机变量 YY 的样本均值为34,样本标准差为2.用样本均值估计参数 μ\mu ,用样本标准差估计参数 σ\sigma ,可以得到

XN(30,62),YN(34,22).X \sim N (3 0, 6 ^ {2}), Y \sim N (3 4, 2 ^ {2}).

(2) X 和 Y 的分布密度曲线如图 7.5-7 所示.

(3)应选择在给定时间内不迟到的概率大的交通工具。由图 7.5-7 可知,

P(X38)<P(Y38)P(X \leqslant 38) < P(Y \leqslant 38) , P(X34)>P(Y34)P(X \leqslant 34) > P(Y \leqslant 34) . 所以,如果有 38min38 \, min 可用,那么骑自行车不迟到的概率大,应选择骑自行车;如果只有 34min34 \, min 可用,那么坐公交车不迟到的概率大,应选择坐公交车.

图7.5-7

假设 XN(μ,σ2)X \sim N(\mu, \sigma^2),可以证明:对给定的 kNk \in \mathbf{N}^*P(μkσXμ+kσ)P(\mu - k\sigma \leqslant X \leqslant \mu + k\sigma) 是一个只与 kk 有关的定值。特别地,

P(μσXμ+σ)0.6827,P(μ2σXμ+2σ)0.9545,P(μ3σXμ+3σ)0.9973.\begin{array}{l} P (\mu - \sigma \leqslant X \leqslant \mu + \sigma) \approx 0. 6 8 2 7, \\ P (\mu - 2 \sigma \leqslant X \leqslant \mu + 2 \sigma) \approx 0. 9 5 4 5, \\ P (\mu - 3 \sigma \leqslant X \leqslant \mu + 3 \sigma) \approx 0. 9 9 7 3. \end{array}

上述结果可用图 7.5-8 表示.

由此看到,尽管正态变量的取值范围是 (,+)(-∞,+∞) ,但在一次试验中,X的取值几乎总是落在区间 [μ3σ,μ+3σ]\left[\mu-3σ,\mu+3σ\right] 内,而在此区间以外取值的概率大约只有0.0027,通常认为这种情况几乎不可能发生.

图7.5-8

在实际应用中,通常认为服从于正态分布 N(μ,σ2)N(\mu, \sigma^2) 的随机变量 XX 只取 [μ3σ,μ+3σ][\mu - 3\sigma, \mu + 3\sigma] 中的值,这在统计学中称为 3σ3\sigma 原则.

练习

  1. 设随机变量 XN(0,1)X \sim N(0, 1),则 XX 的密度函数为 ____,P(X0)=P(X \leqslant 0) = ____,P(X1)=P(|X| \leqslant 1) = ____,P(X1)=P(X \leqslant 1) = ____,P(X>1)=P(X > 1) = ____。(精确到 0.0001.)

  2. 设随机变量 XN(0,22)X \sim N(0, 2^2),随机变量 YN(0,32)Y \sim N(0, 3^2),画出分布密度曲线草图,并指出 P(X2)P(X \leqslant -2)P(X2)P(X \leqslant 2) 的关系,以及 P(X1)P(|X| \leqslant 1)P(Y1)P(|Y| \leqslant 1) 之间的大小关系.

  3. 举出两个服从正态分布的随机变量的例子.

习题7.5

复习巩固

  1. 对某地区数学考试成绩的数据分析,男生成绩 XX 服从正态分布 N(72,82)N(72, 8^2),女生成绩 YY 服从正态分布 N(74,62)N(74, 6^2)。请你从不同角度比较男生、女生的考试成绩。

  2. 某市高二年级男生的身高 XX (单位: cm\mathrm{cm}) 近似服从正态分布 N(170,52)N(170, 5^2), 随机选择一名本市高二年级的男生, 求下列事件的概率: (1) {165<X175}\{165 < X \leqslant 175\}; (2) {X165}\{X \leqslant 165\}; (3) {X>175}\{X > 175\}.

  3. XN(μ,σ2)X \sim N(\mu, \sigma^2),则 XX 位于区域 [μ,μ+σ][\mu, \mu + \sigma] 内的概率是多少?

综合运用

  1. 袋装食盐标准质量为 400g400\mathrm{g},规定误差的绝对值不超过 4g4\mathrm{g} 就认为合格。假设误差服从正态分布,随机抽取100袋食盐,误差的样本均值为0,样本方差为4。请你估计这批袋装食盐的合格率。

信息技术应用

概率分布图及概率计算

利用GeoGebra动态教学软件,可以画二项分布、超几何分布、正态分布等概率分布图,计算随机变量取值于某区间内的概率.

打开软件,进入GeoGebra的界面,点击右侧边框中的小三角,在显示的经典菜单中选择“概率统计”.

1. 二项分布

选择二项分布,输入试验次数 n=20n = 20 及成功概率 p=0.5p = 0.5 ,即 B(20,0.5)B(20, 0.5) 如图1,绘图区显示二项概率分布图,右侧显示分布列。输入随机变量的取值范围,窗口底部显示随机变量落在该范围的概率,例如

P(8X12)=0.7368.P (8 \leqslant X \leqslant 1 2) = 0. 7 3 6 8.

图2

2. 超几何分布

选择超几何分布,输入总体 N=100N = 100M=10M = 10 及样本 n=30n = 30 ,即 h(30,100,10)h(30,100,10) 。如图2,绘图区显示超几何概率分布图,右侧显示分布列。输入随机变量的取值范围,窗口底部显示随机变量落在该范围的概率,例如

P(1X5)=0.9383.P (1 \leqslant X \leqslant 5) = 0. 9 3 8 3.

3. 正态分布

选择正态分布,输入均值 μ=0\mu=0 ,标准差 σ=1\sigma=1 ,即 N(0,1)N(0,1) 。如图 3,绘图区显示正态密度曲线图。输入随机变量的取值范围,窗口底部显示随机变量落在该范围的概率,例如

P(1X1)=0.6827,P(2X2)=0.9545,P(3X3)=0.9973.\begin{array}{l} P (- 1 \leqslant X \leqslant 1) = 0. 6 8 2 7, \\ P (- 2 \leqslant X \leqslant 2) = 0. 9 5 4 5, \\ P (- 3 \leqslant X \leqslant 3) = 0. 9 9 7 3. \end{array}

图3

通过窗口左下角的按钮,还可以求变量落在单边区间内的概率,例如

P(X1.5)=0.9332.P (X \leqslant 1. 5) = 0. 9 3 3 2.

请你再选择一些正态分布 N(μ,σ2)N(\mu, \sigma^2),分别计算 P(μσXμ+σ)P(\mu - \sigma \leqslant X \leqslant \mu + \sigma)P(μ2σXμ+2σ)P(\mu - 2\sigma \leqslant X \leqslant \mu + 2\sigma)P(μ3σXμ+3σ)P(\mu - 3\sigma \leqslant X \leqslant \mu + 3\sigma) 的值,并总结这些值的规律。

小结

一、本章知识结构

二、回顾与思考

本章我们在已有概率学习的基础上,研究了在一个事件发生的条件下,求另一个事件发生的概率问题,从而得到了条件概率的计算方法。这一方法的基本思想是利用一些已知条件,通过缩小样本空间的方法计算概率。利用条件概率,我们得到了一般的概率乘法公式。特别地,当两个事件相互独立时,乘法公式就是求两个独立事件的积事件的概率公式。有了这些知识,当我们面对一个复杂事件时,就可以先把它表示为一些简单事件运算的结果,再利用概率的加法公式和乘法公式计算出复杂事件的概率。这是全概率公式蕴含的数学思想方法,体现了利用研究对象的性质探寻解决问题的方法、将复杂问题化归为简单问题的数学思想。

在古典概型的学习中我们发现,为了计算随机事件的概率,往往需要为不同背景的问题建立不同的样本空间,这样“单个地”处理问题显然是麻烦而不经济的。类似于引入函数概念,通过函数描述现实世界中变量关系和规律一样,本章我们先引入随机变量的概念,建立起样本空间到实数集的对应关系,为随机事件的表示带来方便;然后再引入分布列概念,建立起随机变量取值与其概率的对应关系。有了随机变量及其分布列的概念,就可以将不同背景的概率问题转化为统一的数学问题,从而为我们利用各种数学工具,系统、全面地研究随机现象的规律奠定基础。

本章的学习中,我们重点关注了随机变量的分布列和数字特征。分布列全面彻底地刻画了随机变量的取值规律;均值和方差是随机变量的两个重要的数字特征,均值反映了随机变量取值的平均水平,而方差反映了随机变量取值的离散程度,它们在推断随机现象的规律进而作出决策中有重要作用.

在函数的学习中我们有这样的经验:通过学习幂函数、指数函数、对数函数、三角函数等基本函数类,不仅加深了对一般函数概念的理解,而且奠定了建立适当的函数模型解决不同类型实际问题的数学基础。类似地,我们通过研究二项分布、超几何分布等离散型随机变量的分布,以及正态分布这一连续型随机变量的分布,不仅进一步理解了随机变量在描述随机现象中的作用,而且对随机思想在解决实际问题中的作用也有了更深入的理解。

请你带着下面的问题,复习一下全章的内容吧!

  1. 两个随机事件的独立性和条件概率有什么关系?

  2. 用全概率公式求一个复杂事件的概率的思路是什么?

  3. 离散型随机变量的分布列与样本频率分布有什么联系与区别?

  4. 离散型随机变量的均值与方差的意义和作用是什么?它们与随机变量的观测值的平均值和方差的联系与区别是什么?

  5. 归纳二项分布模型的特征。有人说:“随机掷一枚质地均匀的硬币,出现正面的概率是0.5。因此,随机抛掷100次硬币,出现50次正面的可能性应该也是0.5。”你认为正确吗?为什么?

  6. 离散型随机变量的分布规律与服从正态分布的随机变量的分布规律的区别是什么?

复习参考题7

复习巩固

  1. 举例说明 P(B)P(B)P(BA)P(B|A) 没有确定的大小关系.

  2. 抛掷两枚质地均匀的骰子,求:

(1)两个点数都出现偶数的概率;

(2) 已知第一枚骰子的点数是偶数的条件下,第二枚骰子的点数也是偶数的概率.

  1. 假设有两箱零件,第一箱内装有10件,其中有2件次品;第二箱内装有20件,其中有3件次品。现从两箱中随意挑选一箱,然后从该箱中随机取1个零件。

(1)求取出的零件是次品的概率;

  • (2) 已知取出的是次品,求它是从第一箱取出的概率.
  1. 已知离散型随机变量 X 的分布列如下表所示.

求:(1)常数 qq 的值;(2)E(X)E(X)D(X)D(X).

  1. 已知随机变量 X 取所有的值 1, 2, …, n 是等可能的,且 E(X)=10E(X)=10 ,求 n 的值.

  2. 已知每门大炮击中目标的概率都是 0.3,现在 n 门大炮同时对某一目标各射击一次.

(1)当 n=10n = 10 时,求恰好击中目标3次的概率(精确到0.001);

(2)如果使目标至少被击中一次的概率超过 95%95\% ,至少需要多少门大炮?

综合运用

  1. 长时间玩手机可能影响视力。据调查,某校学生大约 40%40\% 的人近视,而该校大约有 20%20\% 的学生每天玩手机超过 1h1\mathrm{h},这些人的近视率约为 50%50\%。现从每天玩手机不超过 1h1\mathrm{h} 的学生中任意调查一名学生,求他近视的概率。

  2. 某商场要在国庆节开展促销活动,促销活动可以在商场内举行,也可以在商场外举行。统计资料表明,每年国庆节商场内的促销活动可获得利润2万元;商场外的促销活动,如果不遇到有雨天气可获得利润8万元,如果遇到有雨天气则会带来经济损失3万元。9月30日气象台预报国庆节当地的降水概率是 40%40\% ,商场应该选择哪种促销方式?

  3. 一份某种意外伤害保险费为 20 元,保险金额为 50 万元。某城市的一家保险公司一年能销售 10 万份保单,而每一份保单需要赔付的概率为 10510^{-5} 。利用计算工具求(精确到 0.0001):

(1)这家保险公司在这个险种上亏本的概率;

(2) 这家保险公司在这个险种上一年内获利不少于 100 万元的概率.

拓广探索

  1. 甲、乙、丙三人相互做传球训练,第1次由甲将球传出,每次传球时,传球者都等可能地将球传给另外两个人中的任何一人. 求 nn 次传球后球在甲手中的概率.

  2. 某单位有 10 000 名职工,想通过验血的方法筛查乙肝病毒携带者。假设携带病毒的人占 5%,如果对每个人的血样逐一化验,就需要化验 10 000 次。统计专家提出了一种化验方法:随机地按 5 人一组分组,然后将各组 5 个人的血样混合再化验。如果混合血样呈阴性,说明这 5 个人全部阴性;如果混合血样呈阳性,说明其中至少有一人的血样呈阳性,就需要对每个人再分别化验一次。

(1) 按照这种化验方法能减少化验次数吗?

(2)如果携带病毒的人只占 2%2\% ,按照 kk 个人一组,kk 取多大时化验次数最少?

  1. 某城市高中数学统考,假设考试成绩服从正态分布 N(75,82)N(75, 8^2)。如果按照 16%16\%34%34\%34%34\%16%16\% 的比例将考试成绩分为 A,B,C,D 四个等级,试确定各等级的分数线(精确到 1)。

第八章成对数据的统计分析

在必修课程中,我们学习了单个变量的观测数据的直观表示和统计特征的刻画等知识与方法。例如,用直方图描述样本数据的分布规律,用均值刻画样本数据的集中趋势,用方差刻画样本数据的离散程度等。这些方法主要适用于通过样本认识单个变量的统计规律。在现实中,我们还经常需要了解两个或两个以上变量之间的关系。例如,教育部门为掌握学生身体健康状况,需要了解身高变量和体重变量之间的关系;医疗卫生部门要制定预防青少年近视的措施,需要了解有哪些因素会影响视力,以及这些因素是如何影响视力的;商家要根据顾客的意见改进服务水平,希望了解哪些因素影响服务水平,以及这些因素是如何起作用的;等等。为此,我们需要进一步学习通过样本推断变量之间关系的知识和方法。

本章的学习内容有成对数据的统计相关性、一元线性回归模型和 2×22 \times 2 列联表等,这些知识与方法在解决实际问题中非常有用。可以发现,两个随机变量的相关性可以通过成对样本数据进行分析;利用一元线性回归模型可以研究变量之间的随机关系,进行预测;利用 2×22 \times 2 列联表可以检验两个随机变量的独立性。本章的学习对于提高我们解决实际问题的能力,提升数据分析、数学建模等素养都是非常有帮助的。