文字转写
8.1.2 样本相关系数
通过观察散点图中成对样本数据的分布规律,我们可以大致推断两个变量是否存在相关关系、是正相关还是负相关、是线性相关还是非线性相关等。散点图虽然直观,但无法确切地反映成对样本数据的相关程度,也就无法量化两个变量之间相关程度的大小。能否像引入均值、方差等数字特征对单个变量数据进行分析那样,引入一个适当的“数字特征”,对成对样本数据的相关程度进行定量分析呢?
对于变量 x 和变量 y,设经过随机抽样获得的成对样本数据为 ( x 1 , y 1 ) (x_{1}, y_{1}) ( x 1 , y 1 ) , ( x 2 , y 2 ) (x_{2}, y_{2}) ( x 2 , y 2 ) , ⋯ \cdots ⋯ , ( x n , y n ) (x_{n}, y_{n}) ( x n , y n ) ,其中 x 1 , x 2 , ⋯ , x n x_{1}, x_{2}, \cdots, x_{n} x 1 , x 2 , ⋯ , x n 和 y 1 , y 2 , ⋯ , y n y_{1}, y_{2}, \cdots, y_{n} y 1 , y 2 , ⋯ , y n 的均值分别为 x ‾ \overline{x} x 和 y ‾ \overline{y} y 。为了刻画每个变量的观测数据相对其均值的增减情况,将数据以 ( x ‾ , y ‾ ) (\overline{x}, \overline{y}) ( x , y ) 为零点进行平移,得到平移后的成对数据为
( x 1 − x ‾ , y 1 − y ‾ ) , ( x 2 − x ‾ , y 2 − y ‾ ) , … , ( x n − x ‾ , y n − y ‾ ) , (x _ {1} - \overline {{x}}, y _ {1} - \overline {{y}}), (x _ {2} - \overline {{x}}, y _ {2} - \overline {{y}}), \dots , (x _ {n} - \overline {{x}}, y _ {n} - \overline {{y}}), ( x 1 − x , y 1 − y ) , ( x 2 − x , y 2 − y ) , … , ( x n − x , y n − y ) ,
并绘制散点图.
利用上述方法处理表8.1-1中的数据,得到图8.1-3.我们发现,这时的散点大多数分布在第一象限、第三象限,大多数散点的横、纵坐标同号.显然,这样的规律是由人体脂肪含量与年龄正相关所决定的.
一般地,如果变量 x x x 和 y y y 正相关,那么关于均值平移后的大多数散点将分布在第一象限、第三象限,对应的成对数据同号的居多,如图8.1-4(1)所示;如果变量 x x x 和 y y y 负相关,那么关于均值平移后的大多数散点将分布在第二象限、第四象限,对应的成对数据异号的居多,如图8.1-4(2)所示.
思考
根据上述分析,你能利用正相关变量和负相关变量的成对样本数据平移后呈现的规律,构造一个度量成对样本数据是正相关还是负相关的数字特征吗?
从上述讨论得到启发,利用散点 ( x i − x ‾ , y i − y ‾ ) (x_{i}-\overline{x}, y_{i}-\overline{y}) ( x i − x , y i − y ) ( i = 1 , 2 , ⋯ , n i=1,2,\cdots,n i = 1 , 2 , ⋯ , n ) 的横、纵坐标是否同号,可以构造一个量
L x y = 1 n [ ( x 1 − x ‾ ) ( y 1 − y ‾ ) + ( x 2 − x ‾ ) ( y 2 − y ‾ ) + ⋯ + ( x n − x ‾ ) ( y n − y ‾ ) ] . L _ {x y} = \frac {1}{n} \big [ (x _ {1} - \overline {{x}}) (y _ {1} - \overline {{y}}) + (x _ {2} - \overline {{x}}) (y _ {2} - \overline {{y}}) + \dots + (x _ {n} - \overline {{x}}) (y _ {n} - \overline {{y}}) \big ]. L x y = n 1 [ ( x 1 − x ) ( y 1 − y ) + ( x 2 − x ) ( y 2 − y ) + ⋯ + ( x n − x ) ( y n − y ) ] .
一般情形下, L x y > 0 L_{xy}>0 L x y > 0 表明成对样本数据正相关; L x y < 0 L_{xy}<0 L x y < 0 表明成对样本数据负相关.
思考
你认为 L x y L_{xy} L x y 的大小一定能度量出成对样本数据的相关程度吗?
因为 L x y L_{xy} L x y 的大小与数据的度量单位有关,所以不宜直接用它度量成对样本数据相关程度的大小。例如,在研究体重与身高之间的相关程度时,如果体重的单位不变,把身高的单位由米改为厘米,则相应的 L x y L_{xy} L x y 将变为原来的 100 倍,但单位的改变并不会导致体重与身高之间相关程度的改变。
为了消除度量单位的影响,需要对数据作进一步的“标准化”处理。我们用
s x = 1 n ∑ i = 1 n ( x i − x ‾ ) 2 , s y = 1 n ∑ i = 1 n ( y i − y ‾ ) 2 s _ {x} = \sqrt {\frac {1}{n} \sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}}, s _ {y} = \sqrt {\frac {1}{n} \sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) ^ {2}} s x = n 1 ∑ i = 1 n ( x i − x ) 2 , s y = n 1 ∑ i = 1 n ( y i − y ) 2
分别除 x i − x ‾ x_{i}-\overline{x} x i − x 和 y i − y ‾ ( i = 1 , 2 , ⋯ , n ) y_{i}-\overline{y}(i=1,2,\cdots,n) y i − y ( i = 1 , 2 , ⋯ , n ) ,得
( x 1 − x ‾ s x , y 1 − y ‾ s y ) , ( x 2 − x ‾ s x , y 2 − y ‾ s y ) , … , ( x n − x ‾ s x , y n − y ‾ s y ) . \left(\frac {x _ {1} - \overline {{x}}}{s _ {x}}, \frac {y _ {1} - \overline {{y}}}{s _ {y}}\right), \left(\frac {x _ {2} - \overline {{x}}}{s _ {x}}, \frac {y _ {2} - \overline {{y}}}{s _ {y}}\right), \dots , \left(\frac {x _ {n} - \overline {{x}}}{s _ {x}}, \frac {y _ {n} - \overline {{y}}}{s _ {y}}\right). ( s x x 1 − x , s y y 1 − y ) , ( s x x 2 − x , s y y 2 − y ) , … , ( s x x n − x , s y y n − y ) .
为简单起见,把上述“标准化”处理后的成对数据分别记为
( x 1 ′ , y 1 ′ ) , ( x 2 ′ , y 2 ′ ) , … , ( x n ′ , y n ′ ) , (x _ {1} ^ {\prime}, y _ {1} ^ {\prime}), (x _ {2} ^ {\prime}, y _ {2} ^ {\prime}), \dots , (x _ {n} ^ {\prime}, y _ {n} ^ {\prime}), ( x 1 ′ , y 1 ′ ) , ( x 2 ′ , y 2 ′ ) , … , ( x n ′ , y n ′ ) ,
仿照 L x y L_{xy} L x y 的构造,可以得到
r = 1 n ( x 1 ′ y 1 ′ + x 2 ′ y 2 ′ + ⋯ + x n ′ y n ′ ) r = \frac {1}{n} (x _ {1} ^ {\prime} y _ {1} ^ {\prime} + x _ {2} ^ {\prime} y _ {2} ^ {\prime} + \dots + x _ {n} ^ {\prime} y _ {n} ^ {\prime}) r = n 1 ( x 1 ′ y 1 ′ + x 2 ′ y 2 ′ + ⋯ + x n ′ y n ′ )
= \frac {\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) (y _ {i} - \overline {{y}})}{\sqrt {\sum_ {i = 1} ^ {n} (x _ {i} - \overline {{x}}) ^ {2}} \sqrt {\sum_ {i = 1} ^ {n} (y _ {i} - \overline {{y}}) ^ {2}}}.\tag{1}
我们称 r 为变量 x 和变量 y 的样本相关系数(sample correlation coefficient).
这样,我们利用成对样本数据构造了样本相关系数 r r r 。样本相关系数 r r r 是一个描述成对样本数据的数字特征,它的正负性可以反映成对样本数据的变化特征:
当 r > 0 r > 0 r > 0 时,称成对样本数据正相关。这时,当其中一个数据的值变小时,另一个数据的值通常也变小;当其中一个数据的值变大时,另一个数据的值通常也变大。
当 r < 0 r < 0 r < 0 时,称成对样本数据负相关。这时,当其中一个数据的值变小时,另一个数据的值通常会变大;当其中一个数据的值变大时,另一个数据的值通常会变小。
那么,样本相关系数 r r r 的大小与成对样本数据的相关程度有什么内在联系呢?为此,我们先考察一下 r r r 的取值范围.
观察 r r r 的结构,联想到二维(平面)向量、三维(空间)向量数量积的坐标表示,我们将向量的维数推广到 n n n 维,n n n 维向量 a , b a, b a , b 的数量积仍然定义为
a ⋅ b = ∣ a ∣ ∣ b ∣ cos θ , \boldsymbol {a} \cdot \boldsymbol {b} = | \boldsymbol {a} | | \boldsymbol {b} | \cos \theta , a ⋅ b = ∣ a ∣∣ b ∣ cos θ ,
其中 θ \theta θ 为向量 a , b a, b a , b 的夹角. 类似于平面或空间向量的坐标表示,对于向量 a = ( a 1 , a 2 , a = (a_{1}, a_{2}, a = ( a 1 , a 2 ,
⋯ , a n \cdots, a_{n} ⋯ , a n 和 b = ( b 1 , b 2 , ⋯ , b n ) \boldsymbol{b}=(b_{1}, b_{2}, \cdots, b_{n}) b = ( b 1 , b 2 , ⋯ , b n ) ,我们有
a ⋅ b = a 1 b 1 + a 2 b 2 + ⋯ + a n b n . \boldsymbol {a} \cdot \boldsymbol {b} = a _ {1} b _ {1} + a _ {2} b _ {2} + \dots + a _ {n} b _ {n}. a ⋅ b = a 1 b 1 + a 2 b 2 + ⋯ + a n b n .
设 “标准化” 处理后的成对数据 ( x 1 ′ , y 1 ′ ) (x_{1}^{\prime}, y_{1}^{\prime}) ( x 1 ′ , y 1 ′ ) , ( x 2 ′ , y 2 ′ ) (x_{2}^{\prime}, y_{2}^{\prime}) ( x 2 ′ , y 2 ′ ) , ⋯ \cdots ⋯ , ( x n ′ , y n ′ ) (x_{n}^{\prime}, y_{n}^{\prime}) ( x n ′ , y n ′ ) 的第一分量构成 n 维向量
x ′ = ( x 1 ′ , x 2 ′ , … , x n ′ ) , \boldsymbol {x} ^ {\prime} = (x _ {1} ^ {\prime}, x _ {2} ^ {\prime}, \dots , x _ {n} ^ {\prime}), x ′ = ( x 1 ′ , x 2 ′ , … , x n ′ ) ,
第二分量构成 n 维向量
y ′ = ( y 1 ′ , y 2 ′ , … , y n ′ ) , \mathbf {y} ^ {\prime} = (y _ {1} ^ {\prime}, y _ {2} ^ {\prime}, \dots , y _ {n} ^ {\prime}), y ′ = ( y 1 ′ , y 2 ′ , … , y n ′ ) ,
则有
r = 1 n x ′ ⋅ y ′ = 1 n ∣ x ′ ∣ ∣ y ′ ∣ cos θ . r = \frac {1}{n} \boldsymbol {x} ^ {\prime} \cdot \boldsymbol {y} ^ {\prime} = \frac {1}{n} | \boldsymbol {x} ^ {\prime} | | \boldsymbol {y} ^ {\prime} | \cos \theta . r = n 1 x ′ ⋅ y ′ = n 1 ∣ x ′ ∣∣ y ′ ∣ cos θ .
因为 ∣ x ′ ∣ = ∣ y ′ ∣ = n |x'| = |y'| = \sqrt{n} ∣ x ′ ∣ = ∣ y ′ ∣ = n ,所以样本相关系数
r = cos θ , r = \cos \theta , r = cos θ ,
其中 θ \theta θ 为向量 x ′ x' x ′ 和向量 y ′ y' y ′ 的夹角.
由 − 1 ⩽ cos θ ⩽ 1 -1 \leqslant \cos \theta \leqslant 1 − 1 ⩽ cos θ ⩽ 1 ,可知
− 1 ⩽ r ⩽ 1. - 1 \leqslant r \leqslant 1. − 1 ⩽ r ⩽ 1.
思考
当 ∣ r ∣ = 1 |r| = 1 ∣ r ∣ = 1 时,成对样本数据之间具有怎样的关系呢?
当 ∣ r ∣ = 1 |r|=1 ∣ r ∣ = 1 时, r = cos θ r=\cos\theta r = cos θ 中的 θ = 0 \theta=0 θ = 0 或 π \pi π ,向量 x ′ x' x ′ 和 y ′ y' y ′ 共线。由向量的知识可知,存在实数 λ \lambda λ ,使得 y ′ = λ x ′ y'=\lambda x' y ′ = λ x ′ ,即
y i − y ‾ s y = λ x i − x ‾ s x , i = 1 , 2 , … , n . \frac {y _ {i} - \overline {{y}}}{s _ {y}} = \lambda \frac {x _ {i} - \overline {{x}}}{s _ {x}}, i = 1, 2, \dots , n. s y y i − y = λ s x x i − x , i = 1 , 2 , … , n .
这表明成对样本数据 ( x i , y i ) (x_{i}, y_{i}) ( x i , y i ) 都落在直线
y − y ‾ = λ s y s x ( x − x ‾ ) y - \overline {{y}} = \frac {\lambda s _ {y}}{s _ {x}} (x - \overline {{x}}) y − y = s x λ s y ( x − x )
• •
上.这时,成对样本数据的两个分量之间满足一种线性关系.
由此可见,样本相关系数 r 的取值范围为 [ − 1 , 1 ] [-1, 1] [ − 1 , 1 ] . 样本相关系数 r 的绝对值大小可以反映成对样本数据之间线性相关的程度:
当 ∣ r ∣ |r| ∣ r ∣ 越接近1时,成对样本数据的线性相关程度越强;
样本相关系数 r r r 有时也称样本线性相关系数,∣ r ∣ |r| ∣ r ∣ 刻画了样本点集中于某条直线的程度。当 r = 0 r = 0 r = 0 时,只表明成对样本数据间没有线性相关关系,但不排除它们之间有其他相关关系。
当 ∣ r ∣ |r| ∣ r ∣ 越接近0时,成对样本数据的线性相关程度越弱.
图 8.1-5 是不同成对样本数据的散点图和相应的样本相关系数。图(1)中的散点有明显的从左下角到右上角沿直线分布的趋势,说明成对样本数据呈现出线性相关关系;样本相关系数 r=0.97,表明成对样本数据的正线性相关程度很强。图(2)中的散点有明显的从左上角到右下角沿直线分布的趋势,说明成对样本数据也呈现出线性相关关系;样本相关系数 r = − 0.85 r = -0.85 r = − 0.85 ,表明成对样本数据的负线性相关程度比较强。从样本相关系数来看,图(1)中成对样本数据的线性相关程度要比图(2)中强一些;图(3)和图(4)中的成对样本数据的线性相关程度很弱,其中图(4)中成对样本数据的线性相关程度极弱。
综上可知,两个随机变量的相关性可以通过成对样本数据进行分析,而样本相关系数 r r r 可以反映两个随机变量之间的线性相关程度:r r r 的符号反映了相关关系的正负性;∣ r ∣ |r| ∣ r ∣ 的大小反映了两个变量线性相关的程度,即散点集中于一条直线的程度.
在有限总体中,若要确切地了解两个变量之间相关关系的正负性及线性相关的程度,我们可以利用这两个变量取值的所有成对数据,通过公式(1)就可以计算出两个变量的相关系数。例如,要确切了解脂肪含量 y y y 与年龄 x x x 的线性相关程度,需要调查所有人的年龄及其脂肪含量,再将得到的成对数据代入公式(1),计算出相关系数。这个相关系数就能确切地反映变量之间的相关程度。
不过,在实际中,获得总体中所有的成对数据往往是不容易的。因此,我们还是要用样本估计总体的思想来解决问题。也就是说,我们先要通过抽样获取两个变量的一些成对样本数据,再计算出样本相关系数,通过样本相关系数去估计总体相关系数,从而了解两个变量之间的相关程度。对于简单随机样本而言,样本具有随机性,因此样本相关系数 r r r 也具有随机性。一般地,样本容量越大,用样本相关系数估计两个变量的相关系数的效果越好。
例 1 根据表 8.1-1 中脂肪含量和年龄的样本数据,推断两个变量是否线性相关,计算样本相关系数,并推断它们的相关程度.
解:先画出散点图,如图8.1-1所示。观察散点图,可以看出样本点都集中在一条直线附近,由此推断脂肪含量和年龄线性相关。
根据样本相关系数的定义,
r = \frac {\sum_ {i = 1} ^ {1 4} (x _ {i} - \overline {{x}}) (y _ {i} - \overline {{y}})}{\sqrt {\sum_ {i = 1} ^ {1 4} (x _ {i} - \overline {{x}}) ^ {2}} \sqrt {\sum_ {i = 1} ^ {1 4} (y _ {i} - \overline {{y}}) ^ {2}}} = \frac {\sum_ {i = 1} ^ {1 4} x _ {i} y _ {i} - 1 4 \overline {{x}} \overline {{y}}}{\sqrt {\sum_ {i = 1} ^ {1 4} x _ {i} ^ {2} - 1 4 \overline {{x}} ^ {2}} \sqrt {\sum_ {i = 1} ^ {1 4} y _ {i} ^ {2} - 1 4 \overline {{y}} ^ {2}}}.\tag{①}
利用计算工具计算可得
x ‾ ≈ 48.07 , y ‾ ≈ 27.26 , ∑ i = 1 14 x i y i = 19403.2 , ∑ i = 1 14 x i 2 = 34181 , ∑ i = 1 14 y i 2 = 11051.77. \begin{array}{l} \overline {{x}} \approx 4 8. 0 7, \overline {{y}} \approx 2 7. 2 6, \sum_ {i = 1} ^ {1 4} x _ {i} y _ {i} = 1 9 4 0 3. 2, \\ \sum_ {i = 1} ^ {1 4} x _ {i} ^ {2} = 3 4 1 8 1, \sum_ {i = 1} ^ {1 4} y _ {i} ^ {2} = 1 1 0 5 1. 7 7. \end{array} x ≈ 48.07 , y ≈ 27.26 , ∑ i = 1 14 x i y i = 19403.2 , ∑ i = 1 14 x i 2 = 34181 , ∑ i = 1 14 y i 2 = 11051.77.
代入 ① 式,得
利用统计软件计算样本相关系数,Excel 软件用函数 CORREL;R 软件用函数 cor.
r ≈ 19403.2 − 14 × 48.07 × 27.26 34181 − 14 × 48.07 2 × 11051.77 − 14 × 27.26 2 ≈ 0.97. r \approx \frac {1 9 4 0 3 . 2 - 1 4 \times 4 8 . 0 7 \times 2 7 . 2 6}{\sqrt {3 4 1 8 1 - 1 4 \times 4 8 . 0 7 ^ {2}} \times \sqrt {1 1 0 5 1 . 7 7 - 1 4 \times 2 7 . 2 6 ^ {2}}} \approx 0. 9 7. r ≈ 34181 − 14 × 48.0 7 2 × 11051.77 − 14 × 27.2 6 2 19403.2 − 14 × 48.07 × 27.26 ≈ 0.97.
由样本相关系数 r ≈ 0.97 r \approx 0.97 r ≈ 0.97 ,可以推断脂肪含量和年龄这两个变量正线性相关,且相关程度很强.
例 2 有人收集了某城市居民年收入(所有居民在一年内收入的总和)与 A 商品销售额的 10 年数据,如表 8.1-2 所示.
画出散点图,推断成对样本数据是否线性相关,并通过样本相关系数推断 A 商品销售额与居民年收入的相关程度和变化趋势的异同.
解:画出成对样本数据的散点图,如图8.1-6所示。从散点图看,A商品销售额与居民年收入的样本数据呈现出线性相关关系。
由样本数据计算得样本相关系数 r ≈ 0.95 r \approx 0.95 r ≈ 0.95 。由此可以推断,A 商品销售额与居民年收入正线性相关,即 A 商品销售额与居民年收入有相同的变化趋势,且相关程度很强。
例 3 在某校高一年级中随机抽取 25 名男生,测得他们的身高、体重、臂展等数据,如表 8.1-3 所示.
体重与身高、臂展与身高分别具有怎样的相关性?
解:根据样本数据画出体重与身高、臂展与身高的散点图,分别如图 8.1-7(1) 和 (2) 所示,两个散点图都呈现出线性相关的特征.
通过计算得到体重与身高、臂展与身高的样本相关系数分别约为0.34和0.78,都为正线性相关。其中,臂展与身高的相关程度更高。
练习
由简单随机抽样得到的成对样本数据的样本相关系数是否一定能确切地反映变量之间的相关关系?为什么?
已知变量 x x x 和变量 y y y 的3对随机观测数据(2,2),(3,-1),(5,-7),计算成对样本数据的样本相关系数。能据此推断这两个变量线性相关吗?为什么?
画出下列成对数据的散点图,并计算样本相关系数。据此,请你谈谈样本相关系数在刻画成对样本数据相关关系上的特点。
(1) ( − 2 , − 3 ) (-2, -3) ( − 2 , − 3 ) , ( − 1 , − 1 ) (-1, -1) ( − 1 , − 1 ) , ( 0 , 1 ) (0, 1) ( 0 , 1 ) , ( 1 , 3 ) (1, 3) ( 1 , 3 ) , ( 2 , 5 ) (2, 5) ( 2 , 5 ) , ( 3 , 7 ) (3, 7) ( 3 , 7 ) ;
(2) ( 0 , 0 ) (0, 0) ( 0 , 0 ) , (1, 1), (2, 4), (3, 9), (4, 16);
(3) ( − 2 , − 8 ) (-2, -8) ( − 2 , − 8 ) , ( − 1 , − 1 ) (-1, -1) ( − 1 , − 1 ) , ( 0 , 0 ) (0, 0) ( 0 , 0 ) , ( 1 , 1 ) (1, 1) ( 1 , 1 ) , ( 2 , 8 ) (2, 8) ( 2 , 8 ) , ( 3 , 27 ) (3, 27) ( 3 , 27 ) ;
(4) ( 2 , 0 ) (2, 0) ( 2 , 0 ) , ( 1 , 3 ) (1, \sqrt{3}) ( 1 , 3 ) , ( 0 , 2 ) (0, 2) ( 0 , 2 ) , ( − 1 , 3 ) (-1, \sqrt{3}) ( − 1 , 3 ) , ( − 2 , 0 ) (-2, 0) ( − 2 , 0 ) .
随机抽取 7 家超市,得到其广告支出与销售额数据如下:
请推断超市的销售额与广告支出之间的相关关系的类型、相关程度和变化趋势的特征.
习题8.1
复习巩固
在以下4幅散点图中,推断哪些图中的 y y y 和 x x x 之间存在相关关系?其中哪些正相关,哪些负相关?哪些图所对应的成对样本数据呈现出线性相关关系?哪些图所对应的成对样本数据呈现出非线性相关关系?
综合运用
随机抽取 10 家航空公司,对其最近一年的航班正点率和顾客投诉次数进行调查,所得数据如下:
顾客投诉次数和航班正点率之间是否呈现出线性相关关系?它们之间的相关程度如何?变化趋势有何特征?
根据物理中的胡克定律,在弹性限度内,弹簧伸长的长度与所受的外力成正比。在弹性限度内,测得一根弹簧伸长长度 x x x 和相应所受外力 F F F 的一组数据如下:
两个变量的样本相关系数是否为 1?请你解释其中的原因.
拓广探索
某地区的环境条件适合天鹅栖息繁衍. 有人发现了一个有趣的现象, 该地区有 5 个村庄, 其中 3 个村庄附近栖息的天鹅较多, 婴儿出生率也较高; 2 个村庄附近栖息的天鹅较少, 婴儿的出生率也较低. 有人认为婴儿出生率和天鹅数之间存在相关关系, 并得出一个结论: 天鹅能够带来孩子. 你同意这个结论吗? 为什么?