Appearance
协方差、相关系数与柯西不等式
这份笔记整理协方差、标准化、相关系数、向量夹角和柯西-施瓦茨不等式之间的关系。
核心直觉:
协方差看两个变量是否一起偏离平均值;相关系数把这种共同偏离标准化后,变成两个中心化向量夹角的余弦。
协方差:共同偏离平均值
设随机变量
协方差定义为:
它看的是两件事:
比自己的平均值高或低; 比自己的平均值高或低;- 这两个偏离方向是否经常一致。
如果
如果它们经常异号,那么乘积多为负,协方差偏负。
如果方向没有明显规律,正负乘积互相抵消,协方差接近
因此:
:两个变量倾向于同涨同跌; :一个变量高于均值时,另一个倾向于低于均值; :没有明显线性共同变化。
协方差的问题是受单位影响。比如身高用厘米还是米,协方差数值会改变。所以它很基础,但不总是最适合直接解释。
标准化:去掉单位和尺度
标准化就是把变量改写成“离均值多少个标准差”:
其中:
标准化后:
并且:
这说明标准化后的变量没有单位,平均值为
这里容易疑惑的是:为什么标准化后
关键是方差公式:
标准化后
因此:
更直接地看:
相关系数:标准化后的协方差
相关系数定义为:
把协方差展开:
也就是:
所以相关系数衡量的是:
两个变量标准化后的偏离方向,是否经常一致。
如果
如果
如果偏离方向没有规律,正负抵消,相关系数接近
相关系数比协方差更容易解释,因为它没有单位,并且一定落在
为什么相关系数的绝对值不超过 1
令:
那么:
又因为标准化后:
由柯西-施瓦茨不等式:
代入
因此:
这就是相关系数范围固定在
柯西-施瓦茨不等式
向量形式的柯西-施瓦茨不等式是:
展开成求和形式:
也常写成:
概率形式是:
这可以理解为把随机变量当成某种“向量”,把
所以前面说“柯西不等式”,更严格地说是“柯西-施瓦茨不等式”。在很多语境里,它也会被简称为柯西不等式。
把数据看成向量
假设有三个人的数据:
| 人 | 学习时间 | 成绩 |
|---|---|---|
| A | 1 | 2 |
| B | 2 | 4 |
| C | 3 | 6 |
先把每一列看成一个向量:
相关系数不是直接看原始向量,而是先减去各自平均值。
然后计算两个中心化向量夹角的余弦:
点积为:
长度为:
所以:
因为:
两个中心化向量方向完全一致,所以相关系数是
如果成绩改成:
中心化后:
这时:
两个中心化向量方向完全相反,所以相关系数是
向量夹角的解释
把中心化后的数据向量记为
这正是两个向量夹角
因此:
:夹角是 ,方向完全一致; :夹角是 ,方向完全相反; :夹角是 ,方向正交,没有线性共同变化。
这也是为什么相关系数的绝对值不会超过
需要注意的点
相关系数很有用,但要注意三件事:
第一,它衡量的是线性共同变化。如果两个变量之间是明显非线性关系,相关系数可能接近
第二,相关不等于因果。两个变量一起变化,不一定是一个导致另一个。
第三,如果某个变量的标准差是
总结
这几个概念可以串成一条线:
- 协方差看两个变量是否一起偏离平均值。
- 标准化把变量变成“离均值几个标准差”,消除单位和尺度。
- 相关系数是标准化后的协方差。
- 把数据看成向量时,相关系数就是中心化向量夹角的余弦。
- 柯西-施瓦茨不等式保证了这个余弦式的绝对值不会超过
。
所以相关系数不是凭空定义出来的数,而是协方差、标准化、向量点积和柯西-施瓦茨不等式自然合在一起的结果。