数学 / 概率与统计 · 从样本空间到成对数据 / 成对数据的相关关系与样本相关系数 待审核 14 / 16
scatter plot · r · 相关不等于因果

成对数据的相关关系与样本相关系数

在同一批个体上同时测两个变量,得到 nn成对数据 (paired data) (xi,yi)(x_i, y_i)。把它们描在直角坐标系里就是散点图,点的走向透露两个变量是否一起变化。样本相关系数 (sample correlation coefficient) rr 把这种走向压缩成一个数,符号给出方向,绝对值给出线性关系的紧密程度。压缩必有损失:rr 看不见曲线,也分不清谁是因谁是果。

1 · 成对数据与散点图

paired data · scatter plot

散点图的每一个点对应一个个体,横坐标是 xix_i,纵坐标是 yiy_i。若点整体沿一条从左下伸向右上的带状区域分布,xx 大的个体 yy 也偏大,称两个变量正相关 (positive correlation);带状区域从左上走向右下则称负相关 (negative correlation)。点云漫无方向时,两者之间没有明显的线性趋势。

判断的着眼点是把散点按样本中心 (xˉ,yˉ)(\bar x, \bar y) 划成四个区域:正相关时点集中在右上与左下,两个坐标同时偏向均值的同一侧;负相关时点集中在左上与右下。

注 · 相关关系与函数关系不同。函数关系里 xx 定则 yy 定,散点严格落在一条曲线上;相关关系只要求 yy 有随 xx 变化的趋势,同一个 xx 上的 yy 仍可参差。统计里绝大多数成对数据属于后者,散点带的宽窄即随机因素留下的痕迹。

2 · 相关系数的构造

离差积之和 · 离差平方和 · 无量纲

四区域的观察可以量化。记 Sxy=i(xixˉ)(yiyˉ)S_{xy} = \sum_i (x_i - \bar x)(y_i - \bar y),同侧的点贡献正项,异侧的点贡献负项,SxyS_{xy} 的符号即相关的方向。它的大小却随量纲变化——把 xx 由米改记为厘米,SxyS_{xy} 就放大一百倍。除以两侧各自离差平方和的平方根,量纲被约掉:

r=i(xixˉ)(yiyˉ)i(xixˉ)2i(yiyˉ)2r = \frac{\sum_i (x_i - \bar x)(y_i - \bar y)}{\sqrt{\sum_i (x_i - \bar x)^2}\,\sqrt{\sum_i (y_i - \bar y)^2}}
图 2-1 · 散点按样本中心分出的四个区域与相应的 rr。可切换数据形态、调整噪声强度、平移取样区间中心与随机种子。

3 · 取值范围与不变性

Cauchy–Schwarz · 平移与伸缩不变

由 Cauchy–Schwarz 不等式 Sxy2SxxSyyS_{xy}^2 \le S_{xx} S_{yy} 立得 r1|r| \le 1。等号当且仅当全部点严格落在一条斜率非零的直线上时取到:r=1r = 1 对应正斜率,r=1r = -1 对应负斜率。r|r| 越接近 1,点越贴近某条直线;越接近 0,线性成分越弱。

rr 对平移与正的伸缩不敏感:把 xix_i 换成 axi+ba x_i + byiy_i 换成 cyi+dc y_i + da>0a > 0c>0c > 0),rr 一字不变。这正是「无量纲」的含义,也意味着 rr 只认相对位置,不认单位与原点。

4 · 线性之外的关系

非线性 · 取样区间

rr 只度量线性成分。写本节时原以为「非线性关系必然让 rr 接近 0」,实测把这个断言推翻了:取 y=x2y = x^2,在 x=5,4,,5x = -5, -4, \dots, 5 上算得 r=0r = 0,对称让每一对 ±x\pm x 的离差积正负抵消;同一条抛物线换到 x=1,2,,11x = 1, 2, \dots, 11 上,rr 变成 0.9740。

决定 rr 的不是曲线是否为直线,而是取样区间落在曲线的哪一段。顶点居中时两翼互相抵消,顶点被推到区间端点时曲线在这一段上几乎单调,rr 随之逼近 1。把图 2-1 的噪声置零、取样区间中心由 0 移到 5,抛物线的 rr 从 0.0000 升到 0.9655。

警示 · r0r \approx 0 只说明线性成分弱,不说明两个变量无关;r|r| 接近 1 也不保证关系是直线,足够窄的取样区间里任何光滑曲线都近似为直线。关系的形状要看散点图,rr 只是它的一个摘要。

5 · 相关与因果

correlation is not causation · confounder

rr 大只说明两列数一起动,不说明谁推动了谁。冰淇淋销量与溺水人数在同一批月份的数据上高度正相关,二者都由气温这个共同原因驱动,彼此并无因果链条,气温这类同时影响两侧的变量称为混杂因素 (confounder)。除共同原因之外,因果方向可能与直觉相反,也可能纯属巧合:在足够多的变量里搜寻,总能捞出几对 r|r| 很高却毫无关联的序列。

从相关走向因果需要观察数据之外的东西:随机化试验、时间先后的证据、或者对机制的独立说明。列联表上的独立性检验同样只回答「有没有关联」,见 列联表与独立性检验;由成对数据拟合出可用于预测的直线,见 一元线性回归

6 · 参考文献

  1. Pearson correlation coefficient. Wikipedia. 样本相关系数的定义、取值范围与不变性。https://en.wikipedia.org/wiki/Pearson_correlation_coefficient
  2. Cauchy–Schwarz inequality. Wikipedia. r1|r| \le 1 的来源与等号条件。https://en.wikipedia.org/wiki/Cauchy%E2%80%93Schwarz_inequality
  3. Correlation does not imply causation. Wikipedia. 混杂因素、反向因果与巧合相关。https://en.wikipedia.org/wiki/Correlation_does_not_imply_causation
  4. Anscombe quartet. Wikipedia. 四组 rr 相同而形状迥异的数据,说明 rr 只是摘要。https://en.wikipedia.org/wiki/Anscombe%27s_quartet