成对数据的相关关系与样本相关系数
在同一批个体上同时测两个变量,得到 组成对数据 (paired data) 。把它们描在直角坐标系里就是散点图,点的走向透露两个变量是否一起变化。样本相关系数 (sample correlation coefficient) 把这种走向压缩成一个数,符号给出方向,绝对值给出线性关系的紧密程度。压缩必有损失: 看不见曲线,也分不清谁是因谁是果。
1 · 成对数据与散点图
散点图的每一个点对应一个个体,横坐标是 ,纵坐标是 。若点整体沿一条从左下伸向右上的带状区域分布, 大的个体 也偏大,称两个变量正相关 (positive correlation);带状区域从左上走向右下则称负相关 (negative correlation)。点云漫无方向时,两者之间没有明显的线性趋势。
判断的着眼点是把散点按样本中心 划成四个区域:正相关时点集中在右上与左下,两个坐标同时偏向均值的同一侧;负相关时点集中在左上与右下。
注 · 相关关系与函数关系不同。函数关系里 定则 定,散点严格落在一条曲线上;相关关系只要求 有随 变化的趋势,同一个 上的 仍可参差。统计里绝大多数成对数据属于后者,散点带的宽窄即随机因素留下的痕迹。
2 · 相关系数的构造
四区域的观察可以量化。记 ,同侧的点贡献正项,异侧的点贡献负项, 的符号即相关的方向。它的大小却随量纲变化——把 由米改记为厘米, 就放大一百倍。除以两侧各自离差平方和的平方根,量纲被约掉:
3 · 取值范围与不变性
由 Cauchy–Schwarz 不等式 立得 。等号当且仅当全部点严格落在一条斜率非零的直线上时取到: 对应正斜率, 对应负斜率。 越接近 1,点越贴近某条直线;越接近 0,线性成分越弱。
对平移与正的伸缩不敏感:把 换成 、 换成 (,), 一字不变。这正是「无量纲」的含义,也意味着 只认相对位置,不认单位与原点。
4 · 线性之外的关系
只度量线性成分。写本节时原以为「非线性关系必然让 接近 0」,实测把这个断言推翻了:取 ,在 上算得 ,对称让每一对 的离差积正负抵消;同一条抛物线换到 上, 变成 0.9740。
决定 的不是曲线是否为直线,而是取样区间落在曲线的哪一段。顶点居中时两翼互相抵消,顶点被推到区间端点时曲线在这一段上几乎单调, 随之逼近 1。把图 2-1 的噪声置零、取样区间中心由 0 移到 5,抛物线的 从 0.0000 升到 0.9655。
警示 · 只说明线性成分弱,不说明两个变量无关; 接近 1 也不保证关系是直线,足够窄的取样区间里任何光滑曲线都近似为直线。关系的形状要看散点图, 只是它的一个摘要。
5 · 相关与因果
大只说明两列数一起动,不说明谁推动了谁。冰淇淋销量与溺水人数在同一批月份的数据上高度正相关,二者都由气温这个共同原因驱动,彼此并无因果链条,气温这类同时影响两侧的变量称为混杂因素 (confounder)。除共同原因之外,因果方向可能与直觉相反,也可能纯属巧合:在足够多的变量里搜寻,总能捞出几对 很高却毫无关联的序列。
从相关走向因果需要观察数据之外的东西:随机化试验、时间先后的证据、或者对机制的独立说明。列联表上的独立性检验同样只回答「有没有关联」,见 列联表与独立性检验;由成对数据拟合出可用于预测的直线,见 一元线性回归。
6 · 参考文献
- Pearson correlation coefficient. Wikipedia. 样本相关系数的定义、取值范围与不变性。https://en.wikipedia.org/wiki/Pearson_correlation_coefficient
- Cauchy–Schwarz inequality. Wikipedia. 的来源与等号条件。https://en.wikipedia.org/wiki/Cauchy%E2%80%93Schwarz_inequality
- Correlation does not imply causation. Wikipedia. 混杂因素、反向因果与巧合相关。https://en.wikipedia.org/wiki/Correlation_does_not_imply_causation
- Anscombe quartet. Wikipedia. 四组 相同而形状迥异的数据,说明 只是摘要。https://en.wikipedia.org/wiki/Anscombe%27s_quartet