数学 / 概率与统计 · 从样本空间到成对数据 / 2×2 列联表与独立性检验 待审核 16 / 16
contingency table · χ² · 临界值

2×2 列联表与独立性检验

成对数据的相关关系一元线性回归 处理的都是数值型变量。若两个变量取的是「参加 / 未参加」「优良 / 不优良」这类类别,散点图与相关系数都用不上,取而代之的是把频数填进一张列联表 (contingency table),再问一句:这两个分类变量相互独立,还是彼此有关联。独立性检验 (test of independence) 把这句话量化成一个可判定的形式。

1 · 四格表

2×2 contingency table · 边缘和

两个分类变量各取两个值时,列联表是一张 2×22 \times 2 的四格表。约定按行读,四格依次记为 aabbccddaa 是两个变量都取第一类的个体数,bb 是行取第一类、列取第二类的个体数,ccdd 同理。行和 a+ba + bc+dc + d 与列和 a+ca + cb+db + d 称为边缘和,总和 n=a+b+c+dn = a + b + c + d 是样本容量。

演示用的一张表来自 200 名学生:参加课外体育社团的 100 人中体质测试优良的有 52 人,未参加的 100 人中优良的有 39 人。四格依次是 a=52a = 52b=48b = 48c=39c = 39d=61d = 61。两行的优良率 52.0% 与 39.0% 相差 13 个百分点,这个差是否大到不能用随机波动解释,正是检验要回答的。

2 · 独立假设下的期望频数

期望频数 · 行和乘列和再除以 n

若两个变量相互独立,「行取第一类」与「列取第一类」这两个事件就独立,联合频率应当等于两个边缘频率之积。乘上样本容量,左上格的期望频数 (expected frequency) 是

fe=na+bna+cn=(a+b)(a+c)n,f_e = n \cdot \frac{a + b}{n} \cdot \frac{a + c}{n} = \frac{(a + b)(a + c)}{n} ,

其余三格同理,一律等于所在行和乘所在列和再除以 nn。演示数据的四个期望频数依次是 45.5、54.5、45.5、54.5,观测到的 52 比它高出 6.5。

3 · 卡方统计量

Pearson's chi-squared · 四格简算式

把四格的偏离汇总成一个数,需要先给每格的偏离一个尺度。Pearson 的做法是除以该格的期望频数,使偏离按「相对于本该有多少」计量:

χ2=i=14(foifei)2fei.\chi^2 = \sum_{i=1}^{4} \frac{(f_{oi} - f_{ei})^2}{f_{ei}} .

把四个期望频数代进去整理,对 2×22 \times 2 表可得只用四格与总量表达的简算式:

χ2=n(adbc)2(a+b)(c+d)(a+c)(b+d).\chi^2 = \frac{n(ad - bc)^2}{(a + b)(c + d)(a + c)(b + d)} .

分子里的 adbcad - bc 是四格表的行列式。两个变量在样本上完全独立时它恰为零,偏离越远它的绝对值越大。演示数据代入得 χ2=3.4076\chi^2 = 3.4076

注 · 两式代数等价,浮点算术下不等。把四格各自取遍 1 到 60 的全部 12960000 张表逐张对照,两式给出不同双精度值的有 9463678 张,占 73.0%;相对偏差最大的一张是 a=53a = 53b=54b = 54c=54c = 54d=55d = 55,相对差 1.5×10121.5 \times 10^{-12},而该表的 χ2\chi^2 本身只有 1.6×1061.6 \times 10^{-6}。这点差异够不着判定:全部 12960000 张表里,没有一张会因为换用另一个式子而跨过五档临界值中的任何一条。

4 · 临界值与小概率反证

significance level · critical value

检验的逻辑是反证。先假定两个变量相互独立,此时 χ2\chi^2 理应很小;若实际算出的值大到在独立假设下几乎不可能出现,就认为假设与数据矛盾,转而承认两者有关联。「几乎不可能」的门槛由显著性水平 α\alpha 给出:自由度为 1 时,χ2\chi^2 超过下列临界值的概率恰为 α\alpha

显著性水平 α\alpha 0.1 0.05 0.01 0.005 0.001
临界值 2.706 3.841 6.635 7.879 10.828

演示数据的 χ2=3.4076\chi^2 = 3.4076 越过了 2.706 而没越过 3.841:在 α=0.1\alpha = 0.1 下可以认为两者有关联,在 α=0.05\alpha = 0.05 下则证据不足。同一批数据在不同的 α\alpha 下给出不同结论,这不是矛盾,而是「愿意承担多大的犯错风险」这一项选择在起作用。

图 4-1 · 四格表、两行优良率的对照与 χ2\chi^2 判定。可拖动四格频数、切换显著性水平,并显示独立假设下的期望频数。

5 · 结论的边界

样本量 · 期望频数下限

χ2\chi^2 与样本容量成正比:四格同乘一个正整数 kk,行比例分毫不变,统计量却变成原来的 kk 倍。四格 13、7、5、15 给出 χ2=6.4646\chi^2 = 6.4646,同比放大一倍的 26、14、10、30 给出 12.9293。这说明「有没有关联」的判定既取决于关联的强度,也取决于收集了多少数据:足够大的样本能让极微弱的关联越过临界值,而样本太小时真实的关联也可能被埋没。

另有两条常被略过的前提。其一,χ2\chi^2 的分布只是近似为自由度 1 的卡方分布,一般要求四格的期望频数都不小于 5,否则临界值不再可靠。其二,「证据不足」不等于「两者独立」,它只表示这批数据没能推翻独立假设。反证法能推翻假设,不能确立假设。

6 · 关联与因果的距离

association is not causation

警示 · 拒绝独立性假设得到的是「两个变量有关联」,不是「其中一个导致另一个」。演示数据里参加社团与体质优良的关联,同样可以由「体质本来就好的学生更愿意参加社团」解释,因果方向恰好相反;也可以由家庭条件之类同时影响两侧的变量解释。检验只读频数表,看不见时间先后,也看不见机制。

要把关联升级成因果,需要检验之外的证据:把个体随机分配到两组的对照试验、变量在时间上的先后、或者对作用机制的独立说明。这几样都不在列联表里。同一条界线在数值型数据上的表现见 成对数据的相关关系 §5。

7 · 参考文献

  1. Pearson chi-squared test. Wikipedia. 卡方统计量、自由度与期望频数下限。https://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test
  2. Contingency table. Wikipedia. 列联表、边缘和与四格表简算式。https://en.wikipedia.org/wiki/Contingency_table
  3. Statistical significance. Wikipedia. 显著性水平与临界值,以及「证据不足」的含义。https://en.wikipedia.org/wiki/Statistical_significance
  4. Statistical power. Wikipedia. 样本量如何影响检验能否发现微弱关联。https://en.wikipedia.org/wiki/Power_of_a_test