数学 / 概率与统计 · 从样本空间到成对数据 / 抽样:简单随机抽样与分层随机抽样 待审核 10 / 16
census vs sample · SRS · stratified

抽样:简单随机抽样与分层随机抽样

统计推断的对象是总体,能拿到手的通常只是其中一部分个体构成的样本。逐个考察全部个体的普查 (census) 在理论上最可靠,实践中却常常行不通。抽样调查用有限的观测换取对总体的估计,估计的质量取决于样本是怎么取出来的:取法一旦带有系统性倾向,样本量再大也纠正不了偏差。

1 · 普查的代价与破坏性检验

census · destructive testing

普查的成本随总体容量线性增长。一次全国规模的人口普查动员的人力与时间以年计,中途任何一次口径调整都要从头再来。更硬的障碍来自破坏性检验:测定一批灯泡的平均寿命必须让灯泡一直亮到熄灭,检验罐头是否合格必须开罐,普查做完,这批产品也就不存在了。时效性是第三重限制——总体本身在变,等普查结束,结论描述的已是过去的那个总体。

2 · 简单随机抽样

simple random sampling · 抽签法 · 随机数法

简单随机抽样 (simple random sampling) 指从容量为 NN 的总体中不放回地抽取 nn 个个体,使得每一个容量为 nn 的样本被抽到的机会都相同。由此可推出每个个体入样的概率都是 n/Nn / N,这是「等可能」落在抽样上的形态。

抽签法把 NN 个号码写在质地与大小相同的签上,充分搅匀后逐个抽出。它最直观,但 NN 大到几百以上就难以保证「搅匀」,签的差异会悄悄破坏等可能。随机数法先给个体统一编号,再由随机数表或伪随机数发生器产生号码,重复的号码作废重取。本页的实现走后一条路:sampleIndices 对下标做部分 Fisher–Yates 洗牌,取前 nn 个,与不放回抽取等价而无须处理重号。

3 · 分层随机抽样与按比例分配

stratified sampling · 层容量 · 抽样比

若总体中的个体能按某个与考察指标相关的属性划成互不重叠的几层,分层随机抽样 (stratified sampling) 就先在每层内部独立地做简单随机抽样,再把各层结果合起来。按比例分配指第 hh 层分得 nh=nNh/Nn_h = n \cdot N_h / N 个名额,各层的抽样比 nh/Nhn_h / N_h 一律等于 n/Nn / N。精确值一般不是整数,实现里先取下整,再按小数余数从大到小把剩余名额补出去,保证 hnh=n\sum_h n_h = n 恒成立。

演示用的总体是一所学校 1000 名学生的每周锻炼时长:高一 400 人、高二 360 人、高三 240 人,三层的层均值依次为 6.4515、4.8350、3.0611 小时,总体均值 μ=5.0558\mu = 5.0558 小时。按比例分配在 n=60n = 60 时给出 24、22、14 三个名额。

4 · 层均值的加权还原

加权还原 · 层内齐性 · 估计精度

总体均值的估计不是把各层样本直接合并求平均,而是按层容量加权:μ^=hNhNxˉh\hat{\mu} = \sum_h \frac{N_h}{N} \bar{x}_h。按比例分配下两种算法恰好一致,因为每层在合并样本里所占的份额本就等于 Nh/NN_h / N;分配方式一改,直接合并就会把抽样比高的层算得过重。

图 4-1 · 三层的容量、各层分得的人数与总体均值的估计。可切换抽样方法、拖动样本量与随机种子,并开关按层容量加权还原。

注 · 分层能减小估计的波动,前提是层内比层间更整齐。取 n=60n = 60、遍历图 4-1 的 40 个随机种子实测:简单随机抽样的估计对 μ\mu 的均方根误差是 0.2298,按比例分层后降到 0.1049,n=30n = 30n=120n = 120 两处的比值同样落在 2.2 附近。分层消掉的正是「三个年级各抽到多少人」这一项波动:种子 #1 的简单随机抽样在三层落下 23、20、17 人,与按比例的 24、22、14 相去不小。

警示 ·「分了层」不等于「估计更准」。等额分配(三层各 20 人)下若把 60 个数据直接合并求平均,图 4-1 的 40 个种子给出的估计均值是 4.7739,比 μ=5.0558\mu = 5.0558 系统性地低了 0.28——小层高三的抽样比被抬高,权重也跟着虚高。同一批样本改用加权还原,40 个种子的均值回到 5.0417。这一项偏差来自算法而非样本量,把 nn 调到 240 也不会消失。

5 · 抽样偏差的来源

selection bias · nonresponse · survivorship

抽样偏差 (sampling bias) 指抽样方式本身让样本系统性地偏离总体。它与随机波动是两回事:波动随样本量增大而收缩,偏差不会。抽样框缺漏使一部分个体根本没有机会入样,用固定电话名单调查上网习惯即属此类。自选择让愿意应答的人过度代表自己所属的群体,网络投票与商品评价都受它支配。无应答把「拒绝回答」的那部分个体悄悄剔出样本,而拒答与被问的内容常常相关。幸存者偏差只统计留下来的个体,二战期间对返航飞机弹孔分布的分析是它的经典例子。

样本取定之后,由样本推断总体的具体做法见 用样本估计总体,样本自身的概括量见 样本的数字特征

6 · 参考文献

  1. Simple random sample. Wikipedia. 简单随机抽样的定义与实现方法。https://en.wikipedia.org/wiki/Simple_random_sample
  2. Stratified sampling. Wikipedia. 分层抽样、按比例分配与加权还原。https://en.wikipedia.org/wiki/Stratified_sampling
  3. Sampling bias. Wikipedia. 抽样偏差的几类来源及其与随机波动的区别。https://en.wikipedia.org/wiki/Sampling_bias
  4. Fisher–Yates shuffle. Wikipedia. 部分洗牌与不放回抽取的等价性。https://en.wikipedia.org/wiki/Fisher%E2%80%93Yates_shuffle