← 概率与统计 · 从样本空间到用样本估计总体 / 样本的数字特征:集中趋势、离散程度与百分位数 待审核 9 / 10
mean / median / mode · IQR · box plot

样本的数字特征:集中趋势、离散程度与百分位数

面对一组数据,通常先问三件事:中心在哪里、分散有多大、不同位置的取值如何分布。集中趋势平均数(mean)、中位数(median)、众数(mode)刻画数据的中心;离散程度极差(range)、方差(variance)、标准差(standard deviation)刻画取值的波动;百分位数(percentile)按位置把数据切分,定位任意比例处的取值。这些由样本算出、用来概括数据的量统称数字特征,也是 用样本估计总体 的基础。本页用可切换的数据集观察它们如何度量同一组数据,以及它们对离群值(outlier)的不同敏感程度。

1 · 集中趋势与离散程度:中心与波动

mean · median · mode · range · variance · std

平均数 xˉ=(1/n)Σxi\bar{x} = (1/n)Σx_i 是所有数据的算术平均,几何上是分布的重心;中位数是升序后居中的数(偶数个取中间两数的平均),把数据按个数对半分;众数是出现最频繁的取值。离散程度里,极差 =maxmin= \max - \min 只看两端;方差 s2=(1/n)Σ(xixˉ)2s^2 = (1/n)Σ(x_i - \bar{x})^2 是各数据到重心距离平方的平均,标准差 s=s2s = \sqrt s^2 与数据同量纲。切换数据集、开关离群值,观察数轴上的标记与右侧数字如何联动。

平均数与中位数在对称数据里几乎重合,但数据偏斜或含离群值时分道扬镳:平均数被极端值拉动,中位数只认位置、几乎不动。上例开启离群值后,平均数明显偏移而中位数稳定——因此描述收入、房价这类右偏数据时,中位数往往比平均数更有代表性;众数则适合刻画「最常见」的取值。

2 · 百分位数与四分位数:按位置切分

p-th percentile · Q1 / Q2 / Q3 · IQR · box plot

p 百分位数是这样一个值:至少有 p% 的数据不超过它、且至少有 (100p)(100 - p)% 不小于它。计算时先升序排列,令 i=npi = n \cdot p%:若 i 不是整数,向上取整,第 i\lceil i\rceil 个数据即为所求;若 i 恰是整数,取第 i 与第 i + 1 个的平均。四分位数是最常用的三个百分位数——Q1(25%)、中位数 Q2(50%)、Q3(75%),把数据四等分。拖动滑块查看任意 p 对应的分位值,下方箱线图(box plot) 以五数概括画出数据的整体形状。

箱线图由五数概括(min、Q1、中位数、Q3、max)构成:箱体两端是 Q1Q3,箱内竖线是中位数,箱长即四分位距 IQR=Q3Q1IQR = Q3 - Q1,覆盖中间 50% 的数据。须线延伸到 Q11.5IQRQ1 - 1.5\cdot IQRQ3+1.5IQRQ3 + 1.5\cdot IQR 范围内最远的数据,越出者按离群值单独描点。IQR 只依赖中间半数数据,与极差不同,它不受离群值影响,因此箱线图能同时呈现中心、分散与异常。

本页方差按 s2=(1/n)Σ(xixˉ)2s^2 = (1/n)Σ(x_i - \bar{x})^2 描述这组数据本身的分散程度。若把样本方差当作对总体方差 σ2\sigma ^2 的估计,则改除以 n1n - 1 以消除偏差(无偏估计),两种口径的区别见 用样本估计总体;连续总体的钟形密度见 正态分布