概率与统计 · 从样本空间到用样本估计总体
概率论把「某件事有多大可能发生」这句日常话,安放在一个可计数、可运算的结构上:先圈定一次试验所有可能结果构成的样本空间 Ω,把随机事件看成 Ω 的子集,概率 P 便是一个给子集赋值、满足非负与规范化的测度。有限等可能时它退化为最朴素的古典概型 P(A) = |A| / |Ω|——一切从数格子开始。
本系列沿这条主线推进:先在样本空间上做事件的关系与运算、辨明互斥与相互独立的区别,用频率的稳定性反过来估计概率;再引入条件概率、全概率与贝叶斯公式。随后把结果映射成数值,得到离散型随机变量的分布列、期望与方差,从最简单的两点分布归纳出二项分布、超几何分布与连续的正态分布;最后回到统计,先用数字特征概括样本,再用直方图去估计总体。每页都可拖动参数或点选结果,即时看到概率、分布与统计量如何随之变化。
事件与概率 · 从样本空间到条件概率
把一次试验的全部结果收进样本空间 Ω,事件是它的子集、概率是子集上的测度。古典概型给出「数格子」的算法,事件运算与独立性刻画事件之间的关系,频率从数据一侧逼近概率,条件概率则把「已知某事发生」折进样本空间。
随机事件、样本空间与古典概型
一次试验的所有可能结果构成样本空间 Ω,随机事件是它的子集。当结果有限且等可能,概率就是古典概型 P(A) = |A| / |Ω |——数出有利结果占几格。以掷两枚骰子的 6×6 格阵为例,选定事件即高亮有利结果并算出概率。
事件的关系与运算、相互独立性
事件之间有包含、互斥、对立的关系,可做并 A∪ B、交 A∩ B、差、对立运算;P(A∪ B) = P(A) + P(B) - P(A∩ B)。相互独立是另一回事——P(A∩ B) = P(A)·P(B),与「互斥」恰好相反。在格阵上圈出两个事件,逐项验证运算与两种关系。
互斥与独立是两件不同的事
A∩B = ∅,于是 P(A∪B) = P(A) + P(B)。独立(independent)说的是一个发生不改变另一个的概率:P(A∩B) = P(A)·P(B)。二者常被混淆,实则几乎相反——若 A、B 概率都非零又互斥,则一个发生时另一个必不发生,反而是强烈相关、绝不独立。这一点在事件的关系与运算页里可逐格验证。频率与概率:用数据估计可能性
概率是理论值,频率是把试验重复 n 次后「发生次数 / n」的实测值。随着 n 增大,频率围绕概率上下波动、幅度逐渐收窄并稳定下来——这就是用频率估计概率的依据。模拟成千上万次投掷,看频率曲线如何收敛到设定的概率。
条件概率、全概率与贝叶斯公式
已知事件 B 发生后再问 A,样本空间收缩到 B:P(A|B) = P(A∩ B) / P(B)。把 Ω 划分成若干互斥情形,全概率公式把 P(A) 拆成各情形的加权和;贝叶斯公式再由结果反推原因 P(Bᵢ|A)。用划分树逐支计算,并联系 base-rate 假阳性问题。
随机变量及其分布 · 分布列、数字特征与两大分布
把每个样本点映射成一个数值,随机事件的概率就整理成分布列;期望与方差是分布的数字特征。最简单的两点分布(0-1 分布)是二项分布的基本单元;放回与不放回两种取样,分别给出二项分布与超几何分布这两族最常用的离散分布。
离散型随机变量:分布列、期望与方差
随机变量 X 把每个样本点映射成一个数值,各取值的概率整理成分布列(所有概率之和为 1)。期望 E[X] = Σ xᵢ·pᵢ 是分布的重心,方差 D[X] = Σ(xᵢ - E[X])²·pᵢ 度量取值的分散程度。以掷两骰之和为例,看分布列、重心与离散度如何联动。
两点分布与 n 重伯努利试验
只取 0 与 1 的两点分布(0-1 分布)是二项分布的基本单元,期望 p、方差 p(1-p)。把一次成功概率为 p 的试验独立重复 n 次,成功总次数 X = X₁ + ⋯ + Xₙ 即二项分布 B(n, p),其期望 n·p、方差 n·p(1-p) 由 n 份两点分布累加直接得到。
二项分布与超几何分布
同一个取球模型,放回取 n 次、每次成功率恒为 p,成功次数服从二项分布 B(n, p),P(X=k) = C(n,k)·pᵏ·(1-p)ⁿ⁻ᵏ;不放回取,成功次数服从超几何分布,概率由组合数之比给出。并排对比两族分布的形状、期望与方差,看放回与否如何拉开差距。
连续分布与统计推断 · 正态分布与用样本估计总体
当取值连续、且是大量微小因素叠加的结果,分布趋于钟形的正态分布。反过来,面对未知的总体,先用数字特征(集中趋势、离散程度、百分位数)概括样本,再用频率分布直方图与样本均值 / 方差去估计总体的分布与参数,是统计推断的起点。
正态分布:钟形曲线与 3σ 法则
大量相互独立的微小因素叠加,结果趋于连续的正态分布 N(μ , σ ²):关于 μ 对称的钟形密度曲线,σ 决定胖瘦。落在 μ ± σ / μ ± 2σ / μ ± 3σ 内的概率约为 68% / 95% / 99.7%(3σ 法则)。拖动 μ、σ,看曲线平移伸缩、阴影面积即概率如何变化。
样本的数字特征:集中趋势、离散程度与百分位数
集中趋势(平均数 / 中位数 / 众数)、离散程度(极差 / 方差 / 标准差)与百分位数(Q1 / Q2 / Q3、IQR)三组数字特征概括一组数据。数轴点图叠出均值与中位数,箱线图以五数概括呈现整体形状,并演示离群值如何拉动平均数、却几乎不改变中位数与 IQR。
用样本估计总体:直方图与样本数字特征
总体的分布往往未知,只能抽取一个样本去估计。把样本数据分组画成频率分布直方图,其形状逼近总体的密度曲线;样本均值与样本方差,则是总体期望与方差的估计。增大样本量、调整组距,看估计如何越来越贴近真实总体。
它和其他系列的接续
(p+q)ⁿ 的展开系数 C(n, k) 直接给出;条件概率与贝叶斯的假阳性悖论,在 条件概率 / 贝叶斯 系列里用方阵进一步展开;而用样本估计总体里由散点拟合直线的做法,属于 最小二乘 系列的一元线性回归。三者可对照阅读。相关链接
本站相关系列
-
排列组合 · 计数、P(n,k) 与 C(n,k)
playground
二项分布的系数
C(n, k)与二项式定理的来源。 -
条件概率 / 贝叶斯 · 方阵与 base-rate
playground
用方阵把
P(A|B)展开、复现假阳性悖论。 - 最小二乘 · 一元线性回归 playground 由成对数据拟合直线,与用样本估计总体相接。
外部参考
- Probability space — Wikipedia en.wikipedia.org 样本空间、事件与概率测度的公理化定义。
- Conditional probability — Wikipedia en.wikipedia.org 条件概率、全概率与贝叶斯公式。
- Random variable — Wikipedia en.wikipedia.org 随机变量、分布列与数字特征。
- Normal distribution — Wikipedia en.wikipedia.org 正态分布的密度、参数与 3σ 法则。