混合策略:无鞍点时,把出招交给骰子
无鞍点的对局里,死守任一纯策略都会被对手摸透。出路是随机化:Blue 不再固定出某行,而是以概率 p 出第一行、
出第二行——一个混合策略 (mixed strategy)。神奇之处:存在一个最优 p*,无论 Red 怎么应对,Blue 都能锁定同一个保底收益 博弈值 V。这就是 von Neumann 的 minimax 定理。
1 · 把期望收益画成两条线,取下包络的最高点
固定一个混合比例 p,Blue 的期望收益取决于 Red 出哪列:Red 出左得到一条直线 E左(p),出右得到另一条 E右(p)。Red 会挑对 Blue 更差的那条,所以 Blue 实际能拿到的是两线的下包络 min(E左,E右)。Blue 调
p 把这条下包络顶到最高点——那个 p* 处两线相交,交点高度就是博弈值 V。
拖 p 滑块看灰色游标在下包络上滑动:在 p* 之外,Red 总能把你压到某条线的低处;只有在交点 p*,两条线一样高——Red 怎么应都一样,Blue 的保底被顶到最高。可直接编辑四个收益再观察。
1.1 · 为什么交点处「Red 怎么应都一样」
最优混合 p* 让 E左(p*) = E右(p*)——Blue 故意调到「让 Red 的两个纯应对收益相等」的比例。这叫无差异原则 (indifference):你把对手调到「怎么选都一样」,他就无法利用你的偏向。同理 Red 也有一个最优混合 q* 让 Blue 的两行收益相等。两人各自的保底在同一个数
V 上对齐——这正是混合策略 Nash 均衡,minimax 定理保证它在零和博弈里总存在。
1.2 · 有鞍点时,混合自动退化为纯策略
点第三个预设(有鞍点):两条线在 [0,1] 内不相交,下包络的最高点落在 p=0 或 p=1 的端点——也就是「纯出某一行」。这与鞍点一节完全一致:纯策略只是混合策略的特例(概率
0/1)。所以混合策略是更一般的解,minimax 定理把「总有解」从有鞍点的特例,推广到了所有零和博弈。
1.3 · 它真实跑在哪里
扑克与竞技对抗里的诈唬频率、安全博弈(随机巡逻 / 抽检让对手无法预测)、体育(发球方向、点球左右)的最优随机化、以及生成对抗网络 (GAN) 等 minimax 优化的理论原型——凡是「一旦被对手看穿规律就会被针对」的场合,最优解几乎都是一个精心校准的混合策略。