← 博弈论 · 我的最优选择,取决于你怎么选 / 混合策略:无鞍点时,把出招交给骰子 待审核 4 / 5
core · 混合策略 / minimax 定理

混合策略:无鞍点时,把出招交给骰子

无鞍点的对局里,死守任一纯策略都会被对手摸透。出路是随机化:Blue 不再固定出某行,而是以概率 p 出第一行、1p{1-p} 出第二行——一个混合策略 (mixed strategy)。神奇之处:存在一个最优 p*,无论 Red 怎么应对,Blue 都能锁定同一个保底收益 博弈值 V。这就是 von Neumann 的 minimax 定理

1 · 把期望收益画成两条线,取下包络的最高点

固定一个混合比例 p,Blue 的期望收益取决于 Red 出哪列:Red 出得到一条直线 E左(p),出得到另一条 E右(p)。Red 会挑对 Blue 更差的那条,所以 Blue 实际能拿到的是两线的下包络 min(E左,E右)。Blue 调 p 把这条下包络顶到最高点——那个 p* 处两线相交,交点高度就是博弈值 V。

p 滑块看灰色游标在下包络上滑动:在 p* 之外,Red 总能把你压到某条线的低处;只有在交点 p*,两条线一样高——Red 怎么应都一样,Blue 的保底被顶到最高。可直接编辑四个收益再观察。

1.1 · 为什么交点处「Red 怎么应都一样」

最优混合 p* 让 E左(p*) = E右(p*)——Blue 故意调到「让 Red 的两个纯应对收益相等」的比例。这叫无差异原则 (indifference):你把对手调到「怎么选都一样」,他就无法利用你的偏向。同理 Red 也有一个最优混合 q* 让 Blue 的两行收益相等。两人各自的保底在同一个数 V 上对齐——这正是混合策略 Nash 均衡,minimax 定理保证它在零和博弈里总存在。

1.2 · 有鞍点时,混合自动退化为纯策略

点第三个预设(有鞍点):两条线在 [0,1]不相交,下包络的最高点落在 p=0p=1端点——也就是「纯出某一行」。这与鞍点一节完全一致:纯策略只是混合策略的特例(概率 0/1)。所以混合策略是更一般的解,minimax 定理把「总有解」从有鞍点的特例,推广到了所有零和博弈。

1.3 · 它真实跑在哪里

扑克与竞技对抗里的诈唬频率、安全博弈(随机巡逻 / 抽检让对手无法预测)、体育(发球方向、点球左右)的最优随机化、以及生成对抗网络 (GAN) 等 minimax 优化的理论原型——凡是「一旦被对手看穿规律就会被针对」的场合,最优解几乎都是一个精心校准的混合策略。