鞍点:保底线与压顶线相遇之处
收益矩阵记录了每种对法的结局,但没说该选哪行。零和博弈里两方各有一条思路:Blue(最大化方) 想「无论 Red 怎么应,我至少保住多少」;Red(最小化方) 想「无论 Blue 怎么出,我最多被赢走多少」。前者叫 maximin、后者叫 minimax。当这两个值相等,就出现一个 鞍点 (saddle point)——这局有了确定的解,双方都该咬定各自的纯策略 (pure strategy)。
1 · 行 min 与列 max:两条保底线
看每一行:Blue 选了它,Red 当然挑对 Blue 最差的那格应对,所以这行的价值下限 = 行内最小值。Blue 会挑下限最高的行 → maximin,这是 Blue 能锁定的保底收益。看每一列:Red 选了它,Blue 会挑对自己最好的那格,所以这列对 Red 的风险上限 = 列内最大值。Red 会挑上限最低的列 → minimax,这是 Red 能把损失压住的天花板。
改格子里的数(直接编辑),右侧 行 min 与底部 列 max 会实时更新;maximin 行与 minimax 列被标紫。两线交于同一格 (★) 时即鞍点。下面两个预设分别对应「有鞍点 / 无鞍点」。
1.1 · 有鞍点 ⇒ 纯策略解,而且「亮牌也不怕」
鞍点处 。这一格既是它所在行的最小、又是所在列的最大,于是谁都不愿单方面改:Blue 换行不会更高,Red 换列不会更低(并列时可以持平)。这种稳态叫纯策略 Nash 均衡。奇妙之处在于:即便 Blue 公开宣布「我就走这一行」,Red 的最优应对仍给出同一收益——亮牌也无损保底(若有并列鞍点,落点未必唯一,但收益相同)。这份稳定性来自「行最小与列最大在同一格相遇」,与支配关系是否能消去行列无关。
1.2 · 无鞍点 ⇒ 纯策略会被对手摸透
当 ,没有任何一格同时满足「行最小且列最大」。此时若 Blue 死守一行,Red 总能找到一列把它压到行内最差;Blue 想反制就得换行,如此互相试探、没有稳态。出路是不再固定出某一行,而是按一定概率随机混用各行——这就是混合策略,它把保底线抬到博弈值 ,其中 ——不等号可以取等,例如 的 就等于 maximin 1。
1.3 · 它真实跑在哪里
maximin 是稳健决策的通用准则:在最坏情况下争取最好结果——用于对抗性规划(安全防护按最坏威胁布防)、鲁棒优化(参数最坏取值下的最优设计)、以及 AI 对弈里 minimax 搜索(配 α-β 剪枝)的理论根基。鞍点就是这套搜索在零和博弈里追求的均衡点。
2 · 参考文献
- von Neumann, J. (1928). Zur Theorie der Gesellschaftsspiele. Mathematische Annalen, 100(1), 295–320. https://doi.org/10.1007/BF01448847