← 博弈论 · 我的最优选择,取决于你怎么选 / 鞍点:当「我能保底」对上「你能压顶」 待审核 2 / 5
core · maximin / minimax

鞍点:当「我能保底」对上「你能压顶」

收益矩阵记录了每种对法的结局,但没说该选哪行。零和博弈里两方各有一条思路:Blue(最大化方) 想「无论 Red 怎么应,我至少保住多少」;Red(最小化方) 想「无论 Blue 怎么出,我最多被赢走多少」。前者叫 maximin、后者叫 minimax。当这两个值相等,就出现一个 鞍点 (saddle point)——这局有了确定的解,双方都该咬定各自的纯策略 (pure strategy)

1 · 行 min 与列 max:两条保底线

看每一:Blue 选了它,Red 当然挑对 Blue 最差的那格应对,所以这行的价值下限 = 行内最小值。Blue 会挑下限最高的行 → maximin,这是 Blue 能锁定的保底收益。看每一:Red 选了它,Blue 会挑对自己最好的那格,所以这列对 Red 的风险上限 = 列内最大值。Red 会挑上限最低的列 → minimax,这是 Red 能把损失压住的天花板

改格子里的数(直接编辑),右侧 行 min 与底部 列 max 会实时更新;maximin 行minimax 列被标紫。两线交于同一格 (★) 时即鞍点。下面两个预设分别对应「有鞍点 / 无鞍点」。

1.1 · 有鞍点 ⇒ 纯策略解,而且「亮牌也不怕」

鞍点处 maximin = minimax = 博弈值 (game value)。这一格既是它所在行的最小、又是所在列的最大,于是谁都不愿单方面改:Blue 换行只会更低,Red 换列只会更高。这种稳态叫纯策略 Nash 均衡。奇妙之处在于:即便 Blue 公开宣布「我就走这一行」,Red 的最优应对仍落在同一格——亮牌也无损保底,这正是支配关系与最优反应在零和下收敛的结果。

1.2 · 无鞍点 ⇒ 纯策略会被对手摸透

maximin < minimax,没有任何一格同时满足「行最小且列最大」。此时若 Blue 死守一行,Red 总能找到一列把它压到行内最差;Blue 想反制就得换行,如此互相试探、没有稳态。出路是不再固定出某一行,而是按一定概率随机混用各行——这就是混合策略,它能把保底线从 maximin 抬高到两线之间的博弈值

1.3 · 它真实跑在哪里

maximin 是稳健决策的通用准则:在最坏情况下争取最好结果——用于对抗性规划(安全防护按最坏威胁布防)、鲁棒优化(参数最坏取值下的最优设计)、以及 AI 对弈里 minimax 搜索(配 α-β 剪枝)的理论根基。鞍点就是这套搜索在零和博弈里追求的均衡点。