← 博弈论 · 我的最优选择,取决于你怎么选 / 纳什均衡:谁也不想单方面反悔的那一格 待审核 5 / 5
core · 纳什均衡 / 囚徒困境

纳什均衡:谁也不想单方面反悔的那一格

前面四页都在零和博弈里:一方所得即另一方所失。但现实多是非零和——可以共赢,也可以共输。这时不再有「博弈值」,取而代之的核心概念是 纳什均衡 (Nash equilibrium):一组策略,在对手不变的前提下,任何一方单独改变都不会让自己更好。每格写一对收益 Blue , Red,两人都各自最大化自己

1 · 最优反应:站在对方的选择上,我该怎么回

求纳什均衡靠最优反应 (best response) 两步走。给定 Red 选某列,Blue 看这一列里自己收益最大的那格(标蓝点);给定 Blue 选某行,Red 看这一行里自己收益最大的那格(标红点)。同时带蓝点和红点的格子,就是纳什均衡 (NE)——双方互为最优反应,谁都没有反悔的动机。

点预设切换四类经典对局,或直接编辑收益。蓝点 = Blue 的最优反应,红点 = Red 的最优反应,两点重合处高亮为 NE。注意:纳什均衡可能不止一个,也可能纯策略下一个都没有

1.1 · 囚徒困境:理性的双方,一起走向更差的结局

囚徒困境里,「坦白」对每个人都是占优策略——不管对方怎么做,坦白都让自己更好。于是双方都坦白,落在唯一的纳什均衡 (坦白,坦白)。可是双方沉默明明对两人都更好!纳什均衡稳定,却不一定 Pareto 最优:个体理性导致集体次优。这就是合作为何困难的数学内核——军备竞赛、价格战、公地悲剧都是它的变体。

1.2 · 均衡可能有多个,也可能纯策略下没有

协调博弈 / 性别战两个纯策略纳什均衡——难点从「要不要合作」变成「协调到哪一个」。配对硬币一个纯策略 NE 都没有:蓝点和红点总在错开追逐(你想配对、我想错开),和无鞍点的零和局面同构。但 Nash 的著名定理保证:只要允许混合策略,任何有限博弈都至少有一个纳什均衡——在配对硬币里就是双方各 50% 的随机。

1.3 · 它真实跑在哪里

纳什均衡是现代经济学 / 博弈论的基石(Nash 因此获诺贝尔奖):寡头定价拍卖与机制设计网络拥塞(自私路由的代价)、多智能体强化学习的收敛目标。凡是「多方各自逐利、相互影响」的系统,其稳定状态几乎都用纳什均衡来刻画与预测。