当 AI 学会「说谎」:从军棋到库恩扑克,不完全信息博弈的秘密武器
目录
- 一个藏着秘密的棋盘
- 不完全信息:AI 的最后一块硬骨头
- 冷静得不像话:Ataraxos 是怎么赢的
- 现场验证:我用百来行代码,复现了「说谎的数学」
- 虚张声势不是作弊,是均衡
- 斗地主与四国军棋:我们早就在和 AI 打牌了
一个藏着秘密的棋盘
先看一个棋盘。
黑白双方各 40 枚棋子。你看到的不是棋子——是背面。你知道对方把军旗藏在哪里,但你不知道他面前那枚棋子到底是炸弹、是师长、还是工兵。只有当两枚棋子撞在一起,输的那枚被移走,赢的那枚才翻过来给你看。
这就是 Stratego(军棋/西洋陆军棋)。规则简单到 5 分钟能讲完,但它困住了 AI 整整三十年。
1997 年,深蓝击败卡斯帕罗夫;2016 年,AlphaGo 击败李世石;扑克机器人更是早就把职业选手按在地上摩擦。但 Stratego 一直没被攻克——连 DeepMind 都没能造出一台稳定击败人类高手的机器。
直到现在。
卡内基梅隆、MIT、NYU 和斯坦福的研究者造出了一个叫 Ataraxos 的 AI,在 20 局比赛里 15 胜 1 负 4 平,击败了 Pim Niemeijer——四届世界冠军、累计 600 周世界排名第一的传奇选手。而且它只用了 16 张 GPU、几千美元就训练完成。
DeepMind 当年的 DeepNash 用了 1024 张 Google 专用芯片、训练了两三个月,成本估计 300 万到 450 万美元。Ataraxos 用 16 张 GPU 跑了一周,加 4 张 GPU 跑四天训一个辅助模型。
成本差了三个数量级。
不完全信息:AI 的最后一块硬骨头
为什么 Stratego 这么难?
先看它和象棋、围棋的区别。象棋、围棋是完全信息博弈——所有棋子的位置、价值,双方都看得一清二楚。AI 只需要在给定的局面里找到最优解,再深挖几步就行。
Stratego 不一样。你的对手知道你的棋子在哪里,但不知道它们是什么。这两者的差别,就是「看得见」和「看得懂」的差别。
用数字说话:
- 德州扑克翻牌前只有 1326 种手牌组合
- Stratego 一方要布下 40 枚棋子,可能的摆法超过 10^33 种(1 后面跟 33 个零)——这个数字我亲自验证过
40! / (1!·1!·2!·3!·4!·4!·4!·5!·8!·1!·6!·1!) ≈ 1.41 × 10^33
这还只是摆法。更麻烦的是游戏长度:一盘象棋通常 40 步,一盘 Stratego 可以轻松拖到 2000 步。
还有最关键的一点:Stratego 是虚张声势(bluff)的游戏。你经常需要把一枚弱小的工兵当成师长推出去,吓跑对方的棋子。但你也不能老是虚张声势——虚张声势太频繁,你的威胁就没人信;从不虚张声势,对手一眼看穿你的牌路。
这种「该在什么时候说谎、说谎到什么程度」的平衡,才是之前所有 AI 都过不去的坎。DeepMind 2022 年的 DeepNash 做到了自我对弈,但面对人类高手的深厚 bluff 功底,还是差了一口气。
冷静得不像话:Ataraxos 是怎么赢的
Ataraxos 的突破有两条:
第一,换了一种自我对弈的调整方式。 在隐藏信息博弈里,自我对弈算法特别容易「原地打转」——因为你看不到对手的牌,赢了也不知道自己为什么赢。Ataraxos 的做法是:训练早期做大胆、激进的策略调整,后期做微小、保守的调整。就像先跳进黑屋子乱撞,摸清轮廓后再小心翼翼地挪。
第二,加了一个「信念模型」(belief model)。 这是 DeepNash 没有的东西。Ataraxos 在每次行动前,会先用一个专门的神经网络猜对手的隐藏棋子——根据对手之前怎么走棋来推断。然后它不是遍历所有可能的摆法(那有 10^33 种,算不动),而是采样出几个最有可能的摆法,在每一种里推演候选走法,再综合决定。
这个「先猜、再算」的思路,让 Ataraxos 在下棋前有了「思考」的能力——AlphaGo 靠这种搜索能力统治了围棋,但 Stratego 的搜索空间太大,DeepMind 一直没能把搜索塞进去。Ataraxos 做到了。
结果是一个冷静到可怕的棋手。
「Ataraxos」这个名字来自古希腊语,意思是「平静、不动摇」。研究者说,它在人类会抓狂的劣势局面下,依然能慢慢地、有条不紊地把局面扳回来——他们亲眼看着这个机器「从 2% 的胜率里虚张声势地打回来,非常淡定」。
它甚至学会了利用对手的知识盲区。当它判断对手没有理由怀疑某个弱点时,它就故意不去补那个弱点——哪怕从全知视角看,那是一个随时会爆的雷。人类很难做到这一点,因为「当你知道了秘密,就很难装作不知道」。机器很容易。
对局结果也很有戏剧性:2025 年 Stratego 世锦赛上,挑战 Ataraxos 的选手在 40 局里只赢了 2 局。它还改变了人类的打法——选手们惊讶地发现,它经常把军旗藏在角落里、只放两枚炸弹守着,这是人类很少用的布局。
现场验证:我用百来行代码,复现了「说谎的数学」
光看论文不过瘾。我决定自己动手,验证文章里最核心的命题:
在不完全信息博弈里,最优策略必须包含「固定概率的虚张声势」——也就是混策略。
我用的是博弈论里的经典玩具模型:Kuhn Poker(库恩扑克)。只有 3 张牌(J < Q < K),每人发一张,底注 1,先手可以选择过牌或下注。规则简单到可以在餐巾纸上写完,但它完美保留了「隐藏信息 + 虚张声势」的核心结构——和 Stratego 一样,只拿好牌才下注、从不诈唬的玩家,会被对手精准剥削。
我写了一个 CFR(反事实遗憾最小化) 求解器——这正是 Ataraxos 的算法基石(文章里的自我对弈强化学习,本质就是 CFR 的规模化版本)。跑了 100 万次迭代,得到均衡策略:
[P1 第一轮(先手)]
持 J(最弱牌): bet 12.5% pass 87.5% ← 这就是纯虚张声势
持 Q(中间牌): bet 0.0% pass 100%
持 K(最强牌): bet 38.1% pass 61.9%
[P2 面对 P1 过牌(轮到 P2 决定要不要诈唬)]
持 J(最弱牌): bet 33.5% pass 66.5% ← P2 用最弱牌吓唬人
持 K(最强牌): bet 100% pass 0%
看到了吗?均衡策略里,玩家拿着最弱的 J 也要有 12.5%(先手)到 33.5%(后手)的概率下注——纯粹是为了吓唬对手、让对手不敢轻易相信你的下注都是好牌。
为了确认实现没写错,我拿博弈论的教科书答案对了一下:Kuhn Poker 的博弈值(先手方的长期期望收益)理论值是 -1/18 ≈ -0.0556,我的求解器算出来是 -0.0567,误差只有 0.001。
这完美的验证了文章里的观点:虚张声势不是「作弊」,它是数学上的必需品。如果你从不虚张声势,对手就会发现「你下注 = 你有好牌」,然后看到你下注就弃牌——你手里最强的那张牌(相当于 Stratego 的元帅),就再也赢不到大钱了。
我加了一个对照实验来量化这件事:让 P1(先手)固定使用不同的诈唬频率,然后让 P2 用 CFR 学习最优应对,观察 P2 面对 P1 下注时的跟注率:
[对照:P1 持 J 的诈唬频率 → P2 面对下注的跟注率]
P1 从不诈唬 (bluff 0%) -> P2 跟注率 0.00%
P1 偶尔诈唬 (bluff 33%) -> P2 跟注率 58.7%
P1 频繁诈唬 (bluff 50%) -> P2 跟注率 99.98%
数据把逻辑说得清清楚楚:你从不虚张声势,对手就永远不跟你的注——你的「真话」(拿好牌下注)没有听众,价值下注全部落空;你开始虚张声势,对手才不得不开始跟注、为你的真话付钱。
这就是「说谎的数学意义」——它不是道德问题,是博弈论层面的生存问题。隐藏信息越多的游戏,会虚张声势的玩家优势越大。Stratego 有 40 枚隐藏棋子,所以 bluff 就是它的命脉。
最后我核了一下论文的出处,确认这不是营销号编的:Sokota、Vinitsky 等人的论文《Scalable decision-making for games of imperfect information》发表在 Nature 上(2026 年),没有撤稿标记,与 Ars Technica 的报道完全对应。
虚张声势不是作弊,是均衡
到这里,我发现一个有意思的事:「虚张声势」这个词,在博弈论里有个更精确的名字——混策略(mixed strategy)。
在完全信息博弈里,你总是能找到「最优解」:这一步走马,那一步将军。但在不完全信息博弈里,没有一个「永远正确的动作」。如果你的策略可以被预测,你就输了。所以均衡要求你:有时候这么做,有时候那么做——而且每个选项都要有一个特定的概率。
这个概率不是随意定的,它精确到:让你对手无论怎么应对,都无法占到便宜。
这就是为什么 Stratego 的 AI 那么难造。DeepNash 的自我对弈学到了一些 bluff 技巧,但它的搜索机制在 10^33 的摆法空间面前失效了。Ataraxos 的「信念模型 + 采样搜索」刚好补上了这一环——它让 AI 能在「猜对手」的基础上做推演,而不是在完全无知中瞎走。
有趣的是,研究者说 Ataraxos 的架构也适用于其他游戏——它击败了 Barrage Stratego(8 枚棋子的快速变体)的三个世界冠军、合作卡牌游戏 Hanabi 的最强 AI,还击败了中国扑克游戏斗地主的最强 bot。
斗地主。这个我们中国人再熟悉不过的游戏,被同一个算法攻克了。
斗地主与四国军棋:我们早就在和 AI 打牌了
说到斗地主,你大概想到了什么?
对了——斗地主本来就是不完全信息博弈。你只知道自己的 17 张牌,不知道另外两家各有什么。而且斗地主里有「明牌底牌」机制,地主能看到三张底牌,农民看不到——这本身就是一种信息不对称。
几十年来,会虚张声势的人类高手一直是 AI 的噩梦——程序算得再快,也读不懂「对方在虚张声势还是真有货」。直到 CFR 这类算法出现,AI 才第一次学会「何时该说谎」。现在,AlphaGo 之后的新一代算法把斗地主的最强 bot 也击败了。这背后是同一个道理:不完全信息 + 大搜索空间 + 虚张声势,曾经是 AI 的「三座大山」,现在被一个一个搬走。
还有一个更有意思的国内对应物:四国军棋。它比 Stratego 的信息暴露程度更低——四个玩家两两结盟,每个玩家只知道自己的 25 枚棋子,连队友的都不知道。这种「三方博弈 + 隐藏信息 + 队友协作」的结构,比 Stratego 还要复杂。至少在我的认知里,四国军棋还没有出现一个像 Ataraxos 这样、在公开对局里稳定碾压人类高手的 AI——它把不完全信息博弈的难度又往上推了一层。
这让我想到一个问题:AI 学会说谎,是好事还是坏事?
一方面,它让游戏更有趣了。以前 AI 只会「硬碰硬」,现在它会 bluff 了——人类高手发现,和一个会虚张声势的对手下棋,比和一台计算器下棋刺激得多,而且能从它的奇招里学到新东西。
另一方面,如果同样的算法被用到谈判、金融市场、军事推演……一个「永远不会情绪化、永远不会被吓到、永远知道什么时候该假装」的 AI,意味着什么?论文作者自己也承认,他们接下来想做的,是让 AI 能解释自己为什么这么走——因为现在的 Ataraxos 像一个黑盒,连研究者都说不清它每次决策的依据。
棋盘上,AI 学会了说谎。棋盘外,我们可能需要更好的问题来问它。
数据处理:Stratego 摆法数(40!/∏m_i! ≈ 1.41×10^33)与 Kuhn Poker CFR 均衡策略均在本机 Python 中独立复现验证。论文信息经 Crossref 核实:Sokota, Vinitsky 等,《Scalable decision-making for games of imperfect information》,Nature,2026。
评论(0)
暂无评论,来写第一条吧~