← 返回列表
Lex Fridman Podcast播客6 Dec 2022来源: lexfridman.com主持: Lex Fridman

#344 – Noam Brown: AI vs Humans in Poker and Games of Strategic Negotiation

一句话导读

这篇播客聊的是AI如何从玩扑克进化到玩需要合作和谈判的桌游。Meta的AI研究员Noam Brown认为,在需要合作的游戏里,AI光靠和自己对练(自我对弈)是不够的,它必须学会理解人类的不理性行为,否则会被人类玩家联手排挤。他重点提了三个AI:Libratus(扑克AI,靠实时搜索碾压人类,还发明了“超池下注”这种新战术)、Pluribus(六人扑克AI,训练成本极低)、Cicero(外交游戏AI,通过分析5万场人类对话学会了合作与欺骗)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Noam Brown,Meta AI(FAIR)研究科学家,在Lex Fridman播客中讨论了AI在扑克和战略谈判游戏中的突破。他共同创建了首个在无限制德州扑克(heads-up和多人)中达到超人类水平的AI系统,以及近期在桌游Diplomacy中能通过自然语言进行战略谈判的AI。核心观点是,AI在非完全信息博弈中通过自我对弈和推理(如counterfactual regret minimization)取得进展,Diplomacy的成功展示了AI在复杂人类协作与欺骗场景中的潜力。重要结论:这些技术可应用于现实世界的谈判、经济博弈和AI安全,但需谨慎处理伦理问题。

全文约 12 分钟 · 7 个章节
深度解读

本期速览

Noam Brown,Meta AI(FAIR)研究科学家,共同创建了首个在无限制德州扑克(heads-up和六人)和桌游Diplomacy中达到超人类/人类水平AI的团队。本期主线是从扑克到Diplomacy的AI演进,核心在于从纯对抗的零和博弈转向需要自然语言合作与信任构建的复杂社会博弈。全片最有分量的判断:Noam Brown认为,在需要合作的游戏中,纯自我对弈(self-play)不再足以击败人类——AI必须学习并适应人类的行为模式,包括非理性与情绪反应,否则即使策略上“正确”也会被人类玩家联合排斥。


主题一:扑克AI的突破——搜索比神经网络更关键

Noam Brown认为,在扑克等不完全信息博弈中,实时搜索(search)带来的提升远大于扩大预计算策略规模。

  • 历史脉络:2015年Brown的扑克AI在对抗人类职业选手时惨败,原因是它仅依赖预计算的策略表,而人类在关键时刻会花数分钟进行推理。2017年的Libratus引入了实时搜索——在游戏中途(翻牌后)开始搜索到终局的所有可能行动路径,结果以约$2,000,000(虚拟筹码)的优势击败四位顶尖heads-up选手(120,000手牌,$50/$100盲注)。
  • 机制拆解:搜索的核心不是简单地评估当前手牌,而是同时搜索自己可能持有的约1,000种手牌组合(52选2),以保持不可预测性。系统通过反事实遗憾最小化(CFR) 在自我对弈中学习:它模拟游戏、计算每个行动相比其他选择的“遗憾值”,然后按遗憾比例调整未来选择概率。搜索与预计算策略的融合方式是:用预计算的价值函数评估搜索终点(如翻牌到转牌)的状态,从而避免搜索到终局。
  • 数据链:No-Limit Texas Hold'em heads-up版本约有10¹⁶¹个决策点(超过宇宙原子数的平方)。Libratus的训练成本约$100,000(云计算资源),而后续的Pluribus(六人扑克)通过深度受限搜索(depth-limited search)将成本降至<$150——仅需搜索几步后就用价值估计替代,而非搜索到终局。
  • 关键类比:Noam Brown指出,即使AlphaGo/AlphaZero,若去掉实时搜索(Monte Carlo Tree Search),其ELO评级从约5,200骤降至约3,000——低于人类顶尖水平(约3,600)。“没有人制造出仅靠原始神经网络就达到超人类水平的围棋AI。” 搜索是这些突破中不可或缺的组件。

主题二:扑克AI的意外发现——“超池下注”改变了人类玩法

Libratus在比赛中自发采用了人类几乎不用的“超池下注”(overbet),结果证明这是极其有效的策略,并已被人类职业选手广泛采纳。

  • 机制拆解:Brown团队在最后时刻给Libratus添加了“可下注任意金额”的选项(包括10倍底池),原本认为AI不会使用。但比赛中AI频繁下注$20,000进入$1,000底池——这迫使持有“第二好牌”的人类玩家陷入极端困境:要么怀疑AI在诈唬而跟注,要么担心AI真有坚果牌而弃牌。人类有时会思考5-10分钟才能做出决定。
  • 数据与推演:Brown观察到人类在这种局面下极度挣扎,意识到这实际上是AI在“做正确的事”——它只是最大化期望收益,而“让对手难受”是副产品。“这是人类从比赛中带走的第一教训:他们现在也开始使用超池下注。” 如今超池下注已成为高水平扑克中的常见武器。
  • 证伪条件:如果人类玩家能适应这种下注模式并调整跟注/弃牌频率,超池下注的效果会下降。但Brown认为,在纳什均衡框架下,这种策略的平衡点仍然对AI有利。

主题三:Diplomacy的挑战——合作与信任无法靠纯自我对弈解决

Noam Brown认为,Diplomacy代表了AI从纯对抗博弈到需要理解人类行为模式的根本性跨越——纯自我对弈训练的AI在七人游戏中会被人类玩家“联手消灭”。

  • 机制拆解:Diplomacy是七人战争游戏,核心是自然语言谈判:玩家私下协商结盟、协调行动,但可以随时背弃承诺。游戏有约50个领土,每回合玩家同时提交移动指令,支持(support)机制允许玩家帮助盟友或背叛。“游戏的核心是人,而不是棋子。”
  • 为什么纯自我对弈失败:Brown团队训练了一个纯自我对弈的Diplomacy AI(无人类数据),在七人游戏中与人类对战时被“摧毁”。原因有二:1)AI会发展出只有自己理解的“机器人语言”,人类无法与之沟通;2)AI会做出在数学上最优但在人类社交中不可接受的行为——例如在联手对抗领先者时,AI会用多余兵力抢夺盟友的领土。“人类会因此愤怒,然后故意输掉比赛来报复你。” 这种非理性但真实的人类行为无法从零和博弈的自我对弈中习得。
  • 数据链:Cicero系统使用了约50,000场人类Diplomacy游戏(超过1,000万条自然语言消息)作为训练数据。语言模型先在互联网数据上预训练,再在Diplomacy数据上微调。关键创新是意图控制(intent conditioning):系统通过强化学习+规划计算出“我想做什么”和“我希望对方做什么”,然后将这些意图输入语言模型生成消息。同时有过滤网络评估每条消息的预期价值——如果消息会导致对方采取不利行动(如告诉对方“我要攻击你”),则被阻止。
  • 推演:Cicero在40场在线游戏中排名第二(共约80名玩家,19人玩过5场以上)。Brown强调,衡量标准不是“在所有专家中排第一”,而是“在混合技能水平的真实环境中表现优于强人类玩家”——就像测试自动驾驶汽车不应在特技车手赛道上,而应在真实城市道路上。

主题四:人类化AI——从“正确”到“可合作”的平衡

Noam Brown提出,通过调整自我对弈中“人类锚定策略”(anchor policy)的权重,可以创造出既强大又像人类一样思考的AI——这对训练、作弊检测和游戏设计都有深远影响。

  • 机制拆解:核心方法是在自我对弈中引入正则化(regularization):AI被鼓励最大化期望收益,但同时被惩罚偏离人类行为模式(由监督学习从人类数据中得到的“锚定策略”)。有一个参数控制两者的相对权重。“你可以说‘尽量像人类一样玩,但如果某个行动有特别高的期望价值,可以偏离’。”
  • 应用案例:Brown团队已将此技术应用于国际象棋和围棋。结果:AI既保持了接近超人类的强度,又展现出人类化的风格。“你可以调出一个2,800 ELO的人类风格棋手——而不是Stockfish那种非人化的风格。” 更进一步,理论上可以针对特定棋手(如Magnus Carlsen)建模,用于针对性训练或弱点分析。
  • 伦理与风险:这种技术也带来作弊检测的挑战——如果AI能完美模仿人类风格,在线游戏中将更难区分人机。Brown承认:“这提出了关于AI系统在社会中角色的深刻问题。”同时,Diplomacy中的欺骗能力也引发伦理担忧——“开发能够对人类撒谎的语言模型是一个棘手的问题。”
  • 证伪条件:如果人类数据量不足或质量差,锚定策略会不准确,导致AI要么太弱(过度模仿有缺陷的人类),要么太不人类化(过度优化)。Brown认为数据规模是主要瓶颈。

提及的标的

标的 嘉宾态度 关键数据
Libratus(扑克AI) 已成功(超人类) 2017年击败4位顶尖heads-up选手,120,000手牌盈利约$2,000,000(虚拟),训练成本~$100,000
Pluribus(六人扑克AI) 已成功(超人类) 训练成本<$150,通过深度受限搜索实现
Cicero(Diplomacy AI) 人类水平(排名第二) 40场在线游戏,19名活跃玩家中排第二;使用50,000场人类游戏数据
AlphaGo/AlphaZero 引用为对比案例 无搜索时ELO从5,200降至3,000(低于人类顶尖3,600)
人类扑克选手(Daniel Negreanu) 肯定其适应AI的能力 少数跟上AI发展的老牌顶尖选手
人类扑克选手(Phil Hellmuth) 中性(提及风格) 以“非最优但有效”的风格著称

值得记住的判断

1. Noam Brown:在需要合作的游戏中,纯自我对弈不再足够——AI必须学习人类的行为模式,包括非理性与情绪反应。 支撑:Diplomacy中纯自我对弈AI被人类玩家“联手消灭”,因为它会做出数学上最优但社交上不可接受的行为(如抢夺盟友领土),引发人类报复。

2. Noam Brown:搜索(search)是AI突破的关键,而非神经网络本身——即使AlphaGo去掉搜索也会跌到人类水平以下。 支撑:AlphaZero无搜索时ELO从5,200降至3,000;Libratus通过实时搜索将扑克AI从2015年的失败变为2017年的碾压胜利。

3. Noam Brown:超池下注(overbet)是Libratus的意外发现,现已改变人类扑克策略。 支撑:AI下注$20,000进入$1,000底池,迫使人类陷入极端困境;人类选手赛后表示“我们需要开始这样做”。

4. Noam Brown:Diplomacy中,信任比欺骗更重要——长期撒谎会降低AI的得分。 支撑:一旦AI被发现撒谎,人类玩家会永久失去信任,拒绝合作;Cicero被设计为尽量减少谎言,因为“从长远来看,撒谎会导致更低的分数”。

5. Noam Brown:通过“人类锚定策略”正则化,可以创造出既强大又像人类的AI——这可用于针对性训练,但也带来作弊检测挑战。 支撑:该方法已应用于国际象棋和围棋,可调出特定ELO等级的人类风格棋手;但这也使在线游戏中区分人机变得更加困难。

6. Noam Brown:Diplomacy的“反AI偏见”是人类的天性——一旦玩家怀疑有AI,他们会联手先消灭它。 支撑:在非语言版本的实验中,人类玩家花费整局游戏试图找出AI,然后联合攻击它;这类似于“当外星人出现时,人类会团结一致”的社会心理。

7. Noam Brown:数据效率是AI当前最大的瓶颈——人类可以用数千局学会围棋,而AI需要数百万局。 支撑:他认为解决之道可能是让AI像人类一样利用广泛的背景知识(如语言模型预训练),而非从零开始学习每个任务。

8. Noam Brown:Diplomacy是AI向真实世界迈出的重要一步——因为它使用自然语言、涉及信任与欺骗、需要理解人类非理性。 支撑:相比StarCraft或Dota,Diplomacy的“行动空间”是自然语言句子,更接近现实谈判场景;但部署到真实世界仍面临定义奖励函数和行动空间的挑战。