这篇播客聊的是AI如何从玩扑克进化到玩需要合作和谈判的桌游。Meta的AI研究员Noam Brown认为,在需要合作的游戏里,AI光靠和自己对练(自我对弈)是不够的,它必须学会理解人类的不理性行为,否则会被人类玩家联手排挤。他重点提了三个AI:Libratus(扑克AI,靠实时搜索碾压人类,还发明了“超池下注”这种新战术)、Pluribus(六人扑克AI,训练成本极低)、Cicero(外交游戏AI,通过分析5万场人类对话学会了合作与欺骗)。
Noam Brown,Meta AI(FAIR)研究科学家,在Lex Fridman播客中讨论了AI在扑克和战略谈判游戏中的突破。他共同创建了首个在无限制德州扑克(heads-up和多人)中达到超人类水平的AI系统,以及近期在桌游Diplomacy中能通过自然语言进行战略谈判的AI。核心观点是,AI在非完全信息博弈中通过自我对弈和推理(如counterfactual regret minimization)取得进展,Diplomacy的成功展示了AI在复杂人类协作与欺骗场景中的潜力。重要结论:这些技术可应用于现实世界的谈判、经济博弈和AI安全,但需谨慎处理伦理问题。
Noam Brown,Meta AI(FAIR)研究科学家,共同创建了首个在无限制德州扑克(heads-up和六人)和桌游Diplomacy中达到超人类/人类水平AI的团队。本期主线是从扑克到Diplomacy的AI演进,核心在于从纯对抗的零和博弈转向需要自然语言合作与信任构建的复杂社会博弈。全片最有分量的判断:Noam Brown认为,在需要合作的游戏中,纯自我对弈(self-play)不再足以击败人类——AI必须学习并适应人类的行为模式,包括非理性与情绪反应,否则即使策略上“正确”也会被人类玩家联合排斥。
Noam Brown认为,在扑克等不完全信息博弈中,实时搜索(search)带来的提升远大于扩大预计算策略规模。
Libratus在比赛中自发采用了人类几乎不用的“超池下注”(overbet),结果证明这是极其有效的策略,并已被人类职业选手广泛采纳。
Noam Brown认为,Diplomacy代表了AI从纯对抗博弈到需要理解人类行为模式的根本性跨越——纯自我对弈训练的AI在七人游戏中会被人类玩家“联手消灭”。
Noam Brown提出,通过调整自我对弈中“人类锚定策略”(anchor policy)的权重,可以创造出既强大又像人类一样思考的AI——这对训练、作弊检测和游戏设计都有深远影响。
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| Libratus(扑克AI) | 已成功(超人类) | 2017年击败4位顶尖heads-up选手,120,000手牌盈利约$2,000,000(虚拟),训练成本~$100,000 |
| Pluribus(六人扑克AI) | 已成功(超人类) | 训练成本<$150,通过深度受限搜索实现 |
| Cicero(Diplomacy AI) | 人类水平(排名第二) | 40场在线游戏,19名活跃玩家中排第二;使用50,000场人类游戏数据 |
| AlphaGo/AlphaZero | 引用为对比案例 | 无搜索时ELO从5,200降至3,000(低于人类顶尖3,600) |
| 人类扑克选手(Daniel Negreanu) | 肯定其适应AI的能力 | 少数跟上AI发展的老牌顶尖选手 |
| 人类扑克选手(Phil Hellmuth) | 中性(提及风格) | 以“非最优但有效”的风格著称 |
1. Noam Brown:在需要合作的游戏中,纯自我对弈不再足够——AI必须学习人类的行为模式,包括非理性与情绪反应。 支撑:Diplomacy中纯自我对弈AI被人类玩家“联手消灭”,因为它会做出数学上最优但社交上不可接受的行为(如抢夺盟友领土),引发人类报复。
2. Noam Brown:搜索(search)是AI突破的关键,而非神经网络本身——即使AlphaGo去掉搜索也会跌到人类水平以下。 支撑:AlphaZero无搜索时ELO从5,200降至3,000;Libratus通过实时搜索将扑克AI从2015年的失败变为2017年的碾压胜利。
3. Noam Brown:超池下注(overbet)是Libratus的意外发现,现已改变人类扑克策略。 支撑:AI下注$20,000进入$1,000底池,迫使人类陷入极端困境;人类选手赛后表示“我们需要开始这样做”。
4. Noam Brown:Diplomacy中,信任比欺骗更重要——长期撒谎会降低AI的得分。 支撑:一旦AI被发现撒谎,人类玩家会永久失去信任,拒绝合作;Cicero被设计为尽量减少谎言,因为“从长远来看,撒谎会导致更低的分数”。
5. Noam Brown:通过“人类锚定策略”正则化,可以创造出既强大又像人类的AI——这可用于针对性训练,但也带来作弊检测挑战。 支撑:该方法已应用于国际象棋和围棋,可调出特定ELO等级的人类风格棋手;但这也使在线游戏中区分人机变得更加困难。
6. Noam Brown:Diplomacy的“反AI偏见”是人类的天性——一旦玩家怀疑有AI,他们会联手先消灭它。 支撑:在非语言版本的实验中,人类玩家花费整局游戏试图找出AI,然后联合攻击它;这类似于“当外星人出现时,人类会团结一致”的社会心理。
7. Noam Brown:数据效率是AI当前最大的瓶颈——人类可以用数千局学会围棋,而AI需要数百万局。 支撑:他认为解决之道可能是让AI像人类一样利用广泛的背景知识(如语言模型预训练),而非从零开始学习每个任务。
8. Noam Brown:Diplomacy是AI向真实世界迈出的重要一步——因为它使用自然语言、涉及信任与欺骗、需要理解人类非理性。 支撑:相比StarCraft或Dota,Diplomacy的“行动空间”是自然语言句子,更接近现实谈判场景;但部署到真实世界仍面临定义奖励函数和行动空间的挑战。