← 返回列表
Lex Fridman Podcast播客3 Jul 2020来源: lexfridman.com主持: Lex Fridman

#106 – Matt Botvinick: Neuroscience, Psychology, and AI at DeepMind

一句话导读

这篇访谈聊的是大脑和AI如何互相启发。DeepMind的神经科学主管认为,理解大脑就是理解行为,心理学和神经科学应该合二为一。他重点讲了三个发现:一是“元强化学习”——只要AI有记忆,它自己就会学会“怎么学”,不用人教;二是多巴胺不是简单的“惊喜信号”,而是像天气预报一样,给出各种可能结果的概率分布;三是AI光有“能力”不够,还得让人类觉得它“温暖”、可信,这才是终极挑战。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Matt Botvinick, DeepMind神经科学研究主管,在访谈中探讨了神经科学、心理学与人工智能的交叉领域。核心观点认为,人类大脑的理解仍有限,但认知功能受环境影响,前额叶皮层在高级认知中起关键作用。他提出元强化学习(meta-reinforcement learning)框架,将多巴胺系统与强化学习算法关联,认为AI研究可以从大脑机制中获益,反之亦然。重要结论:通过模仿大脑信息处理,可推动AI发展,但创造能与人产生情感连接的AI仍面临挑战。DeepMind作为研究机构,正致力于弥合神经科学与AI的鸿沟。

全文约 8 分钟 · 6 个章节
深度解读

好的,这是根据你提供的访谈文字稿和指令,生成的独立分析师解读报告。

本期速览

嘉宾 Matt Botvinick 是 DeepMind 神经科学研究主管,横跨认知心理学、计算神经科学与人工智能。本期主线围绕大脑如何产生行为这一核心问题,探讨了神经科学与 AI 研究如何相互启发。全片最有分量的判断是:Botvinick 认为,神经科学、心理学与 AI 研究的最终目标应是统一的,理解大脑就是理解行为,而 AI 模型(特别是元强化学习与分布编码)正不断印证这一观点。

认知的“中间层”谜团:高层的功能描述与低层的物理机制之间存在巨大鸿沟

Matt Botvinick 认为,目前对大脑的理解处于一个“奇怪”的中间状态:我们对其高级功能(如“要做什么”)和低层机制(如单个神经元放电)都有相当了解,但中间的鸿沟仍未填补。

  • 历史脉络:Botvinick 用遗传学历史做类比。孟德尔遗传学早于沃森和克里克的 DNA 双螺旋发现,前者使用的“基因”概念虽是一种隐喻,但为寻找物理机制提供了方向。他认为,当前认知心理学中的“注意”、“记忆”等概念,正是类似的、有价值的隐喻。
  • 机制拆解:他主张,神经科学的最终目的是研究大脑“为了什么”(即产生适应性的行为),而心理学就是研究这个“功能结构”的科学。因此,这两个学科不应被割裂。他将大脑比作肾脏:首先要明确其功能(过滤血液),然后才能研究其具体机制。
  • 推演与信号:Botvinick 预测,未来神经科学将会迎来“行为研究”的复兴,利用新技术(如小鼠的虚拟现实环境)引入更丰富的行为范式,并结合 AI 计算机制,弥合中间鸿沟。验证信号:是否能出现更多将心理学精确实验与高通量神经记录技术相结合的研究。

元强化学习:AI 揭示的“学习如何学习”的自动机制

Botvinick 阐述了“元强化学习”这一核心概念,指出这是 AI 研究向神经科学输入的关键洞见——一种自发涌现的、而非人为设计的“学习如何学习”机制。

  • 机制拆解:元学习是指一种学习算法催生出另一种学习算法的过程。Botvinick 团队的研究发现,用强化学习算法训练一个循环神经网络(RNN) 执行一系列相关任务时,会发生一个近乎“魔法”的现象:缓慢的权重调整过程,会塑造出网络的激活动态,而这种动态本身变成了一个全新的、快速的学习算法。即使冻结权重,RNN 依然能通过其内部动态,在新任务中理性地探索与利用。
  • 数据链:该研究的核心是,只要系统具备记忆(如 RNN 的循环结构或记忆增强神经网络),其功能被强化学习塑造,并且训练环境包含一系列共享抽象结构的任务,元学习就会自动发生,不可避免。(引自论文《Meta-Learning in Memory Augmented Neural Networks》)
  • 推演与信号:Botvinick 认为,人脑中的前额叶皮层(具有高度循环结构和工作记忆)可能正是通过这种机制来支持强化学习。多巴胺系统负责了缓慢的突触学习,而前额叶皮层则利用其循环动态,实现了基于激活的快速学习。证伪信号:如果无法在动物实验中,找到前额叶皮层动态与行为策略更新之间,符合元强化学习框架的直接神经证据。

多巴胺:一个分布式的“惊喜信号”编码器

Botvinick 介绍了其团队关于多巴胺的新发现,认为这个关键的神经递质可能并非传递单一的“预测误差”,而是采用一种精细的“分布编码”来表征未来的不确定性。

  • 背景与机制:在传统强化学习中,价值信号和预测误差通常被表示为单个数字(如“期望得到 5 元奖励”)。而“分布强化学习”则将这种表示推广为一种概率分布(如“有 50% 概率得 10 元,50% 概率得 0 元”)。
  • 数据链:AI 研究已证明,使用分布编码能显著加速强化学习并带来更好的策略。原因在于,它保留了内部表征的丰富性,避免了将不同情境(但具有相同期望值)强行“挤压”在一起,从而为后续学习保留更多有效信息。
  • 推演与信号:Botvinick 团队与哈佛大学 Naoshige Uchida 实验室合作,提出了一个具体预测:如果大脑也使用分布编码,那么在特定的行为任务中,应该观察到多巴胺神经元的活动模式并非单一,而是反映了不同结果的概率分布。实验数据确认了这一预测(论文《A distributional code for value in dopamine-based reinforcement learning》)。验证信号:其他实验室能否在独立实验中复现该发现。

人类与 AI 交互的“温暖维度”:通往 AGI 的终极图灵测试

Botvinick 认为,AI 研究过于聚焦“能力”维度,而忽略了“温暖”维度。创造出一个让人类感到同样温暖、可信任的 AI 系统,才是真正的巨大挑战。

  • 机制拆解:他引用社会心理学家 Susan Fiske 的研究,指出人类评价他人时主要依据两个维度:能力(competence)温暖(warmth)。当前 AI 的努力几乎全部集中在提升能力(如超人类水平的围棋、蛋白质折叠),但几乎未触及“温暖”维度。
  • 推演与信号:Botvinick 认为,AI 的“温暖”感并非仅靠给机器装个可爱面孔就能实现,它需要一套复杂的行为模式,让人类感觉其“关心”是真实的,而非模拟出来的。他提出,这可能是终极的图灵测试:一个 AI 系统不仅要能通过对话测试,更要让人类真心觉得“这是个好家伙”。证伪条件:如果无法设计出能让人类在长期互动中产生真实情感信任(而非简单被操控)的算法框架,那么这一目标的实现将遥遥无期。

值得记住的判断

1. “元强化学习是自动发生的,不是人为设计的。” (Matt Botvinick)—— 只要一个具有记忆的系统(如循环神经网络)被强化学习算法训练,并在一个任务分布中经历足够多的变化,元学习就会自动涌现,形成“学习如何学习”的内部动态。这是 AI 和大脑可能共有的底层机制。

2. “多巴胺可能不是单一惊喜信号,而是分布编码。” (Matt Botvinick)—— 传统观点认为多巴胺神经元编码单一的“奖励预测误差”(一个数字)。但新研究(含AI验证)推测,多巴胺信号可能以分布形式编码未来奖励的各种可能性,而非简单的加权平均,这能保留信息并加速学习。

3. “AI 的终极图灵测试不是能力,而是‘温暖度’。” (Matt Botvinick)—— 人类评价他人时,能力(能力)和温暖(温暖)是两个独立维度。创造出一个在能力上超群,但同时让人类感到真诚、可信任、愿意与之建立情感连接的AI,才是真正的挑战。

4. “认知是环境与系统交互的结果,而非仅由大脑结构决定。” (Matt Botvinick)—— 理解人类认知,必须同等重视环境结构与认知系统本身。自我对弈的AI(如AlphaGo)就是最好的例子,其对手成为环境的一部分,竞争(环境)驱动了学习。

5. “前额叶皮层是‘反习惯’的,它让你在需要时能覆盖自动行为。” (Matt Botvinick)—— 大脑有习惯系统(自动行为),也有前额叶皮层主导的目标导向系统。前额叶皮层让你能记住“现在要碰肘”,从而覆盖“伸手握手”的自动习惯。

6. “心理学和神经科学应该是同一门科学,目标都是理解行为。” (Matt Botvinick)—— 他主张,神经科学的目标是理解大脑“为了什么”,即产生行为。因此,心理学(研究行为的功能结构)和神经科学(研究其物理机制)是同一硬币的两面,不应割裂。