← 返回列表
Lex Fridman Podcast播客22 Jan 2022来源: lexfridman.com主持: Lex Fridman

#258 – Yann LeCun: Dark Matter of Intelligence and Self-Supervised Learning

一句话导读

这篇访谈讲的是AI大神Yann LeCun的核心观点:智能的本质不是靠大量标签或试错,而是像婴儿一样通过观察世界来自我学习(自监督学习)。他认为当前AI效率太低,未来要迈向通用人工智能,关键就是让机器学会预测缺失信息、构建世界模型。访谈没有聊投资市场,也没有提到任何具体公司或股票,主要讨论的是AI技术的未来方向。

AI 摘要AI 生成 · 可能有误 · 以原文为准

本报告核心议题围绕Yann LeCun(Meta首席AI科学家、NYU教授、图灵奖得主)在Lex Fridman Podcast中阐述的“智能暗物质”与自监督学习理论。LeCun认为,当前AI系统过度依赖监督学习,而人类与动物学习主要依赖自监督学习——即通过观察世界结构来预测缺失信息,这是驱动智能发展的“暗物质”。他提出,未来AI需突破当前模型局限,构建能进行推理、规划与常识理解的联合嵌入预测架构(Joint Embedding Predictive Architecture),以更接近大脑运作方式,实现通用人工智能。

全文约 9 分钟 · 6 个章节
深度解读

好的,已完成对原文的分析与重组。以下是基于您指定框架的解读报告。

本期速览

嘉宾身份背景:本期嘉宾为Yann LeCun(Meta首席AI科学家、NYU教授、图灵奖得主)。

本期主线:LeCun系统阐述其核心理论——自监督学习是驱动智能发展的“暗物质”,并指出当前AI系统(依赖监督学习与强化学习)的效率瓶颈,以及如何通过构建联合嵌入预测架构(Joint Embedding Predictive Architecture)来突破这一瓶颈,迈向通用人工智能。

全片最有分量的一个判断LeCun认为,当前AI系统(尤其是通过强化学习)的效率极其低下,其根本原因在于缺少通过观察世界结构来学习预测模型的能力;而解决这一问题的核心在于“自监督学习”,即通过预测缺失信息来构建世界模型,这才是智能的本质,而非当前主流的监督或强化学习范式。


主题一:为何“自监督学习”是智能的“暗物质”?

Yann LeCun认为,人类与动物学习效率远高于当前AI,核心在于他们通过一种“自监督”的方式,在无外部标注的情况下,仅通过观察世界来构建丰富的背景知识(世界模型)。

  • 效率的鸿沟:LeCun指出,当前AI的两大主流范式——监督学习与强化学习——效率极低。“监督学习需要大量样本才能学习任何东西,而强化学习需要一个极其庞大的试错次数(ridiculously large number of trials)才能让系统学到任何东西。” 他以人类学习驾驶为例:一个青少年可以在约20小时的练习后学会开车,而一个自动驾驶系统即使经过数百万小时的模拟练习,仍无法可靠地学会驾驶。这巨大差距的背后,正是人类所拥有的、通过观察世界积累的“背景知识”或“常识”。
  • “暗物质”的比喻:LeCun将这种大部分未被当前AI系统复制的学习方式,称为智能的“暗物质”。他认为,婴儿在出生后头几个月里,几乎是通过纯粹的观察来学习世界如何运作,从而构建起世界模型。这种学习不针对特定任务,也不受外部奖励驱动,而是通过预测——例如,看到一段视频后预测接下来会发生什么,或者看到一句话后预测被遮挡的单词——来填充信息空白。“所以,从某种意义上说,智能的本质就是预测能力。”
  • 数据量的对比:LeCun用“蛋糕”的比喻量化了不同学习范式从每一次反馈中获取的信息量。在强化学习中,每次反馈只是一个标量(“好”或“坏”);在监督学习中,比如ImageNet分类,每次反馈约10比特(1000个类别)。而自监督学习,例如预测视频的下一帧,其反馈是一整段视频片段,信息量巨大。“在自监督环境中,信号比监督或强化学习环境中多得多。”

主题二:联合嵌入预测架构——如何处理预测的不确定性?

Yann LeCun指出,实现自监督学习的关键挑战在于如何处理世界的不确定性,并提出了“联合嵌入预测架构”(Joint Embedding Predictive Architecture,JEPA)作为解决方案。

  • 核心挑战:世界中存在固有的不确定性(例如,从一个视频片段预测未来,有无数种可能的结果)。传统的生成式模型(如预测像素)需要处理高维连续空间中的分布,这极其困难。而语言之所以成功,是因为其预测空间是离散的(一个大型词汇表),可以轻松表示为一个概率分布。
  • JEPA的范式转变:LeCun提出,与其直接预测像素,不如让系统学习一个抽象的、有信息的表征。具体来说,通过两个并行的神经网络,分别处理输入(如视频开头)和目标(如视频后续)。训练目标是让这两个网络输出高度相互可预测的表征,但过滤掉那些无法预测的细节(如背景纹理)。“你想让系统学习一个函数,该函数不会随着输入的那些特定变换而改变其输出。”
  • 非对比性方法(Non-Contrastive Methods):LeCun强调,他当前最兴奋的方向是“非对比性方法”,如Barlow Twins和VICREG。这些方法不需要“负样本”(即不相似的图像对),而是通过最大化两个网络输出之间的互信息来防止“信息坍塌”(系统对所有输入输出相同向量)。“VICREG……是近15年来我在机器学习中最兴奋的事情。” 这种方法能有效学习到对图像分类等任务有用的表征,但会丢失定位信息,这恰好印证了不同任务需要不同层次表征的观点。

主题三:AI学习范式的未来——从“工程师之”到“端到端学习”

Yann LeCun认为,AI的发展轨迹与所有其他模式识别领域一样,将从“大量手工工程”逐步演进到“完全端到端学习”,而自监督学习是实现这一目标的关键。

  • 历史的必然性:LeCun以OCR、语音识别和计算机视觉的发展为例,描述了这种演进:最初,人们依赖于手工设计的特征提取器(如傅里叶变换、SIFT特征),然后在其上应用一个简单的机器学习模型。随着数据增多和计算能力增强,人们开始训练整个系统,从原始输入到最终输出,使用一个巨大的神经网络。“我看到一个从越来越少的手工制作到越来越多学习的连续演变。” 他认为,这与生物学中的进化过程类似。
  • 对多模态与主动学习的看法:LeCun认为,多模态学习(如图像与文本结合)是“短期的有趣问题”,但并非解决智能的根本。他承认,主动学习(通过交互来探索世界的不确定性)和因果模型的学习(通过行动观察结果)对于提高学习效率至关重要,但这并非核心问题。“我担心的是主动学习,一旦这个问题被回答了……如果主动学习或交互将效率提高了几个数量级,那可能就变得完全不同了。” 他更强调,必须先解决“通过观察如何学习背景模型”这一根本问题。
  • AI的通用性与情感:LeCun坚信强AI终将实现,“机器最终会在所有人类智能的领域变得比人类更聪明,这是我毫无保留的‘是’。” 但他认为这需要很长时间,比许多人(如马斯克)预想的要难得多。他强调,情感是自主智能系统不可或缺的组成部分,因为一个拥有内在动机和长期预测能力的系统,必然会产生诸如恐惧、喜悦等情绪。“《星际迷航》中Data少校那种可以关闭情感芯片的情节,我认为是荒谬的。”

提及的标的

(本节内容为访谈,未涉及具体可投资标的的仓位动向或深度商业分析,因此不适用该表格格式。)

值得记住的判断

1. Yann LeCun“智能的本质可能就是某种特定形式的统计。” 支撑:他认为,学习因果模型、世界模型等深层机制,本身就是通过统计学习实现的。关键在于这种统计必须足够“聪明”,能够从观察中推断出结构的因果关系,而不是简单的模式匹配。

2. Yann LeCun“当前AI的盲点在于,我们还没有能力复制一个猫的大脑。” 支撑:他用800M神经元的猫脑作为标尺,指出猫拥有丰富的直观物理学和因果模型,而当前最先进的AI系统在常识方面远不如一只家猫。解决这个“低级”智能问题,是通往通用人工智能的必经之路。

3. Yann LeCun“数据增强是‘必要的邪恶’,但最终会被更纯粹的预测掩盖方法取代。” 支撑:目前的非对比性学习方法严重依赖预先设计好的数据增强(如旋转、颜色变化),这本身引入了先验知识。LeCun更看好类似于自然语言处理中的“掩码去噪自编码器”方法,例如仅通过随机遮挡图像中的部分像素(如Masked Autoencoder)来训练,这不需要复杂的数据增强。

4. Yann LeCun“意识不是我们大脑强大的结果,而是我们大脑局限性的体现。” 支撑:人类大脑只有一个“世界模型引擎”,一次只能处理一个任务。意识作为“执行控制器”,负责为当前场景配置这个世界模型。如果拥有多个可同时运行的模型,就不需要这种“意识”了。这解释了为何高度熟练的动作(如驾驶)会变成“潜意识”。

5. Yann LeCun“复杂性是‘观察者’的眼镜决定的。” 支撑:对MNIST数字施加一个随机但固定的像素置换,对人来说变得复杂,但对知道置换规则的“外星人”来说却很简单。因此,对复杂性的任何度量都包含一个“任意大的可加常数”,这阻碍了我们对复杂系统(如自组织、生命起源)的理论理解。

6. Yann LeCun“AI领域未来10年的最大挑战,是让机器学会学习处理不确定性并应对真实世界复杂性的预测模型。” 支撑:经典的模型预测控制(MPC)依赖于手工构建的确定性模型。而AI需要的是,像人类一样,通过观察自动学习一个能够处理复杂、非线性和不确定性的世界模型,例如橡胶、水流、人群交互等难以用第一性原理描述的现象。