← 返回列表
Lex Fridman Podcast播客31 Jul 2021来源: lexfridman.com主持: Lex Fridman

#206 – Ishan Misra: Self-Supervised Deep Learning in Computer Vision

一句话导读

这篇讲的是让计算机像人一样自己看懂图片,不用人类一张张教它。研究者Ishan Misra认为,教计算机看图片比教它理解语言更难,因为图片是连续的、变化无穷的,而语言有固定的单词。他重点提到了几个方法:SEER模型在10亿张网上图片上自学成功,证明了这条路可行;SWAV算法通过把图片自动分成3000个类别来防止模型偷懒;DINO论文发现模型能自己学会识别物体的轮廓,比如狗在田野里的形状,而没人教它分割任务。

AI 摘要AI 生成 · 可能有误 · 以原文为准

该报告讨论了FAIR研究员Ishan Misra在计算机视觉领域推动自监督深度学习的研究,核心观点是借鉴OpenAI GPT-3等语言模型在自监督学习上的成功,将其应用于图像和视频理解,以减少对人类标注的依赖。重要结论包括:通过让机器人观看YouTube视频整夜,可显著提升其智能水平;自监督学习被视为“智能的暗物质”,是解决计算机视觉核心难题(如识别香蕉等对象)的关键。报告强调,自监督方法有望实现视觉系统对世界的自主理解,与Jan Lekun等合作者共同探索这一方向。

全文约 7 分钟 · 6 个章节
深度解读

好的,这是根据您提供的铁律和分析要求,对 Lex Fridman 播客 #206 期(嘉宾:Ishan Misra)的解读。

本期速览

本期嘉宾是 FAIR 研究员 Ishan Misra,他专注于计算机视觉领域的自监督学习。本期主线是探讨自监督学习如何成为机器理解视觉世界的关键,并对比其在语言和视觉领域的进展差异。Ishan Misra 认为,计算机视觉比自然语言处理更难解决,因为视觉信号是连续且组合爆炸的,而语言具有离散的、有限的词汇表,这使得语言领域的自监督学习(如掩码预测)更容易取得初步成功。

自监督学习:从“模仿”到“发现”

Ishan Misra 指出,监督学习无法规模化,而自监督学习的核心在于让算法从数据本身发现“监督信号”。

  • 监督学习的瓶颈:Misra 以 ImageNet 为例,指出标注 22000 个概念、1400 万张图像耗费了约 22 个人年。这种模式无法扩展到互联网上每天上传的数亿张图像。监督学习本质上是让模型“模仿”人类标注,这既不高效也不可持续。
  • 自监督的“技巧”:自监督学习的关键在于设计巧妙的“前文本任务”(pretext task),让数据自己产生标签。Misra 列举了两个核心技巧:
  • 语言中的掩码预测:如 BERT 模型,通过遮住句子中的某个词,让模型预测被遮住的词。这利用了“分布假设”——出现在相同语境中的词具有相似含义。
  • 视觉中的对比学习:这是当前视觉自监督学习最主流的方法。核心是“同一图像的不同裁剪(crops)是相关的”,因此模型需要学习让这些不同裁剪的特征表示(feature representations)在向量空间中彼此靠近。这利用了视觉世界的内在一致性。

视觉 vs. 语言:为什么视觉更难?

Ishan Misra 明确判断,计算机视觉比自然语言处理更难,其根本原因在于信号的结构差异。

维度 自然语言处理 (NLP) 计算机视觉 (CV)
信号本质 离散的、有限的词汇表(如英语约 5 万个单词) 连续的、组合爆炸的像素值(256 种可能值)
预测任务 从有限词汇表中选一个词(分类问题) 预测一个像素块(回归/生成问题),极其困难
成功技巧 掩码预测(Masked Prediction) 对比学习(Contrastive Learning),如不同裁剪的特征对齐
当前成就 已能解决部分语义理解、逻辑推理任务 能学习到物体的边界和部分概念,但离深层理解尚远
  • 数据增强的“原罪”:Misra 坦承,当前视觉自监督学习的成功高度依赖于精心设计的数据增强(如裁剪、颜色抖动、模糊等)。这本质上是一种“偷偷塞进去”的人类先验知识。理想情况下,模型应自己学会这些不变性,而非由人类预设。他展望了未来将数据增强本身也纳入学习过程的可能性,使其能根据图像内容(如香蕉的颜色)进行更真实、更合理的变换。

多模态学习与未来方向

Ishan Misra 展示了多模态学习(如音视频)的巨大潜力,并探讨了自监督学习的边界。

  • 音视频联合学习:Misra 介绍了其 CVPR 2021 论文,通过对比学习让模型学习视频画面与对应音频之间的关联。模型能自发地学会将特定的声音(如吉他声)与画面中的物体(吉他)联系起来,甚至能定位声音来源。这证明了多模态信息能提供远超单一模态的丰富信号。
  • 自监督学习的边界:Misra 认为,自监督学习在需要与人类交互的环节会遇到瓶颈。模型学到的“模糊概念”难以直接与人类沟通,必须引入某种形式的语言或语义接口。此外,深度学习普遍面临的数据效率低下问题,也是自监督学习需要攻克的难题。

提及的标的

标的 嘉宾态度 关键数据
ImageNet 局限性 22,000 个概念,1,400 万张图像,耗时 22 个人年;图像经过精心挑选(物体居中、概念明确),导致自监督方法“过拟合”于该数据集。
SEER 模型 看好 1 亿参数,在 10 亿张未经筛选的互联网图像上训练;证明了自监督学习可以在“野生”数据上有效工作。
SWAV 算法 看好 一种在线聚类方法,通过固定 K 个簇(如 3000 个)并施加等分约束(equipartition constraint)来防止模型坍塌(collapse)。
DINO 论文 看好 展示了自监督模型能自发地学习到物体的边界(如狗在田野中的轮廓),而从未被训练过分割任务。
RegNet 架构 看好 一种高效的卷积网络架构,优化了计算量(FLOPs)和内存占用,非常适合大规模训练。

值得记住的判断

1. 视觉比语言更难 (Ishan Misra):因为视觉信号是连续的、组合爆炸的,而语言是离散的、有限词汇的。这导致语言领域的掩码预测技巧无法直接迁移到视觉领域。

2. 数据增强是“偷偷塞进去”的人类先验 (Ishan Misra):当前视觉自监督学习的成功高度依赖于人类精心设计的图像变换(裁剪、颜色抖动等),这本质上是另一种形式的监督。理想情况下,模型应自己学会这些不变性。

3. 自监督学习能自发学到“物体性” (Ishan Misra):DINO 论文显示,仅通过“让不同裁剪的特征相似”这一简单目标,模型就能自动学会识别物体的边界,而从未被训练过分割任务。这证明了像素中蕴含的巨大信号。

4. 多模态学习提供“免费”的上下文 (Ishan Misra):音视频联合学习利用了“分布假设”的变体——相同的声音(如切割苹果 vs. 切割洋葱)往往对应相同的视觉概念。这比单一模态学习更高效、更强大。

5. 自监督学习的边界在于与人类交互 (Ishan Misra):模型学到的“模糊概念”无法直接与人类沟通。任何需要与人类交互的系统,最终都需要引入语言或语义接口,这构成了自监督学习的天然边界。

6. 主动学习与自监督学习有巨大协同潜力 (Ishan Misra):通过建模模型“知道什么”和“不知道什么”,可以智能地选择最有益的数据进行标注或学习,从而大幅提升数据效率。这类似于特斯拉的“数据引擎”策略。

7. 深度学习缺乏“正确性保证” (Ishan Misra):与传统算法不同,深度学习模型没有“保证”能正确识别所有情况。这种“模糊的正确性”是机器学习需要被接受和理解的本质特征。

8. “饥饿感”是成功的关键 (Ishan Misra):对目标要有“需要”而非“想要”的态度,并愿意为之付出巨大努力。失败是研究的常态,只有通过不断试错才能找到真正有效的方法。