← 返回列表
Lex Fridman Podcast播客27 Aug 2019来源: lexfridman.com主持: Lex Fridman

Jeremy Howard: fast.ai Deep Learning Courses and Research

一句话导读

这篇播客里,fast.ai创始人Jeremy Howard聊了怎么让普通人也能学会深度学习。他认为未来20年AI的重大突破都能用一张显卡搞定,用多张显卡训练对多数人是浪费时间。他批评学术界只做“安全”的小改进,忽略了像“超收敛”(一种让训练快10倍的方法)这样的实用发现。他提到NVIDIA在高端显卡上收费太贵,Google的TPU几乎没法编程,而看好微软的Access编程环境,认为它至今仍是最好用的。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Jeremy Howard,fast.ai创始人及旧金山大学杰出研究科学家,在Lex Fridman播客中讨论了深度学习教育的可及性与实践方法。核心观点是fast.ai提供免费、易上手的深度学习课程,聚焦实际应用与前沿探索,既适合初学者也惠及专家。Howard强调减少教育内容中的“废话”(BS),并分享其编程起点——在Commodore 64上用BASIC编写程序探索音乐音阶(如寻找更精确的3:2和声比例)。他因RSI(重复性劳损)问题减少音乐活动,但音乐与编程的结合仍影响其创意方法。重要结论:fast.ai是入门深度学习的首选资源,注重实用性与低门槛。

全文约 9 分钟 · 6 个章节
深度解读

好的,遵照您的指示,以下是基于播客文字稿的分析解读。

本期速览

嘉宾Jeremy Howard是fast.ai创始人、旧金山大学杰出研究科学家,前Kaggle主席。本期主线是探讨深度学习教育的可及性、实践方法论以及编程语言对研究效率的制约。全片最有分量的判断是:Howard认为,未来20年AI的所有重大突破都将在单GPU上完成,多GPU训练对绝大多数研究者而言是浪费时间。

深度学习教育:降低门槛,赋能领域专家

Jeremy Howard 认为,深度学习最大的社会价值在于赋能领域专家,而非培养更多算法专家。

  • 动机与使命:Howard创立fast.ai的初衷源于他在医疗AI创业中的挫败感。他发现,与其自己成为每个领域的专家,不如教会那些已经拥有数据和领域知识的人(如医生、生物学家)使用深度学习工具。他观察到,在Kaggle和医疗领域,深度学习已到达一个临界点,即将在所有领域成为主流方法,但最大的瓶颈是缺乏能将其应用于实际问题的实践者。
  • 课程哲学:fast.ai课程的核心是“减少废话”(BS),聚焦于实用和前沿。Howard强调,课程设计的目标是让一个“非常熟练的程序员”在70小时内完成一门课程,并能够训练出世界级的模型。他认为,成功的关键不是智力,而是“坚韧不拔”(tenacity)——不放弃的人最终都会成功。
  • 教学实践:Howard的教学方法强调“训练大量模型”。他认为,真正的学习发生在动手实践中:从创建自己的数据集(例如,用脚本从谷歌图片搜索抓取数据),到微调预训练模型,再到分析模型的错误分类。他特别强调,在课程的第二课,学生就能创建一个能区分不同熊类的网页应用,整个过程只需几分钟。

编程语言瓶颈:Python的“不可破解性”与Swift的希望

Jeremy Howard 认为,当前深度学习研究的最大瓶颈是Python语言本身,它严重阻碍了算法创新。

  • Python的缺陷:Howard指出,Python速度慢,导致其“极其不可破解”。研究者一旦需要优化底层算法(如循环神经网络中的循环、稀疏卷积核),就必须深入到CUDA C层面,这超出了大多数研究者的能力范围。这导致许多有潜力的研究方向(如稀疏卷积神经网络、主动学习)因实现难度过大而被忽视。
  • 历史视角:Howard回顾了编程语言的历史,认为主流世界忽略了“数组导向语言”(如APL、J、K)这一分支。他高度赞赏J语言的“表达力、可组合性和优美设计”,并提到其商业分支K语言,因其极致的速度和紧凑性(整个运行时能放入CPU的L3缓存),被全球最顶级的对冲基金使用,但价格高达10万美元/CPU
  • 未来的希望:Howard将希望寄托于SwiftMLIR(多层中间表示)项目。他认为,Swift的目标是“无限可破解”,而MLIR等编译器技术(如Halide、Tensor Comprehensions)能让研究者用领域特定语言(DSL)描述计算,再由编译器自动优化为高效的GPU代码。他预计,Swift在深度学习领域变得实用还需要三年时间。

研究生态批判:被忽视的实用创新

Jeremy Howard 严厉批评了当前深度学习学术界的研究文化,认为其奖励“安全”而非“实用”,导致大量有价值的发现被埋没。

  • “无用”的研究:Howard直言,深度学习领域的大部分研究是“完全浪费时间”。因为学者需要发表论文,他们倾向于研究同行熟悉的、能带来微小进步的“安全”课题,而非那些有重大实际影响但“不流行”的方向。
  • 被忽视的明珠:他以超收敛(Super-Convergence) 现象为例。研究员Leslie Smith发现,通过特定的学习率设置,某些网络可以快10倍地训练,且泛化能力更好。然而,这篇论文因无法解释其原理而被学术界拒绝发表。Howard认为,深度学习领域“对发表无法解释的实验结果毫无兴趣”,这与其他科学领域(如物理学)截然不同。他正是从这类未发表的论文中汲取了关键灵感,并将其应用于fast.ai的课程和DawnBench竞赛中。
  • 数据集的误导:Howard认为,像ImageNet这样的大型数据集(130万张图片)鼓励了“不创造性思考”。他发布了两个替代数据集:ImageNette(ImageNet的易分类子集)和ImageWoof(仅包含狗品种的难分类子集)。这两个数据集在单GPU上10分钟即可完成训练,且结果几乎可以直接迁移到完整的ImageNet上,从而让研究者能更快地迭代想法。

提及的标的

标的 嘉宾态度 关键数据
NVIDIA 风险提示 在高端企业级GPU市场“严重超额收费”,因缺乏竞争。
Google (TPU) 风险提示 TPU几乎“完全不可编程”,因Google为保护IP而限制了直接访问。
Google (TensorFlow) 风险提示 TensorFlow代码库“极其复杂混乱”,TF-Eager模式比PyTorch慢10倍
IBM (Watson) 风险提示 与Google一样,推动“需要更多数据和计算”的错误观念。
Amazon (AWS) 中性 设置GPU实例“仍然太难”,不如GCP和PaperSpace等平台便捷。
Microsoft (Access) 看好 认为其编程环境(VBA+关系数据库)是“有史以来最好的”,至今未被超越。

值得记住的判断

1. “未来20年AI的所有重大突破都将在单GPU上完成。” (Jeremy Howard) —— 支撑:过去20年的所有关键突破(BatchNorm, ReLU, Dropout, ConvNets, GANs)均不需要多GPU。多GPU训练对绝大多数研究者是“浪费时间”,会拖慢迭代速度。

2. “深度学习领域的大部分研究是浪费时间。” (Jeremy Howard) —— 支撑:学术界奖励“安全”的微小进步,而非有重大实际影响的创新。像“超收敛”(Super-Convergence)这样能让训练快10倍的发现,因无法解释原理而被拒绝发表。

3. “Python是深度学习创新的最大瓶颈。” (Jeremy Howard) —— 支撑:Python速度慢,导致其“极其不可破解”。研究者无法轻易创新RNN或稀疏CNN的核心算法,因为必须深入CUDA C层面。他寄希望于SwiftMLIR来解决此问题。

4. “成功的关键不是智力,是坚韧不拔(tenacity)。” (Jeremy Howard) —— 支撑:在fast.ai的教学中,他观察到来自不同背景的学生,只要不放弃,最终都能成功。放弃是失败的唯一原因。

5. “不要试图成为深度学习专家,要成为用深度学习解决你热爱领域问题的专家。” (Jeremy Howard) —— 支撑:社会不需要更多研究“略微进化”课题的学者,而是需要能用AI诊断疟疾、分析媒体偏见、研究渔业生态的领域专家。真正的创新来自解决真实问题。

6. “数组导向语言(如J, K)比主流语言强大得多,但被忽视了60年。” (Jeremy Howard) —— 支撑:J语言是“最具表达力、可组合性、设计优美的语言”;其商业分支K语言,运行时能放入CPU的L3缓存,数据处理速度在所有基准测试中胜出,但售价高达10万美元/CPU

7. “VC支持的创业比自筹资金创业更可怕。” (Jeremy Howard) —— 支撑:VC会迫使你追求“千倍回报”的增长,而自筹资金可以按自己的节奏发展,实现“生活方式退出”(如以1000万美元出售),这足以让创始人财务自由。

8. “学习任何东西,先学习‘如何学习’。” (Jeremy Howard) —— 支撑:他使用Anki(间隔重复软件)学习中文,并为每个单词编造“有趣、恶心、性感或与熟人相关”的故事来增强记忆。他坚持25年,每天至少花一半时间学习或练习新事物。