← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客25 Aug 2026来源: colossus.com主持: Patrick O'Shaughnessy

Neil Movva - Making AI 10x Cheaper - [Invest Like the Best, EP.488]

一句话导读

这篇访谈讲的是,AI的未来不是聊天机器人,而是能在后台跑好几个小时的“代理”,所以成本比速度更重要。嘉宾Neil Movva认为,像OpenAI、Anthropic这些公司靠领先几个月收高价不可持续,因为开源模型会追上来。他创办的Sail公司专门买别人不用的芯片(比如AMD)和电力,甚至接受偶尔断电,把AI推理成本压到最低。重点提了NVIDIA(短期好但长期不看好,因为每瓦性能提升慢)、AMD(被低估,有套利机会)、Cerebras(芯片带宽大,适合存模型权重)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Neil Movva,Sail创始人,在《Invest Like the Best》节目中提出构建“token factory”以将AI推理成本降低10倍。核心观点是,未来AI代理将长时间后台运行(数小时至数天),此时延迟不重要,成本成为关键。Sail通过“scavenger strategy”收购他人不用的芯片和电力,并优化GPU中吞吐量与延迟的权衡,将每token成本压至极限。重要结论包括:对Nvidia持逆向观点,认为前沿实验室因领先3-6个月而收取的溢价不可持续;未来数据中心的电力效率将大幅提升。节目详细拆解了软件、芯片与电力全栈智能架构。

全文约 11 分钟 · 9 个章节
深度解读

好的,这是根据你提供的规则和原文,对《Invest Like the Best》EP.488 嘉宾 Neil Movva 访谈的分析。

本期速览

Neil Movva,Sail 创始人,提出构建“token factory”以将 AI 推理成本降低 10 倍。核心观点是,未来 AI 代理将长时间后台运行(数小时至数天),此时延迟不重要,成本成为关键。Sail 通过“scavenger strategy”收购他人不用的芯片和电力,并优化 GPU 中吞吐量与延迟的权衡,将每 token 成本压至极限。Neil Movva 认为,前沿实验室因领先 3-6 个月而收取的溢价不可持续,因为开源模型的能力扩散和蒸馏过程无法被阻止。

主题小节

1. 未来属于“后台代理”,而非“聊天机器人”

Neil Movva 判断,AI 推理的未来是长时间运行的后台代理,而非实时交互的聊天机器人。 他认为,当用户不再等待 AI 响应,而是让 AI 在后台自主工作时,延迟变得无关紧要,成本成为唯一关键变量。

  • 论证:这一判断基于“测试时计算扩展”(test-time compute scaling)的趋势——给模型更多时间,它能给出更好的答案。从 Opus 4.5 开始,模型已能胜任持续约 1 小时的任务,且任务时长呈指数级增长。他预测,到今年年底,后台与实时工作负载将各占 50%,并最终演变为 90% 后台、10% 实时
  • 推演:后台代理的 token 消耗量是“无界的”,因为不再受人类注意力限制。这为大幅降低 token 成本创造了商业机会。验证信号:观察前沿模型(如 GPT-5、Claude 4)的任务平均执行时长是否持续增长。
2. 吞吐量 vs. 延迟:GPU 的“公车与私家车”之争

Neil Movva 指出,GPU 本质上是一台“吞吐量机器”,但当前 AI 行业为了追求低延迟,迫使它扮演“私家车”的角色,牺牲了效率。 Sail 的策略是让 GPU 回归其“公车”本质,最大化吞吐量。

  • 机制拆解:GPU 通过“批处理”(batching)并行处理任务,批处理越大,吞吐量越高,但单个请求的延迟也越长。他类比为“公车”(吞吐量优先,路线慢但载客多)与“私家车”(延迟优先,路线快但载客少)。当前行业(如 Cursor 等客户)迫使所有推理公司优化“私家车”模式,但 Neil 认为这是过去式。
  • 数据链:NVIDIA 的 NVLink 互联技术是低延迟推理的“必需品”,因为它允许将矩阵乘法切分到多个 GPU 上并行计算,从而降低单次运算时间。但 Neil 指出,这需要 8 倍的硬件投入,却只能换来 4-5 倍的速度提升(亚线性扩展),对于追求吞吐量的 Sail 而言并不划算。
  • 推演:Sail 将采用不同的并行方案(如专家并行、流水线并行),并愿意接受 1-10 tokens/秒 的极低输出速度,以换取最低的每 token 成本。证伪条件:如果未来 AI 应用的主流形态始终是实时交互,而非后台代理,则 Sail 的策略将失去市场。
3. “拾荒者战略”:从芯片到电力的全栈套利

Neil Movva 的核心战略是“拾荒”(scavenger),即购买市场上无人问津的芯片和电力,通过软件优化使其高效运转,从而构建出成本极低的推理工厂。

  • 芯片拾荒:Neil 认为“没有差的芯片,只有差的定价”。他愿意购买任何芯片(AMD、Cerebras、Google TPU、AWS Trainium 等),只要价格合适。关键在于,这些芯片的供应商(如 AMD)在软件生态上不如 NVIDIA 完善,这为 Sail 这样的“软件高手”留下了巨大的优化空间(alpha)。他明确表示,AMD 芯片因市场认知偏差而被低估,这正中其下怀
  • 电力与数据中心拾荒:Neil 计划利用分布式的小型数据中心(1 兆瓦级别,约 8 个冰箱大小的机柜),而非行业主流的百兆瓦级大型数据中心。他愿意接受 95% 的可用性(即 5% 的宕机时间),这对他而言是致命的,但对后台代理而言可以接受。他甚至考虑使用太阳能和风能等间歇性电源,通过预测天气来动态迁移工作负载。
  • 推演:通过拾荒,Sail 可以避开与 Anthropic、OpenAI 等大客户的正面竞争,获取他们“看不上”的算力资源。验证信号:观察 Sail 能否持续获得非 NVIDIA 芯片的稳定供应,以及其分布式数据中心网络的运营成本是否显著低于行业平均水平。
4. 对 NVIDIA 的逆向观点:短期看多,长期看淡

Neil Movva 对 NVIDIA 持“短期看多,长期看淡”的逆向观点。 他认为 NVIDIA 在低延迟推理领域地位稳固,但未来属于高吞吐量推理,而 NVIDIA 的架构并非为此最优。

  • 短期看多:NVIDIA 的 NVLink 和强大的软件生态使其在低延迟推理领域无可替代。Neil 承认,如果追求最低延迟,NVIDIA 的 Blackwell 芯片是唯一选择。
  • 长期看淡:Neil 的核心论据是,从 Hopper 到 Blackwell 再到 Rubin,NVIDIA 芯片的“每瓦性能”(performance per watt)提升并不显著。这意味着,当市场转向对延迟不敏感的后台推理时,NVIDIA 的护城河(NVLink、低延迟)将失去价值。届时,其他在“每美元算力”(flops per dollar)上更具优势的芯片将更具竞争力。
  • 数据链:Neil 还提出了一个关于芯片制造的逆向观点。他认为,如果失去台积电(TSMC)的供应,冲击虽大但并非灾难,因为西方最好的制程(如 Intel)在每瓦性能上最多只落后 2 倍,远小于市场恐慌所暗示的差距。
5. 数据与模型的未来:从互联网“施舍”到自我博弈

Neil Movva 认为,互联网作为高质量文本数据的来源,是一次性的“补贴”,未来模型能力的提升将主要依赖在可验证任务上的自我强化学习(RL)。

  • 数据链:高质量文本数据约有 30 万亿 token,放宽标准后约 300 万亿 token,模型已基本“读完”。未来,随机用户反馈的价值已不如专家反馈,因为模型本身已远超普通用户。
  • 机制拆解:未来的数据将来自“环境健身房”(RL environment),模型在可验证的任务(如编程、数学)中自我博弈,通过试错和反馈实现自我改进。这被视为通往 AGI 的路径:不断堆叠“专门智能”,直到没有缺口。
  • 推演:这一趋势对 Sail 有利,因为 RL 训练和推理都需要大量、低成本的计算资源。证伪条件:如果模型能力的提升在缺乏新的人类数据后陷入停滞,则 Neil 的“自我博弈”假设可能被证伪。

提及的标的

标的 嘉宾态度 关键数据
NVIDIA 短期看好,长期看淡 从 Hopper 到 Rubin,每瓦性能提升不显著;NVLink 是低延迟必需品,但成本高昂(8x 硬件换 4-5x 速度)。
AMD 看好(存在套利机会) 市场认知偏差导致其芯片被低估,软件生态不如 NVIDIA,为 Sail 留下优化空间。
Cerebras 看好(作为加速器) 其 Wafer Scale Engine 3 的 SRAM 带宽可达 21 PB/s(NVIDIA HBM 约 10 TB/s),适合存储模型权重,但 KV Cache 容量受限。
Anthropic / OpenAI 中性(竞争关系) 他们为领先 3-6 个月 支付了高昂的“溢价”,但 Neil 认为这个溢价不可持续。
DeepSeek 正面提及 在 KV Cache 压缩方面取得了“一个数量级”的进展,并每年持续进步。
Intel 中性(潜在替代方案) 在失去台积电的极端情况下,其制程在每瓦性能上最多落后 2 倍,并非不可接受。

值得记住的判断

1. “最好的延迟就是没有延迟” (Neil Movva):当 AI 代理在后台自主工作时,用户无需等待,延迟问题自然消失。这是 Sail 整个商业模式的基石。

2. “没有差的芯片,只有差的定价” (Neil Movva):任何芯片都有其比较优势,关键在于找到合适的价格和用途。Sail 的核心能力就是为任何芯片找到其在推理堆栈中的位置。

3. “互联网是一次性的数据补贴” (Neil Movva):高质量人类文本数据(约 30 万亿 token)已被模型“榨干”,未来模型能力的提升将依赖在可验证任务上的自我强化学习。

4. “安全已经变成了‘工作量证明’” (Neil Movva):软件的安全性取决于你花了多少美元让 AI 去尝试攻破它。这形象地说明了低成本、大规模推理在网络安全领域的应用前景。

5. “从 Hopper 到 Blackwell 再到 Rubin,每瓦性能的提升并不显著” (Neil Movva):这是他对 NVIDIA 长期看淡的核心技术论据,暗示 NVIDIA 的硬件进步速度可能正在放缓。

6. “我们愿意接受 95% 的可用性” (Neil Movva):通过接受远低于行业标准的可靠性,Sail 可以获取被主流玩家忽视的、成本极低的电力和数据中心资源。

7. “我们不会与 Anthropic 或 OpenAI 竞价” (Neil Movva):Sail 的“拾荒者战略”旨在利用大客户“看不上”的碎片化、非标的算力资源,从而构建出成本优势。

8. “好奇心是唯一无法教授的东西” (Neil Movva):在招聘时,他不看 CUDA 或 AI 经验,而是寻找对“性能工程”有发自内心热爱的工程师,因为技术会变,但好奇心是永恒的。