这篇访谈讲的是,AI的未来不是聊天机器人,而是能在后台跑好几个小时的“代理”,所以成本比速度更重要。嘉宾Neil Movva认为,像OpenAI、Anthropic这些公司靠领先几个月收高价不可持续,因为开源模型会追上来。他创办的Sail公司专门买别人不用的芯片(比如AMD)和电力,甚至接受偶尔断电,把AI推理成本压到最低。重点提了NVIDIA(短期好但长期不看好,因为每瓦性能提升慢)、AMD(被低估,有套利机会)、Cerebras(芯片带宽大,适合存模型权重)。
Neil Movva,Sail创始人,在《Invest Like the Best》节目中提出构建“token factory”以将AI推理成本降低10倍。核心观点是,未来AI代理将长时间后台运行(数小时至数天),此时延迟不重要,成本成为关键。Sail通过“scavenger strategy”收购他人不用的芯片和电力,并优化GPU中吞吐量与延迟的权衡,将每token成本压至极限。重要结论包括:对Nvidia持逆向观点,认为前沿实验室因领先3-6个月而收取的溢价不可持续;未来数据中心的电力效率将大幅提升。节目详细拆解了软件、芯片与电力全栈智能架构。
好的,这是根据你提供的规则和原文,对《Invest Like the Best》EP.488 嘉宾 Neil Movva 访谈的分析。
Neil Movva,Sail 创始人,提出构建“token factory”以将 AI 推理成本降低 10 倍。核心观点是,未来 AI 代理将长时间后台运行(数小时至数天),此时延迟不重要,成本成为关键。Sail 通过“scavenger strategy”收购他人不用的芯片和电力,并优化 GPU 中吞吐量与延迟的权衡,将每 token 成本压至极限。Neil Movva 认为,前沿实验室因领先 3-6 个月而收取的溢价不可持续,因为开源模型的能力扩散和蒸馏过程无法被阻止。
Neil Movva 判断,AI 推理的未来是长时间运行的后台代理,而非实时交互的聊天机器人。 他认为,当用户不再等待 AI 响应,而是让 AI 在后台自主工作时,延迟变得无关紧要,成本成为唯一关键变量。
Neil Movva 指出,GPU 本质上是一台“吞吐量机器”,但当前 AI 行业为了追求低延迟,迫使它扮演“私家车”的角色,牺牲了效率。 Sail 的策略是让 GPU 回归其“公车”本质,最大化吞吐量。
Neil Movva 的核心战略是“拾荒”(scavenger),即购买市场上无人问津的芯片和电力,通过软件优化使其高效运转,从而构建出成本极低的推理工厂。
Neil Movva 对 NVIDIA 持“短期看多,长期看淡”的逆向观点。 他认为 NVIDIA 在低延迟推理领域地位稳固,但未来属于高吞吐量推理,而 NVIDIA 的架构并非为此最优。
Neil Movva 认为,互联网作为高质量文本数据的来源,是一次性的“补贴”,未来模型能力的提升将主要依赖在可验证任务上的自我强化学习(RL)。
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| NVIDIA | 短期看好,长期看淡 | 从 Hopper 到 Rubin,每瓦性能提升不显著;NVLink 是低延迟必需品,但成本高昂(8x 硬件换 4-5x 速度)。 |
| AMD | 看好(存在套利机会) | 市场认知偏差导致其芯片被低估,软件生态不如 NVIDIA,为 Sail 留下优化空间。 |
| Cerebras | 看好(作为加速器) | 其 Wafer Scale Engine 3 的 SRAM 带宽可达 21 PB/s(NVIDIA HBM 约 10 TB/s),适合存储模型权重,但 KV Cache 容量受限。 |
| Anthropic / OpenAI | 中性(竞争关系) | 他们为领先 3-6 个月 支付了高昂的“溢价”,但 Neil 认为这个溢价不可持续。 |
| DeepSeek | 正面提及 | 在 KV Cache 压缩方面取得了“一个数量级”的进展,并每年持续进步。 |
| Intel | 中性(潜在替代方案) | 在失去台积电的极端情况下,其制程在每瓦性能上最多落后 2 倍,并非不可接受。 |
1. “最好的延迟就是没有延迟” (Neil Movva):当 AI 代理在后台自主工作时,用户无需等待,延迟问题自然消失。这是 Sail 整个商业模式的基石。
2. “没有差的芯片,只有差的定价” (Neil Movva):任何芯片都有其比较优势,关键在于找到合适的价格和用途。Sail 的核心能力就是为任何芯片找到其在推理堆栈中的位置。
3. “互联网是一次性的数据补贴” (Neil Movva):高质量人类文本数据(约 30 万亿 token)已被模型“榨干”,未来模型能力的提升将依赖在可验证任务上的自我强化学习。
4. “安全已经变成了‘工作量证明’” (Neil Movva):软件的安全性取决于你花了多少美元让 AI 去尝试攻破它。这形象地说明了低成本、大规模推理在网络安全领域的应用前景。
5. “从 Hopper 到 Blackwell 再到 Rubin,每瓦性能的提升并不显著” (Neil Movva):这是他对 NVIDIA 长期看淡的核心技术论据,暗示 NVIDIA 的硬件进步速度可能正在放缓。
6. “我们愿意接受 95% 的可用性” (Neil Movva):通过接受远低于行业标准的可靠性,Sail 可以获取被主流玩家忽视的、成本极低的电力和数据中心资源。
7. “我们不会与 Anthropic 或 OpenAI 竞价” (Neil Movva):Sail 的“拾荒者战略”旨在利用大客户“看不上”的碎片化、非标的算力资源,从而构建出成本优势。
8. “好奇心是唯一无法教授的东西” (Neil Movva):在招聘时,他不看 CUDA 或 AI 经验,而是寻找对“性能工程”有发自内心热爱的工程师,因为技术会变,但好奇心是永恒的。