跨国串门儿计划播客1:20:06

#692.Neil Movva:把 AI 推理成本降 10 倍,智能充裕时代如何绕开芯片与电力瓶颈

8.5内容质量
#692.Neil Movva:把 AI 推理成本降 10 倍,智能充裕时代如何绕开芯片与电力瓶颈

播客收听

时长 1:20:06原播客页面

问这期播客

会先在本集摘要、章节、转录和笔记里找答案。

TL;DR · AI 摘要

Sail Research通过降低AI推理成本10倍,推动长周期AI Agent发展,利用异构芯片和分散式集群优化算力。

核心要点

  • Sailboxes支持Agent运行数天,将token成本降至原价1/10
  • 异构集群可整合AMD/TPU等芯片,价格不合理时即为价值机会
  • 后台Agent容忍95%可用性,颠覆传统数据中心SLA标准

结构提纲

按章节快速跳转。

  1. Sail Research通过token工厂重构AI基础设施,将推理成本降低10倍。

  2. Sailboxes实现长周期Agent运行,颠覆传统实时响应模式。

  3. 软件优化GPU吞吐量,NVLink与Cerebras架构各有适用场景。

  4. 采用拾荒者策略整合被低估芯片,AMD/TPU等均有机会。

  5. 1000个小型数据中心可替代1吉瓦中心,兼容间歇性能源。

  6. 开源模型与KV cache压缩将重塑AI基础设施投资周期。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI推理成本革命
    • Sail技术栈
      • Sailboxes长周期运行
      • 异构芯片整合
      • KV cache优化
    • 芯片策略
      • 拾荒者芯片整合
      • NVLink与Cerebras对比
    • 能源创新
      • 小型数据中心
      • 可再生能源适配

金句 / Highlights

值得收藏与分享的关键句。

章节

  1. 开场:什么是 token 工厂

    开场:什么是 token 工厂

  2. Neil Movva 与 Sail Research 的业务介绍

    Neil Movva 与 Sail Research 的业务介绍

  3. Sail 如何通过 API 提供低价 token

    Sail 如何通过 API 提供低价 token

  4. Sailboxes:运行数小时、数天甚至数周的 Agent

    Sailboxes:运行数小时、数天甚至数周的 Agent

  5. 「充裕」为何是公司的核心主题

    「充裕」为何是公司的核心主题

  6. 为什么 token 成本是当前的北极星指标

    为什么 token 成本是当前的北极星指标

  7. 开源模型与「智能主权」的兴起

    开源模型与「智能主权」的兴起

  8. Agent 的未来为何属于长周期任务

    Agent 的未来为何属于长周期任务

  9. 「最好的延迟就是完全没有延迟」

    「最好的延迟就是完全没有延迟」

  10. 测试时计算扩展与更长任务时长

    测试时计算扩展与更长任务时长

  11. 后台工作负载可能从 50% 走向 90%

    后台工作负载可能从 50% 走向 90%

  12. 深度研究、互联网索引与网络安全

    深度研究、互联网索引与网络安全

转录

开场什么是 token 工厂

Neil Movva 与 Sail Research 的业务介绍

Sail 如何通过 API 提供低价 token

Sailboxes运行数小时、数天甚至数周的 Agent

「充裕」为何是公司的核心主题

为什么 token 成本是当前的北极星指标

开源模型与「智能主权」的兴起

Agent 的未来为何属于长周期任务

「最好的延迟就是完全没有延迟」

测试时计算扩展与更长任务时长

后台工作负载可能从 50% 走向 90%

深度研究、互联网索引与网络安全

主动型个人助理与「便宜的智能」

Sail 为什么必须从软件做起

Tensor Core 与矩阵乘法

GPU 的本质吞吐量机器

延迟优化与吞吐量优化的根本权衡

NVLink 如何降低低延迟推理的成本

为什么 Sail 没那么在乎低延迟推理

Cerebras、Groq 与片上 SRAM

KV cache动态知识为何成为瓶颈

Transformer 的核心注意力与序列建模

为什么 Transformer 像一块极佳的海绵

互联网是对数据的一次性补贴

强化学习环境如何成为下一阶段的数据来源

芯片稀缺与算力分配

「没有坏的芯片,只有不合理的价格」

训练基础设施如何转向推理基础设施

为什么 1 兆瓦的小型数据中心更适合 Agent 推理

组合不同芯片、性能与数据中心

用 1000 个小型数据中心对抗 1 吉瓦中心

为什么后台 Agent 可以接受 95% 的可用性

太阳能、风能与可预测的间歇性电力

AI 全栈中最需要提升效率的环节

KV cache 压缩与算力调度

前沿实验室领先三到六个月的溢价

便宜 token 与每个人自己的 Agent harness

短期看好英伟达,但永远不要看空英伟达

芯片初创公司必须理解的四个供应链瓶颈

英伟达为何不直接下场卖 token

导师、性能工程与理解完整技术栈

#AI推理优化#芯片架构#能源系统#Agent经济

节目笔记

#692.Neil Movva:把 AI 推理成本降 10 倍,智能充裕时代如何绕开芯片与电力瓶颈 - 跨国串门儿计划 | 小宇宙 - 听播客,上小宇宙

📝 本期播客简介

本期我们克隆了:Invest Like the Best with Patrick O'Shaughnessy Neil Movva - Making AI 10x Cheaper - [Invest Like the Best, EP.488]

原内容更新时间:Tue, 25 Aug 2026

本期嘉宾是 Sail Research 创始人 Neil Movva,主持人是 Patrick O'Shaughnessy。Sail 正在构建一个面向长周期 AI Agent 的「token 工厂」:通过 API 提供低成本推理,并托管可以在云端运行数小时、数天甚至数周的 Agent。与优先追求实时响应速度的传统推理服务不同,Sail 更关心如何把每个 token 的成本压到最低,让机器能够持续工作,而不是等待人类一次次发出指令。

这场对话从一个核心判断展开:只要把某样东西便宜十倍,它就可能成为全新的产品品类。Neil 认为,未来的 AI 不应只是遇到难题时才调用的「昂贵顾问」,而应成为在后台持续运行、主动完成任务的基础设施。深度研究、网络安全、互联网索引、科学发现和软件验证,都可能因为廉价且长时间运行的 Agent 而被重新定义。

节目还深入拆解了实现这一愿景所需的完整技术栈:软件如何榨干 GPU 性能,吞吐量与低延迟为何存在根本权衡,Cerebras、Groq、AMD 和新型加速器各自适合什么场景,以及为什么分散的小型数据中心、闲置芯片和间歇性能源,反而可能成为推理时代的优势。Neil 也分享了他对英伟达、开源模型、蒸馏、KV cache、Transformer 扩展定律和 AI 基础设施投资周期的逆向判断。

👨‍⚕️ 本期嘉宾

Neil Movva,Sail Research 创始人,长期专注于 GPU、算子、芯片架构、数据中心与能源系统之间的协同优化。他大学时期曾在英伟达工作,亲历 Tensor Core 从早期实验性设计逐渐成为 GPU 核心能力的过程;此后持续从软件栈、底层硬件和系统部署的角度研究如何提升计算效率。

Neil 的独特之处在于,他并不把推理基础设施局限于某一种芯片或某一座超大规模数据中心,而是采取「拾荒者策略」:购买市场上被低估、被忽视或不符合传统数据中心要求的芯片与电力,再通过自研软件、异构调度和分散式集群把它们组织起来。对于想理解 AI Agent 经济学、芯片供应链、算力投资逻辑和推理成本下降路径的听众,这是一场非常难得的全栈式对谈。

⏱️ 时间戳

00:00 开场:什么是 token 工厂

01:00 Neil Movva 与 Sail Research 的业务介绍

02:14 Sail 如何通过 API 提供低价 token

02:34 Sailboxes:运行数小时、数天甚至数周的 Agent

02:59 「充裕」为何是公司的核心主题

从实时聊天到后台 Agent

03:23 为什么 token 成本是当前的北极星指标

04:39 开源模型与「智能主权」的兴起

05:24 Agent 的未来为何属于长周期任务

06:04 「最好的延迟就是完全没有延迟」

长时间运行的 Agent 会带来什么

06:58 测试时计算扩展与更长任务时长

08:12 后台工作负载可能从 50% 走向 90%

08:23 深度研究、互联网索引与网络安全

10:52 主动型个人助理与「便宜的智能」

软件、GPU 与吞吐量的重新优化

13:31 Sail 为什么必须从软件做起

14:08 Tensor Core 与矩阵乘法

18:40 GPU 的本质:吞吐量机器

19:13 延迟优化与吞吐量优化的根本权衡

芯片架构:从 NVLink 到 Cerebras

21:19 NVLink 如何降低低延迟推理的成本

22:55 为什么 Sail 没那么在乎低延迟推理

24:12 Cerebras、Groq 与片上 SRAM

28:49 KV cache:动态知识为何成为瓶颈

Transformer、数据与可验证智能

32:08 Transformer 的核心:注意力与序列建模

34:10 为什么 Transformer 像一块极佳的海绵

35:57 互联网是对数据的一次性补贴

37:00 强化学习环境如何成为下一阶段的数据来源

拾荒者策略:芯片、电力与小型数据中心

44:13 芯片稀缺与算力分配

45:17 「没有坏的芯片,只有不合理的价格」

50:52 训练基础设施如何转向推理基础设施

52:29 为什么 1 兆瓦的小型数据中心更适合 Agent 推理

分散式算力与能源创新

53:12 组合不同芯片、性能与数据中心

54:15 用 1000 个小型数据中心对抗 1 吉瓦中心

55:12 为什么后台 Agent 可以接受 95% 的可用性

56:41 太阳能、风能与可预测的间歇性电力

投资判断、开源未来与智能充裕

1:01:20 AI 全栈中最需要提升效率的环节

1:01:59 KV cache 压缩与算力调度

1:07:30 前沿实验室领先三到六个月的溢价

1:10:02 便宜 token 与每个人自己的 Agent harness

公司的未来与 Neil 的逆向观点

1:13:36 短期看好英伟达,但永远不要看空英伟达

1:16:10 芯片初创公司必须理解的四个供应链瓶颈

1:17:31 英伟达为何不直接下场卖 token

1:18:20 导师、性能工程与理解完整技术栈

🌟 精彩内容

💡 让某样东西便宜十倍,它就会成为新产品

Neil 并不把降低 token 成本视为单纯的基础设施优化,而是把它看成创造新需求的前提。当智能变得足够便宜,Agent 就不必只在用户明确提出请求后才工作,而可以主动探索、反复尝试,并持续完成过去因成本过高而无法执行的任务。

「我们认为,只要你把某样东西便宜十倍,它就会成为一个全新的产品品类。」

💡 最好的延迟,是完全没有延迟

传统 AI 产品把延迟理解为用户等待答案的时间,因此追求每秒吐出更多 token。Neil 则提出另一种产品形态:让 Agent 在后台运行,人类不必实时参与。当用户早上醒来时,工作已经在夜里完成,延迟就不再是体验的核心指标。

「一种说法是,最好的延迟就是完全没有延迟。」

💡 Agent 会把人类从工作循环中移开

如果人类每隔几分钟就要给 Agent 一个 prompt、等待回复并继续指挥,人的注意力就会成为系统瓶颈。更理想的协作方式,是像管理一位同事:交代宏观目标,隔天或隔周再回来检查结果。

「随着你不断给 Agent 发 prompt 并等待回复,你在其中参与得越多,实际上,你反而成了决定 Agent 能做多少工作的瓶颈。」

💡 没有坏的芯片,只有不合理的价格

Neil 对算力硬件的判断非常反共识。他不认为只有英伟达芯片才有价值,而是认为不同芯片都有自己的比较优势。只要价格足够低、软件栈足够灵活,AMD、TPU、Trainium 以及各种新型加速器都能在异构推理系统中找到位置。

「没有坏的芯片。只有不合理的价格。」

💡 后台 Agent 不需要传统数据中心的完美可用性

面向实时应用的数据中心必须追求极低延迟、高冗余和严格 SLA;但对于运行数小时甚至数天的后台 Agent,偶发故障只会带来几分钟的额外等待。Sail 因此可以接纳单电源、低冗余、可用性只有 95% 甚至更低的数据中心,用可靠的控制平面把任务迁移到其他算力池。

「我会买 95% 可用性的数据中心。」

💡 未来的算力工厂可能由小型钢厂组成

Neil 用小型钢厂类比 Sail 的基础设施:不追求一座集中式、完全垂直整合的超级数据中心,而是聚合全球各地零散、便宜、别人不愿意使用的芯片和电力。通过软件调度与系统整合,这些分散资源可以形成经济效益更强的推理网络。

「我们正努力建造世界上最好的钢铁厂,但这会通过小型钢厂来实现,而不是通过大型一体化钢铁厂。」

💡 智能不该只是昂贵的咨询服务

Neil 认为,今天人们仍然把 Agent 当成一个价格昂贵、只有遇到难题才会请教的顾问。但如果 token 成本下降几个数量级,人们就可以在没有明确回报保证的情况下,让机器持续探索可验证的问题,智能也会从稀缺资源变成普遍可调用的公共能力。

「看待智能不应该是这种方式。机器能够思考,这太不可思议了,我们应该努力让它走进尽可能多的人手里。」

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺