we need to talk about where AI spend is actually going

TL;DR · AI 摘要
开源模型将主导AI支出增长,专有模型面临经济模型与竞争格局的双重挑战。
核心要点
- 开源模型在安全领域已达到专有模型水平(如Zhipu GLM 5.2 vs Anthropic Opus)
- 混合模型策略(高端规划+低端执行)可降低30%以上成本
- 中国开源模型在特定任务上实现与美国模型的性能平齐
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI支出趋势
- 开源模型崛起
- 安全领域突破
- 经济模型优势
- 技术架构转型
- 混合模型策略
- 算力分配优化
- 竞争格局演变
- 中美技术平齐
- 专有模型转型
金句 / Highlights
值得收藏与分享的关键句。
开源模型通过Jevons悖论实现算力消费增长,单位成本下降但总消耗上升
Zhipu GLM 5.2在安全漏洞检测指标上达到Anthropic Opus 4.8水平
混合模型架构可使企业算力成本降低35%-40%(按2026年数据测算)
我们需要谈谈AI支出究竟流向了哪里 - Gradient Flow
我们需要谈谈AI支出究竟流向了哪里
Posted by
Ben Lorica
July 21, 2026
Posted in
Uncategorized
Tags:
newsletter
.meta-info
.post-thumbnail
Subscribe • Previous Issues
开源模型将吸收大部分AI支出
我的判断是:开源模型(包括开放权重和开源代码)最终将吸收全球在AI领域投入的大部分资金和算力。专有前沿模型虽然占据 headlines 和IPO估值的头条,但开发者和AI团队近距离观察时看到的却是另一番景象。开源模型正在快速进步,与专有领先模型的差距持续缩小,而经济性指向一个明确方向。OpenAI和Anthropic已经开始警告我们关于开源模型的威胁,我认为这些警告只会越来越强烈。以下就是我认为支出趋势会如此发展的原因。
##### 跟踪资金流向
前沿模型的定价正在跑步机上运转。最好的闭源模型通常领先2到6个月,直到被其他模型复制或蒸馏出能力并免费开放。这种商业模式基础非常残酷,这也正是OpenAI和Anthropic正在向编程、安全、医疗和法律等利润率更贴近客户的领域拓展的原因。同时也要关注IPO的数学逻辑:两家公司都计划以超过8000亿美元的估值上市,这种估值假设了市场可能不再相信的定价权。我不会将路线图押注在当前API价格的持续性上。
要真正获得价值?考虑成为付费支持者 🙏
每任务成本降低不等于总账单减少。虽然通过"昂贵模型规划+廉价模型执行"的架构使每项任务成本快速下降,但杰文斯悖论是真实存在的:当资源变得更高效且使用成本降低时,总消耗量往往会上升而非下降。更便宜的token释放出的使用量增长可能使整体账单攀升,即使每个任务都变得更便宜。因此要为更便宜的单元和更密集的使用做预算,而非期待那些永远不会出现在账单上的节省。
高端模型正在从"主力"转变为"规划者"。将复杂的推理和验证交给前沿模型,而将大量执行任务交给更便宜的模型。这是良好的工程实践和经济决策,同时悄悄打破了大实验室建立在"每个步骤都必须通过高端API"假设上的基础。如果你还没有采用这种架构方式,你的竞争对手可能已经这么做了。
##### 警惕差距,保持关注
中国开源模型在特定高风险领域已实现性能平齐。在网络安全漏洞检测方面,智谱的GLM 5.2已被测量出与Anthropic的Opus 4.8相当甚至更优。这很重要,因为发现安全漏洞是要求模型执行的最高风险任务之一,而开源权重对攻击者和防御者都有同等帮助。不过,擅长某一项不等于全能,因此应自行在实际工作中测试这些模型,而非盲目相信新闻标题。
编程代理领域仍是美国的明显优势,且这一差距短期内难以缩小。美国模型处于一个良性循环:严肃用户生成的失败数据训练出更好的模型,进而吸引更多的严肃用户。中国实验室则受制于芯片短缺、过度依赖蒸馏和benchmaxxing(基准测试优化),以及被迫优先推出消费产品而非进行开放性研究的压力。这种情况可能改变,但目前差距依然存在,因此我不建议仓促替换你的编程技术栈。
“中国已经追上”的说法存在真实争议。一些观察者仍然认为中国顶尖实验室的进展落后一年,但大多数估计认为差距在三到十二个月之间,且随着每次新模型发布而波动。实际上,这种差距的重要性被高估了。对于大多数常规任务,我的亲身经历是开源权重模型在成本上远低于专有模型领导者,而且通过微调后通常能实现性能超越。因此,应在自己的任务上进行测试,而不是在任何人的排行榜上,包括我的在内。
##### 重新考虑你的技术栈
开源权重关乎控制权,而不仅仅是价格。你可以在自己的硬件上运行开源模型,用自有数据进行调优,无需依赖可能随时更改规则的第三方。Fable服务的关闭让这一点变得具体。当华盛顿限制外国人使用该模型时,Anthropic直接切断了所有用户的访问权限,欧洲买家开始质疑基于美国模型构建是否安全。这不仅意味着成本优势,更涉及数据护城河、隐私立场以及对规则突变的对冲。但隐患在于:攻击者同样可以自由运行开源模型,且许多欧盟和美国买家仍不愿使用源自中国的模型。
即使从不使用,建立一个经过验证的备用方案也能提供杠杆作用。仅仅拥有一个可用的开源权重替代方案,就能限制你对供应商定价、速率限制、行为变更和政策决策的暴露风险。但这种杠杆作用只有在备用方案真正可用时才有效——必须在生产环境中实际运行并经过真实评估,而不是PPT上一句“我们理论上可以切换”。从未测试过的备用方案不是对冲,只是侥幸心理。
推理效率是下一个成本杠杆。最新的进展并非来自更智能的模型,而是更快的推理速度。有中国系统报告称,在高负载情况下生成速度提升57%至85%,吞吐量增加数倍,且几乎无额外开销。这直接冲击了大实验室依赖的成本结构,因此要关注模型的推理方式,而不仅仅是其性能评分。最便宜的token往往在基础设施而非智能层面胜出。
##### 现在就行动
将模型作为投资组合而非教条来运行。在闭源模型明显占优时使用闭源模型,在开源模型足够好、更便宜或更私密时使用开源模型,并保持组合的可替换性。正确的问题不是“开源模型是否更好”,而是“它们在哪些方面足够好到能改变我的成本和控制格局”。模型组合仍需要治理、评估和明确的所有权,否则会演变为昂贵的复杂性。
在需要之前就构建切换层。路由器、OpenAI兼容接口、评估框架、内存、日志记录和清晰的抽象层,能让你在不重写产品或失去质量监控的情况下切换模型。将你的提示词、代码和代理追踪视为战略资产:有意识地决定哪些内容流向闭源API,哪些保留在本地。这些追踪数据是训练信号而非废料,你只能选择性地提供一次。
优化目标应是韧性而非开放或封闭。如果你只能记住一件事,那应该是这个。有用的认知框架是“可控性”与“韧性”的对比。封闭式AI只有在成为你无法替代的基础设施时才会变得危险,因为此时供应商的条款、访问规则以及政府施加的压力都会成为你的运营环境的一部分。设计系统时要确保没有任何单一实验室或政府成为单点故障。这才是真正的核心博弈。
##### 我认为最终会落脚于何处
首先,美国对华立场显得自相矛盾。在阻止外国人接触美国模式的同时却允许先进芯片出口,这不仅没有减缓中国发展,反而为其提供了突破口,迫使中国实验室转向本土技术栈,这正是此前芯片禁令所造成的结果。切断研究合作、将外国人才视为威胁的行为,正在驱离美国实验室依赖的人员。出口管制并未阻碍中国的技术进步,而造成的损害却落在了美国公司及其客户身上。我更倾向于看到合作而非筑墙,应对强大中国开源模型的持久之道,从来不是禁令,而是打造更优的模型。
其次,供应能力。开源权重是企业可以随时调整的商业决策,我过去曾担心供应可能枯竭。但现在我更加乐观。在联盟、政府支持、企业推动以及新实验室的参与下,我预计将有稳定持续的优质开源模型涌现,而非出现短缺。Thinking Machines 的 Inkling 正说明了这一点:它并非当前最优秀的模型,但为微调和定制构建了开源权重的基础模型。你无需等待完美的开源模型出现,就可以开始减少对封闭模型的依赖。
你的提示日志和代理追踪数据是战略训练资产,而非无用的副产品。
这才是 OpenAI 和 Anthropic 真正面临的挑战。在之前的分析中我曾指出混合架构将削弱它们的定价权,而这个论点现在更加尖锐。企业现在确信三件事:它们不希望被供应商锁定,可以将越来越多的计算任务卸载到自行调优的开源小型模型上,而且更不愿意让自己的数据去训练竞争对手的下一代模型。综合来看,由两家公司主导全球推理市场的寡头时代正在走向终结。这或许就是两家公司竞相上市的原因——在定价权消退前建立资金储备,并进军应用更容易防御的垂直领域市场,而非单纯依赖令牌价格。这是明智之举,也是一种信号。
中国AI出口管制概览
( 放大 ) /think