Open Models Will Absorb Most of the AI Spend

TL;DR · AI 摘要
开源模型将主导AI支出增长,尽管专有模型短期领先,但开源模型在性能和经济性上持续追赶,影响技术选型与预算规划。
核心要点
- Zhipu的GLM 5.2在网络安全领域已匹敌Anthropic的Opus 4.8
- Jevons悖论导致AI支出可能因效率提升而增加而非减少
- 美国代码代理领域优势源于用户-模型正反馈飞轮
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开源模型主导AI支出
- 经济因素
- 专有模型定价困境
- Jevons悖论影响
- 技术演进
- 混合模型架构
- 中美性能对比
- 行业趋势
- 开源模型商业化
- 技术生态重构
金句 / Highlights
值得收藏与分享的关键句。
中国开源模型在网络安全领域已实现与Anthropic Opus 4.8的性能平齐
Jevons悖论揭示:AI效率提升反而可能推高整体支出
美国代码代理领域形成用户-数据-模型的正反馈飞轮
开源模型将吸收大部分AI支出 - Gradient Flow
开源模型将吸收大部分AI支出
作者: Ben Lorica 2026年7月22日
2026年7月15日
分类: 未分类
.meta-info
.post-thumbnail
我的判断是:开源模型(包括开放权重和开源代码)最终将吸收全球在AI领域投入的大部分资金和算力。专有前沿模型虽然占据新闻头条和IPO估值,但开发者和AI团队在近距离观察时看到的却是另一番景象。开源模型正在快速进步,与专有领先模型之间的差距持续缩小,而经济性也指向同一个方向。OpenAI和Anthropic已经开始警告我们关于开源模型的威胁,我预计这些警告将越来越强烈。以下就是我认为支出趋势会如此发展的原因。
##### 关注资金流向
前沿模型的定价正在跑步机上运转。最好的封闭模型通常领先2到6个月,直到被其他模型复制或蒸馏出能力并免费开放。这种商业模式基础非常残酷,这也解释了为什么OpenAI和Anthropic正在向代码、安全、医疗和法律等利润率更贴近客户的领域拓展。同时也要关注IPO的数学逻辑:两家公司都计划以超过8000亿美元的估值上市,这种估值假设了市场可能不再相信的定价权。我不会将我的路线图押注在当前API价格的持续性上。
要真正获得价值?请考虑成为付费支持者🙏
每任务成本降低不等于总账单减少。由于采用昂贵模型规划、廉价模型执行的架构,每项任务完成成本正在快速下降。但杰文斯悖论是真实存在的:当资源变得更高效且使用成本降低时,总消耗量往往会上升而非下降。更便宜的token释放出的使用量增长可能使整体账单攀升,即使每个任务的成本都在下降。因此应为更便宜的单元和更密集的使用做预算,而非期待账单上看不到的节省。
高端模型正在转变为规划者而非主力执行者。将复杂的推理和验证交给前沿模型,而将大量执行任务交给更便宜的模型。这是优秀的工程实践和经济决策,它悄然打破了大实验室建立在"每个步骤都必须通过高端API"这一假设上的基础。如果你尚未采用这种架构方式,你的竞争对手可能已经这么做了。
##### 警惕差距的变化
中国开源模型在特定高风险领域已实现与国际顶尖模型的平齐。在网络安全漏洞检测方面,智谱的GLM 5.2已被测量出匹配甚至超越Anthropic的Opus 4.8。这很重要,因为发现安全漏洞是模型能承担的最高风险任务之一,而开源权重对攻击者和防御者同样有利。然而,擅长某一方面不等于全面领先,因此应自行在实际工作中测试这些模型,而非盲目相信新闻标题。
代码代理领域仍是美国的明显优势领域,且这一差距短期内难以缩小。美国模型运行在一个良性循环中:严肃用户生成的失败数据训练出更好的模型,进而吸引更多的严肃用户。而中国实验室则受到芯片短缺、过度依赖蒸馏和基准测试、以及被迫优先推出消费产品而非进行开放研究的压力。这种状况可能改变,但目前差距依然存在,因此我不建议仓促替换你的代码栈。
“中国已经赶上”的说法确实存在争议。一些观察者仍认为中国顶尖实验室的水平落后一年,但多数估算显示差距在三到十二个月之间,且每次新模型发布后这一差距都会发生变化。实际上,这种差距的重要性远不如听起来那么大。对于大多数常规任务,我自己的经验是,开源权重模型在成本远低于专有模型的情况下,往往能与行业领先者相媲美,而且通过微调后通常能实现反超。因此,测试应基于你自己的任务,而非任何人的排行榜,包括我的。
##### 重新思考你的技术栈
开源权重关乎控制权,而不仅仅是价格。你可以在自己的硬件上运行开源模型,使用自己的数据进行调优,并且无需依赖可能随时更改规则的第三方。Fable服务被关闭的事件让这一点变得具体而现实。当华盛顿禁止外国人使用该模型时,Anthropic直接切断了所有用户的访问权限,欧洲买家开始质疑基于美国模型构建的系统是否安全。这不仅意味着成本的降低,更是一种数据护城河、隐私立场,以及对突发风险的对冲。但需要注意的是:攻击者同样可以自由使用开源模型,而且许多欧盟和美国买家仍不愿接触源自中国的模型。
一个经过验证的备用方案即使从未使用过也具有价值。仅仅拥有一个可用的开源权重替代方案,就能有效限制你对供应商定价、速率限制、行为变更和政策决策的依赖。但这种备用方案的价值只有在真正可执行时才成立——它必须在生产环境中实际运行并经过真实评估,而不是只在演示文稿中写一句“我们可能切换”。从未测试过的备用方案不是对冲,只是希望。
推理效率是下一个成本杠杆。最新的进展并非来自更智能的模型,而是更快的推理速度。某中国系统报告称,在高负载情况下,其生成速度比现有系统快57%到85%,吞吐量是原来的数倍,且几乎不增加额外开销。这直接冲击了大型实验室依赖的成本结构,因此要关注模型的推理方式,而不仅仅是它们的性能评分。最便宜的token往往在基础设施层面胜出,而非智能层面。
##### 立即行动
将模型视为投资组合而非信仰体系。在明确优势的领域使用闭源模型,在开源模型足够好、成本更低或更符合隐私需求时使用开源权重,并保持组合的可替换性。关键问题不是“开源模型是否更好”,而是“它们在哪些方面足够好到能改变我的成本和控制地位”。模型组合仍需要治理机制、评估体系和明确的所有权归属,否则会演变为昂贵的复杂性。
在需要之前就构建好切换层。路由器、OpenAI兼容接口、评估工具、内存管理、日志系统和清晰的抽象层,能让你在不重写产品或牺牲质量的前提下切换模型。同时,将你的提示词、代码和智能体追踪数据视为战略资产:有意识地决定哪些数据流向闭源API,哪些保留在本地。这些追踪数据是训练信号而非废料,你只能选择一次性放弃它们。
优化目标应是韧性而非开源/闭源。如果你必须记住一件事,那就是这个。有用的框架是“可控性”与“韧性”的对比。闭源AI只有在成为你无法替代的基础设施时才会变得危险,因为那时供应商的条款、访问规则以及政府施加的压力都会成为你运营环境的一部分。设计系统时要确保没有任何单一实验室或政府成为唯一的故障点。这才是真正的核心博弈。
##### 我认为最终会落脚于何处
首先,美国对华政策看似自相矛盾。在阻止外国人接触美国模式的同时又允许先进芯片出口,这并未减缓中国的发展,反而为其提供了突破口,迫使中国实验室转向本土技术栈,这正是此前芯片禁令所造成的结果。切断研究合作、将外国人才视为威胁,只会驱离美国实验室依赖的人员。出口管制并未阻碍中国的技术进步,而造成的损害却落在美国公司及其客户身上。我更倾向于看到合作而非筑墙,应对强大中国开源模型的持久方案从来不是禁止它们,而是打造更优秀的模型。
其次,供应问题。开源权重是企业可以随时更改的商业决策,我过去曾担心供应可能枯竭。但现在我更加乐观。在联盟、政府支持、企业推动以及新实验室的参与下,我预计将有持续不断的优质开源模型涌现,而非出现短缺。Thinking Machines 的 Inkling 就是一个例证:它并非当前最先进的模型,但却是专为训练后定制设计的开源权重基础模型。你无需等待完美的开源模型出现,就可以开始减少对封闭模型的依赖。
你的提示日志和代理追踪数据是战略性训练资产,而非无用的副产品。
这才是 OpenAI 和 Anthropic 真正面临的挑战。在之前的分析中我曾指出混合技术栈将削弱它们的定价权,而这一论点现在更加尖锐。企业现在确信三件事:它们不希望被供应商锁定,可以将越来越多的计算任务转移到自行调优的开源小型模型上,并且不愿让自己的数据去训练竞争对手的下一代模型。综合来看,由两家公司主导全球大部分推理任务的时代正在走向终结。这或许就是两家公司都在竞相上市的原因——在定价权消退前建立资金储备,并进军领域特定市场,因为应用比单个 token 价格更容易防御。这是明智之举,也是一种信号。