Gradient Flow

Your AI bill is a tax on scale

8.5内容质量
Your AI bill is a tax on scale

TL;DR · AI 摘要

单供应商AI堆栈正在被混合AI堆栈取代,企业通过使用开源模型降低部署成本并提高控制力。

核心要点

  • 开源模型可将重复性任务的单位成本降低50%以上。
  • 混合AI堆栈允许企业根据需求选择专有模型或开源模型。
  • 使用开源模型需要企业自行承担基础设施和工程成本。

结构提纲

按章节快速跳转。

  1. 单供应商AI堆栈正在成为过渡阶段,企业开始采用混合AI堆栈。

  2. 开源模型在成本、隐私和部署控制方面具有显著优势。

  3. 企业通过混合AI堆栈平衡专有模型与开源模型的使用。

  4. 使用开源模型需要企业承担更多基础设施和工程成本。

  5. 企业需权衡成本、控制力和部署复杂性。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 混合AI堆栈的兴起
    • 开源模型的优势
      • 成本降低
      • 隐私与控制
    • 开源模型的挑战
      • 基础设施成本
      • 工程复杂性

金句 / Highlights

值得收藏与分享的关键句。

#AI#开源模型#企业部署#成本控制
打开原文

你的 AI 费用是规模的税 —— Gradient Flow

你的 AI 费用是规模的税

发布者

Ben Lorica

2026 年 6 月 16 日

发布于

未分类

标签:

newsletter

.meta-info

.post-thumbnail

订阅 • 以前的期数

混合 AI 架构正在挑战 OpenAI 和 Anthropic 的定价权

OpenAIAnthropic 正在上市,同时仍然占据大量基础模型使用支出的市场份额。但部署模式开始讲述一个更复杂的故事。公司正在构建混合模型组合,使用专有模型在便利性、支持和前沿能力方面重要,而在成本、隐私、定制化和部署控制方面更重要时,转向开放权重模型。随着团队在操作多个模型方面变得更好,单一供应商的 AI 架构将不再像默认选择,而更像是一个过渡阶段。

喜欢这封简报吗?考虑成为付费支持者 🙏

##### 开放权重能给你什么,又不能给你什么

经济因素很难忽视。在之前的一篇文章中,我指出 CFO(首席财务官)已经变成了 CTO(首席技术官),即首席令牌官。这种表述在这里直接适用。专有 API 仍然对原型设计、广泛助手和困难推理任务有用。但一旦工作流程变得稳定且高流量,基于令牌的定价开始感觉像是对规模的税。开放权重模型可以显著降低重复性工作(如文档处理、分类、提取、内部搜索、客户服务和摘要)的单位成本。这些节省并不是自动发生的。首先必须吸收基础设施和工程成本。但对于每天运行数百万次推理的组织来说,这种优势可能比许多高管预期的要早得多。

( 放大 )

吸引力不仅仅在于更低的成本。开放权重模型为企业提供了对数据流向、模型如何适应以及生产中运行哪个版本的更多控制。这对银行、保险公司、医疗组织、制造商、软件公司以及处理敏感记录、专有代码、合同、客户对话或受监管数据的任何企业都非常重要。在私有云、本地环境或批准的区域基础设施上运行的模型,可能比仅通过第三方端点访问的模型更容易管理。使用开放权重模型,企业可以选择模型版本,对其进行测试、批准并继续运行。这对于在静默行为变化会导致审计和合规问题的受监管或高风险系统中,这非常有价值。微调和后训练使团队可以在不重新训练整个系统的情况下调整模型行为。RAG(检索增强生成)使模型在回答问题前可以咨询一个精选的内部知识库。这些模式共同使较小的模型在特定于公司的流程上表现良好。

实际障碍同样具有现实意义。切换到开放权重模型并不像更换一个 API 密钥那样简单。专有平台将托管端点、扩展性、文档、安全功能、企业支持和合同责任打包在一起。而开放权重模型则将这些负担更多地转移到买家身上。团队需要进行 GPU 规划、模型服务、推理优化、监控、评估、日志记录、访问控制、回退路径以及成本跟踪。由于 API 费用消失了,因此很容易低估总拥有成本,但运营工作并没有减少。在一些组织中,基础设施和专业工程人才可能成为主要成本。开放权重可以改善经济性,但只有那些足够成熟、能够良好运行它们的团队才能实现这一点。

治理问题则更加难以回避。专有平台通常包含安全层和企业风险支持。而开放权重模型往往需要公司自行构建这些控制措施。输入/输出限制、红队测试、事件响应、安全工件管理以及模型来源都成为了一线工程关注的重点。像 Heretic 这样的工具展示了为什么这很重要。安全限制可以迅速从开放权重模型中移除,这显然带来了合规性和误用的风险。法律团队也有实际的工作要做。“开放权重”并不意味着无限制。许可证可能会限制商业使用、再分发、规模、地理范围或特定功能。而当这些模型用于代码生成时,公司还需要流程来扫描输出中的漏洞和许可证冲突。

##### 新的企业模型堆栈

下一阶段并不是开放与封闭之间的选择,而是针对特定工作负载的模型选择。常规的分类任务可以交给一个较小的开放权重模型来处理。敏感的内部搜索工作流可以在私有基础设施中运行。复杂的推理问题则可以升级到专有的前沿模型。这才是混合模型组合的真正含义。架构不再只是选择一个最佳模型,而是构建一个路由和治理层,该层可以评估请求、选择合适的模型、监控成本和质量,并在需要时替换模型。我自己的编码流程中已经出现了这种做法。我的 O 2 工具包,结合使用开源代码和 OpenRouter,之所以有用,正是因为在不同的任务中,不同的模型表现更好。

随着我们向代理式工作流发展,这种混合方法变得尤为重要。当你构建持续运行循环、调用工具并处理后台任务的自主代理时,你的令牌消耗会急剧增加。如果你在高端专有端点上运行这些多步骤的完整工作流,你的月度 API 费用将急剧上升。相反,一个更聪明的架构会使用较小的本地开放权重模型来处理代理循环中的常规、重复性步骤,而仅将高风险决策或复杂推理任务升级到封闭的前沿模型。这种设置还可以将代理的敏感工具集成和内部系统命令保留在你自己的安全网络中,而不是通过外部 API 进行路由。但问题是,代理使得控制层更难构建。每个操作都需要记录、可审计,并且最好是可逆的,而大多数部署代理的团队尚未构建这样的基础设施。

开放权重是一个商业决策,而商业决策是可以被逆转的。

这种工作负载路由方式的转变对 OpenAI 和 Anthropic 来说带来了令人不安的影响,尤其是在他们向 IPO 迈进的过程中。他们的收入可能仍会快速增长,但定价能力将面临来自下方的压力。如果开源权重模型对于更多常规推理任务已经足够好,企业将变得更加谨慎,只在必要时支付高昂的 API 费用。他们仍然愿意为前沿推理、合规管理、系统稳定性、企业支持、便利性以及强大的安全机制付费。但他们将不太愿意将每一份摘要、提取、路由、标签、检索和支持工作流程都发送给最昂贵的模型。收入可以增长,但价格的主导地位却在减弱。

最大的不确定性在于供应。开源权重并不一定是一种有保障的公共产品,而是一种商业决策,而商业决策是可以被逆转的。OpenAI 多年前就展示了这一点。如今,Meta 对 Llama 作为开放生态系统的承诺似乎不如许多人预期的那样坚定。与此同时,开源权重领域正变得更加集中于中国实验室,而且随着一些供应商在营收压力下转向封闭或更受限制的授权模式,这种供应本身也在减少。这是整个故事中值得更多关注的部分。企业绝对应该认真对待开源权重,但他们不应假设该生态系统会始终保持丰富、宽松和稳定。最终胜出的团队将是那些能够在市场变化时,无需每次重建其 AI 架构,就能测试、路由、治理和替换模型的团队。