Why Open Models Can Win on Enterprise Cost and Control

TL;DR · AI 摘要
开源模型在企业应用中因成本和控制优势逐渐胜出,推理成本可降低至闭源模型的1/5。
核心要点
- 自托管开源模型推理成本约1美元/百万token,远低于闭源模型的50美元
- MIT研究显示开源模型价格仅为闭源模型的1/6
- Kimi K3性能落后领先闭源模型约3.4%
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开源模型企业优势
- 成本优势
- 推理成本降低98%
- 自托管节省固定成本
- 控制优势
- 量化优化
- 模型蒸馏
- 性能对比
- 3.4%性能差距
- 多场景应用
金句 / Highlights
值得收藏与分享的关键句。
Moonshot托管Kimi K3成本15美元/百万token,自托管开源模型仅需1美元
MIT研究显示开源模型价格为闭源模型的1/6
Kimi K3性能落后领先闭源模型约3.4%
开源模型在成本与控制方面具有优势 | CoreWeave 博客
发布于
2026年9月4日
4
分钟阅读
为什么开源模型能在企业成本和控制方面胜出
开源模型的竞争力正在增强
作者
Daniel Bolus
David Corbitt
已复制
如果你正在大规模运行推理,模型选择现在已成为一项明确的支出项,而非一项能力押注。这使开源模型与闭源模型的讨论焦点,从当前业界普遍关注的议题中转移出来。
企业现在不再问“哪个模型最好”,而是关注真正决定成败的问题:“哪个模型能高效地实现规模化运行?”
开源模型与闭源模型的差距正在缩小
Kimi K3 于7月16日发布,具备100万token上下文窗口、原生视觉支持和稀疏专家混合架构。在独立测试中,其智能评分达到60分,仅落后于发布时的三款闭源前沿模型。Moonshot于7月27日如承诺般发布了开源权重。
此后,DeepSeek推出了V4 Flash和Pro 0813模型,阿里巴巴发布了Qwen 3.8系列,Z.ai发布了GLM-5.3-Flash。这些模型在多个应用场景中竞逐前沿地位,而不仅限于代码编写。
这改变了企业的讨论焦点。如今你可以下载的模型性能与最佳闭源系统仅相差几个点。对于大多数生产工作负载来说,“是否足够好”已不再是核心问题。
推理是成本节约的关键所在
训练模型具有高昂的前期固定成本。推理既是持续的使能者,也是持续的成本:每个用户请求、每个代理步骤、每次检索调用、每个token。因此,服务经济学比基准测试分数更能决定企业实际运行的模型。
当前的数学计算难以忽视。在高端市场,最新一代前沿模型每百万个token成本约为50美元。Moonshot托管的Kimi K3每百万个token仅需15美元,而使用自有GPU运行适当规模的开源模型通常接近每百万个token 1美元。今年的成本分析显示,自托管的盈亏平衡点约为每天500万到1000万token。
Kimi K3的定价基于已发布的API计费:每百万个输入token 3美元,每百万个输出token 15美元。前沿模型和自托管模型的数字仅为示例,受模型、硬件和利用率假设影响。
根据斯坦福大学2026年人工智能指数,当前最佳开源模型的性能与最佳闭源模型的差距约为3.4%。根据麻省理工学院的数据,开源权重的访问价格平均仅为闭源模型的六分之一。包括CoreWeave在内的托管推理提供商,使企业能够享受闭源模型提供商的扩展优势,而无需承担任何持续的固定成本。
开源权重还为你提供了控制每token成本的杠杆:量化、批处理、适当规模的硬件以及蒸馏成更小的任务模型。Kimi K3的API定价为每百万个输入token 3美元,每百万个输出token 15美元,与领先的闭源模型相当。区别在于,开源权重下API价格是上限而非下限。
蒸馏遵循相同的逻辑。2026年,一种日益增长的生产模式是将大型教师模型蒸馏成小型、廉价、任务特定的学生模型。大多数封闭式提供商可以随时更新其服务条款,禁止蒸馏等模式。开放式许可证通常不限制蒸馏,而前沿级开放教师模型使这种模式更具价值,而非降低价值。
然后是防护措施。供应商的审核层是根据供应商自身的风险档案进行调整的,而非您的需求。受监管行业的企业需要根据自身政策调整的防护措施、监管机构要求的确定性过滤器,以及检查、版本管理和冻结通过验证的模型的精确版本的能力。开放权重使所有这些成为可能。而任何弃用通知都无法让存储在您自己系统中的模型被停用。
且,而非或
世界上两种模型都有其存在的空间。封闭式前沿模型内置防护措施,可以成为企业开始在职场中采用AI的绝佳方式。随着企业扩大AI使用规模,对开放模型进行迭代优化,可以在单位经济效益决定功能是否上线的高流量路径中实现成本优化和更精细的控制。
在成本优化、迭代训练循环、主权归属以及更精细的防护措施和控制方面,开放模型以封闭模型难以在所有行业通用的方式赋予企业能力。
开放权重需要强大的基础设施
上述节省并非自动实现。它们假设服务执行得当:高GPU利用率、保持大型模型持续供能的互连网络、能够吸收流量高峰且不破坏延迟SLA的自动扩展能力。薄弱的基础设施会悄悄抵消开放权重带来的所有节省。
这就是CoreWeave构建的初衷。如果您的团队正在权衡从封闭源API访问转向开放模型服务,我们可以帮助您在投入任何GPU之前建模单位经济效益。
想在CoreWeave上运行Kimi K3?您今天就可以通过专用推理部署开放权重——自带模型权重并通过OpenAI兼容端点在专用GPU基础设施上提供服务——或完全在CoreWeave Kubernetes服务上自主控制运行。
对于其他开放权重模型:
- 在无服务器推理上部署DeepSeek V4 Pro (0813):部署用于编码任务和代理的领先模型
- 在无服务器推理上部署:按token计费服务,无需搭建集群
- 查看CoreWeave任务控制面板:实时监控GPU、网络和存储行为
- 预览CoreWeave ARIA:让代理作为研究人员工作,对模型进行微调和优化
Kimi K3目前尚未包含在无服务器推理模型目录中;当前可用的按token计费模型列表请参见此处。本文引用的基准测试结果、排名和第三方定价数据截至2026年7月,可能会发生变化。使用第三方模型需遵守适用的模型许可协议。
了解企业团队如何通过在自有基础设施上运行开放模型,降低推理成本并保持对微调、蒸馏和防护措施的控制。
分享本文: /