Three New Models, One Signal About Where AI Spending Goes Next

TL;DR · AI 摘要
GLM 5.2、Kimi K3和Gemini 3.6 Flash三款模型显示AI支出将向性价比倾斜,但硬件成本与性能稳定性仍是企业决策关键。
核心要点
- GLM 5.2单次推理成本低至0.17美元,但部署需8-15万美元硬件投入
- Kimi K3在独立测试中超越除顶级模型外所有竞品,但价格差距仍影响企业采购决策
- Gemini 3.6 Flash的性能/成本比可能重塑企业AI采购市场格局
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI支出趋势
- 模型比较
- GLM 5.2成本优势
- Kimi K3性能接近前沿
- Gemini 3.6 Flash性价比
- 企业决策因素
- 硬件成本
- 价格差距
- 性能稳定性
金句 / Highlights
值得收藏与分享的关键句。
GLM 5.2单个漏洞检测成本仅0.17美元,但部署需8-15万美元硬件
Kimi K3在独立测试中超越除顶级模型外所有竞品,但价格差距仍影响企业采购决策
企业采购决策将更注重模型性价比而非单纯性能,价格差异可能达100倍
三种新模型,一个关于AI支出未来走向的信号 - Gradient Flow
三种新模型,一个关于AI支出未来走向的信号
Posted by
Ben Lorica
July 22, 2026
July 21, 2026
Posted in
Uncategorized
.meta-info
.post-thumbnail
今年秋季,GLM 5.2(智谱)、Kimi K3(月之暗面)和Gemini 3.6 Flash(谷歌)三款前沿级模型在数周内相继发布。我想要捕捉早期开发者的反应,以便观察人们对这些模型的看法如何随时间变化。虽然具体评价存在差异,但综合来看,它们暗示着企业AI支出的实际走向。
Subscribe to our weekly newsletter
##### GLM 5.2让"足够好"变得难以忽视
GLM 5.2的初期媒体报道显示,这是迄今为止最有力的证据,表明开源且价格低廉的模型正在逼近前沿水平。虽然尚未完全达到前沿水平,但接近程度使得价格差距成为真正的焦点。一位开发者仅用约20美元(包含工作代理)就完成了一个完整的周末项目,这种规模的任务在同类高端模型上通常需要超过100美元。独立测试显示,GLM 5.2在代理编程任务中仅落后于当前前沿领导者,这对于开源权重模型来说是一个真正强劲的表现。一家安全研究机构甚至发现,其漏洞检测成本约为每发现一个漏洞0.17美元,尽管该对比是通过为该模型特别构建的定制流水线完成的,因此我更倾向于将其视为有前景的信号,而非证明某模型单纯更聪明。由于智谱使用了熟悉的API风格,将现有工具指向GLM 5.2只需进行接近一行代码的修改(至少在理论上如此)。
一旦超越演示阶段,复杂性就显现出来了。自行运行该模型需要约8万到15万美元的服务器级硬件,因此"廉价"主要意味着租赁成本低,而非拥有成本低。多位开发者报告称,该模型在处理复杂问题时容易陷入循环或丢失主线任务,有项任务竞争对手模型能在五分钟内完成,而GLM 5.2却接近耗时一小时。当加上额外的调试时间后,节省的token成本可能迅速消失。此外还存在真正的地缘政治风险,双向出口管制措施尚未完全明朗。这些因素并不证明该模型不好,但确实表明目前最响亮的论断——廉价开源模型即将引发行业广泛的价格崩盘——可能为时过早。廉价竞争与健康利润率共存的情况此前已出现过,更大的疑问在于:需要支持合同和问责对象的企业,是否真的会因这种程度的价格差异而转换供应商?
##### 对Kimi K3的环境判断
在仔细阅读开发者早期反馈后,我认为Kimi K3的重要性更多体现在它让许多实际工作中的差距变得近乎学术性,而非单纯因为其性能超越了顶级专有模型。独立基准测试显示其排名紧随两大前沿模型之后,但领先于其他所有模型,且足够多的开发者在自己的编码实践中验证了这一结果,使其难以被简单归结为营销噱头。价格差距最终将影响购买决策,其价格仅为美国顶级实验室同类能力收费的三分之一到五分之一。一些演示(包括通过单个提示生成完整模拟桌面、自主运行芯片设计等)确实引发了广泛关注,但需要明确的是,任何炫酷的展示都应被视为潜力预览,而非日常可用功能。悬而未决的核心争议在于K3是否部分使用了其他公司的模型输出进行训练,这一问题至今没有确凿证据能证明任何一方。
一个关键的批评点指向K3的思维模式:它过度思考。该模型在不需要复杂推理的问题上消耗大量推理令牌,导致宣传的每令牌价格与实际完成任务的真实成本存在显著差异。多位测试者发现,单次使用就可能耗尽订阅配额。虽然自行托管开放权重听起来颇具吸引力,但硬件成本的现实让这一选项仅对大型企业和专业托管服务商可行。使用条款还因使用场景(应用、API或最终开放版本)而变化,这本身就像对采购方的一种隐性税收。这些因素并未解决谁拥有最佳模型的问题,但表明前沿模型与"足够好"之间的差距已缩小到如此程度,真正的竞争焦点已转向围绕模型构建更优产品的厂商,而非单纯拥有最强大模型的厂商。
##### Gemini 3.6 Flash:成本策略,而非能力飞跃
与我此前讨论的GLM 5.2和Kimi K3不同,Gemini 3.6 Flash没有开放权重下载选项,也不支持自托管,更没有社区微调生态系统。该模型仅提供API接口,这也塑造了我对相关反馈的理解。没有人争论这是比前代更智能的模型,谷歌本身也未声称这一点。开发者真正称赞的是其在狭窄重复性任务中的速度和价格表现,例如电商商品分类、批量翻译、以及无需人工监督即可全天候运行的后端代理。这种实际应用场景的反馈比任何基准图表都更真实,因为大多数生产AI支出都集中在这些重复性任务,而非开放性推理。谷歌在多模态任务上似乎仍保持真实优势,有开发者描述其自动化处理珠宝业务中耗时10-15分钟的图像清理任务,其他人则指出其在非英语文本和通用图像分析方面表现强劲。这些都不构成前沿突破,而是谷歌继续强化其作为廉价快速方案的定位——毕竟AI工作中庞大的中间层从未真正需要最智能的模型。
投诉揭示的故事比赞美更有意思。最响亮的抱怨其实并非针对模型本身,而是针对谷歌自身的产品架构:令人困惑的层级体系、企业账单滞后于个人账户、以及一个因订阅层级悄然消失而被用户弃用的编码工具。价格也在各版本间逐步上涨,一些开发者指出,最便宜的Flash层级的输出价格自去年以来上涨了六倍以上,足以促使他们将工作负载完全转移到竞争对手那里。而悬而未决的问题是,旗舰Pro模型持续推迟发布,据外部报道显示,一个早期版本因表现不及竞争对手而被撤回。综合来看,这更像是谷歌在为自身经济利益调整一款工作马车,而非竞逐最聪明的模型。谷歌每天通过搜索处理的查询量已非常庞大,这种规模的处理需求,远比为外部开发者提供完整平台的对比更重要。这或许是一个完全合理的商业决策。这与OpenAI和Anthropic的押注不同,但在围绕其构建工作流之前,了解这一点是值得的。
##### 开放权重将吸收流量层
从逐个模型的评分表中后退一步,关于支出的更清晰信号显现出来。GLM 5.2和Kimi K3似乎准备吸收企业AI的流量层,即构成公司实际运行大部分内容的常规编码、提取和工具调用,而这两个模型在挑战最困难问题的前沿领域之前,就已经具备了这种能力。开发者们已经在同一工作流中将这些模型与Claude、Codex和DeepSeek并行运行,用便宜的模型处理常规任务,而将更昂贵的模型用于规划、审查或需要真正判断的环节。这不是一个假设的架构,而是在每次发布后几天内,人们就描述了这种架构的构建过程。
这并不意味着账单金额实际上会减少,也不意味着封闭实验室明天就会陷入困境。一旦计入上述额外的调试和硬件成本,节省的费用往往会蒸发,而更便宜的任务通常只是意味着更多任务被自动化,而非账单金额减少。长期压力则是另一个故事,这正是我最近指出的问题:前沿定价在跑步机上运行,今天取得的领先优势会在几个月内被匹配或提炼,而每次发布都会缩小高端实验室对真正独家产品收取全价的时间窗口。比彻底崩溃更可能的是资金流动而非消失,从为每个常规步骤支付前沿价格转向路由、评估、服务、治理以及基于这些模型构建的领域特定应用。GLM 5.2和Kimi K3是自那以来首次用实际数据而非抽象论点证明这一点的发布。这种转变,而非任何单一模型的基准分数,才是决定未来一年AI支出如何分配的关键因素。
##### 相关内容
- Open Models Will Absorb Most of the AI Spend
- What We Actually Know About China’s AI Export Controls
- Manos Koukoumidis: Stop Renting Generic Intelligence for Your Business
- Ameet Talwalkar: Why Observability May Be AI’s Next Frontier