Open-weight models surge to 29% of volume, price per token flattens
TL;DR · AI 摘要
Open-weight models surge to 29% of volume, price per token flattens - Vercel AI Gateway Production Index — July 2026 Eve...
核心要点
- 主题聚焦:Open-weight models surge to 29% of volume, price
- 来源:Vercel News,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
开放权重模型占比升至29%,每令牌价格趋于平稳 - Vercel
AI网关生产指数 — 2026年7月
每月,AI网关在生产应用与AI实验室之间路由数十万亿个令牌,使我们得以观察当今企业中AI实际使用情况。我们在此发布这一观察结果。查看5月和6月发布的生产指数报告。
复制链接到标题 2026年7月摘要
7月指数报告基于2026年6月收集的AI网关数据。
- AI网关令牌量环比增长29%,支出增长27%。在5月上涨近20%后,每令牌价格趋于平稳。
- 开放权重模型处理了29%的网关令牌,较4月的11%显著提升,但仅占总支出的4%。DeepSeek以22.6%的令牌量位列第三,落后Google不到2个百分点,GLM 5.2在发布两周后进入网关按体积计算的头部模型。
- Anthropic以32%的令牌量获取了网关61%的支出,在所有高风险应用场景中获取了72%或以上的支出。
- 各模态有不同的领导者。OpenAI的GPT Image生成了53%的图像,领先于Google的Nano Banana的39%。中国实验室占据了视频支出的三分之二,而xAI的Grok Imagine生成了42%的视频,是所有模型中最多的。
- Claude Fable 5于6月9日发布,四天内达到Opus 4.8请求量的22%。一项美国出口管制令使其余时间的访问被暂停。
复制链接到标题 AI投资持续增长,平均令牌价格趋于平稳
6月,令牌量和支出以几乎相同的速度增长(分别为29%和27%),而每令牌价格保持稳定。前一个月,支出增速是体积增速的两倍多,推动平均令牌成本上涨近20%。
整体支出增加,但每令牌支出并未增加。自4月以来,开放权重模型的令牌量占比从所有令牌量的九分之一升至近三分之一,仅占网关平均令牌价格的十分之一。仅凭这一点就应拉低每令牌价格。但6月廉价体积增加的同时,封闭权重前沿模型的价格也上涨了约12%每令牌。两者相互抵消,使平均价格保持稳定。
这证明了6月报告中记录的路由纪律,现在在整体数据中可见:高体积工作流向低成本模型,高风险工作仍留在前沿。AI投资仍在快速增长,企业对在不同模型间平衡支出的策略性考量也在增强。
6月使用量和支出均上升;每令牌价格在5月上涨近20%后保持平稳
复制链接到标题 开放权重模型处理了近三分之一的生产令牌
6月,开放权重模型在仅占4%支出的情况下处理了29%的网关令牌。这相当于用四分之一的支出处理了近三分之一的令牌。
自4月以来,开放权重模型的占比几乎翻了三倍。其中大部分增长来自DeepSeek的持续增长,目前已成为网关第三大令牌来源,占比22.6%,仅次于Anthropic和Google。随着Google在4月激增后的回落,其令牌量占比降至24%,使DeepSeek与第二名仅相差2个百分点。
目前约有八分之一的企业客户在生产环境中运行开放权重模型。按当前趋势,一家开放权重实验室将很快成为AI网关按体积计算的第二大模型。
6月,DeepSeek处理了网关22.6%的令牌,落后Google不到2个百分点
最新进入者展示了加速的趋势。Z.ai发布了GLM 5.2,这是一个采用MIT许可的开源权重模型,针对长期代理任务,价格约为Opus 4.8的五分之一。从6月16日API上线到月底,其每日令牌交易量增长了约50倍。在最后一周,它在AI Gateway按令牌量排名为第11位,单日最高达到第7位。它在短短两周内就占据了其家族6月令牌总量的76%。此前我们记录的家族内迁移速度最快的Gemini 3.1 Pro,直到第二个月才达到相似的份额。
GLM 5.2在发布后的两周内客户数量增长速度远快于其令牌使用量
复制链接到标题 前沿实验室几乎保留了所有支出
六月份,美国前四大前沿实验室占据了AI Gateway支出的95%。Anthropic单独承担了32%令牌量的61%支出,较五月的65%有所下降,但与四月份持平。在最关键的应用场景中(错误代价高昂的场景:代码代理、后台代理和应用生成),Anthropic也占据了72%或更高的支出份额。
OpenAI的令牌占比从12.5%下降至10.3%,但其支出占比从13.3%上升至16.1%,导致其每令牌成本相较市场水平在一个月内上涨约50%。与DeepSeek形成对比的是,客户发送给OpenAI的工作量更少但成本更高,这种差异仅在生产数据中显现。
Anthropic承担了6月61%的支出;在体积图表中表现突出的DeepSeek,在支出占比中却微不足道
复制链接到标题 每种模态都有不同的领导者
图像生成在AI Gateway上是两家实验室的竞争。OpenAI的GPT图像系列生成了53%的图像,占据了6月图像支出的52%。Google的Nano Banana系列生成了近39%的图像,占据了43%的支出。其他系列均未超过5%。
OpenAI的GPT图像模型(53%)和Google的Nano Banana模型(39%)共同生成了网关6月图像的92%
视频是目前中国实验室占据高端市场的唯一模态。字节跳动的Seedance以49%的支出领先,但仅生成了三分之一的视频。xAI的Grok Imagine在19%的支出下生成了42%的视频,与DeepSeek在文本中的体积折扣位置相同。中国实验室(Seedance、Kling和阿里巴巴的Wan)共同占据了视频支出的约三分之二。该领域尚处于早期阶段,因此我们预计这些份额将出现波动。
xAI的Grok Imagine在19%的视频支出下生成了最多的视频;字节跳动的Seedance在34%的体积下引领了支出
Anthropic在文本领域领先,OpenAI在图像领域领先,xAI在视频生成量领先,字节跳动在视频支出领先。要在每种模态中运行领先的模型,需要跨至少三个实验室进行路由。
复制链接到标题 美国出口管制在发布后几天内暂停了Claude Fable 5
Anthropic于6月9日发布了Claude Fable 5,且被迅速采用。仅用四天时间,Fable的使用量就达到每发送给Opus 4.8的100次请求中22次的水平。
在发布后的前四天,Fable 5吸引了Opus 4.8 22%的请求
6月12日,一项针对Fable 5的美国出口管制令生效,Anthropic暂停访问以遵守规定。该模型在当月余下时间保持离线状态。6月30日管制解除,7月1日恢复访问。
复制链接到标题 其他六月数据还包括
- 后台代理是网关上每令牌成本最高的工作负载,仅占总令牌量的5%,却占总支出的14%。
- B2B用例驱动了6月46%的令牌量但占60%的支出;B2C用例则相反,占43%的令牌量和26%的支出。
- Google 的业务量主要集中在面向消费者的工作负载上。2026 年 6 月,其处理了 57% 的个人助理类 token 和 54% 的教育类 token,但代码代理类 token 的处理量不足 2%。
复制链接到标题 关于本报告
本分析基于通过 Vercel AI Gateway 截至 2026 年 6 月的匿名化聚合路由数据。
关于测量的一些说明:
- 支出采用市场定价(发布价目表价格),为使用自持 API 密钥的团队提供标准化视图。
- 业务量统计通过 AI Gateway 路由的 token 数量。
- B2C、B2B 和使用场景分类均为聚合数据,不识别任何具体团队或工作负载。
- 图像和视频数据统计生成的媒体内容(仅成功请求),不统计 token。图像和视频模型不按 token 计费,因此占比反映生成的图像和视频数量。
- 开源权重模型采用两种方式统计。业务量和支出占比(实验室份额图表)按提供商分类,统计在网关上提供自有模型的四个实验室(DeepSeek、MiniMax、Moonshot、Z.ai)。这是保守的统计方式。企业采用率数据按模型分类,统计所有开源权重模型(无论由哪家提供商提供),例如 Qwen、Gemma、GPT-OSS 和 Kimi。
复制链接到标题 历史报告
- 2026 年 5 月
- 2026 年 6 月
贡献者
Eric Dodds, Jerilyn Zheng