GLM 5.2 Fast via Wafer now available on AI Gateway
TL;DR · AI 摘要
GLM 5.2 Fast via Wafer 在 AI Gateway 上线,性能比其他服务提供商提升 2 倍。
核心要点
- GLM 5.2 Fast 在小上下文场景下每秒生成 170+ 个 token。
- AI Gateway 提供统一 API,支持自定义报告和零数据保留。
- AI Gateway 不加价反映服务提供商定价,不收取平台费用。
结构提纲
按章节快速跳转。
GLM 5.2 Fast via Wafer 现在在 AI Gateway 上线,提供更高的吞吐量。
在小上下文和大上下文场景下,GLM 5.2 Fast 的吞吐量分别达到 170+ tok/s 和 200+ tok/s。
- ›使用方法
通过设置 AI SDK 中的模型为 zai/glm-5.2-fast 来使用 GLM 5.2 Fast。
AI Gateway 提供统一 API,支持使用跟踪、成本跟踪和性能优化。
AI Gateway 不加价反映服务提供商定价,不收取平台费用。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GLM 5.2 Fast via Wafer 上线
- 性能优势
- 小上下文:170+ tok/s
- 大上下文:200+ tok/s
- AI Gateway 功能
- 统一 API
- 使用跟踪
- 成本跟踪
- 零数据保留
金句 / Highlights
值得收藏与分享的关键句。
Wafer 在小上下文和大上下文场景下分别达到 170+ tok/s 和 200+ tok/s 的吞吐量。
AI Gateway 提供统一 API,支持使用跟踪、成本跟踪和性能优化。
AI Gateway 不加价反映服务提供商定价,不收取平台费用。
GLM 5.2 Fast via Wafer 现已通过 AI Gateway 提供 - Vercel
GLM 5.2 Fast via Wafer 现已通过 AI Gateway 提供。
根据我们在小上下文、大上下文和工具调用场景中的基准测试,Wafer 在无服务器环境中提供 GLM-5.2 的吞吐量是其他提供商的 2 倍,解码和端到端速度在小上下文和大上下文场景中表现优异。
在我们的测试中,GLM 5.2 Fast 在 Wafer 上的表现如下:
- 小上下文:170+ tok/s
- 大上下文:200+ tok/s
要使用 GLM 5.2 Fast,请在 AI SDK 中将模型设置为 zai/glm-5.2-fast:
1
import
{
streamText
}
from
'ai'
;
2
3
const
result
=
streamText
(
{
4
model
:
'zai/glm-5.2-fast'
,
5
prompt
:
'Add error recovery to the data ingestion pipeline.'
,
6
}
)
;AI Gateway 提供统一的 API 用于调用模型、跟踪使用情况和成本,并配置重试、故障转移和性能优化,以实现高于提供商的正常运行时间。它包括内置的自定义报告、零数据保留支持、API 密钥预算等功能。
AI Gateway 反映提供商的定价,没有加价,并且在推理时(包括 Bring Your Own Key (BYOK) 请求)不收取平台费用。
在模型游乐场中尝试 GLM 5.2 Fast。
AI Gateway:按使用情况跟踪顶级 AI 模型
AI Gateway 模型排行榜跟踪随时间变化的最受欢迎模型,按所有 Gateway 流量中处理的总令牌量进行排名。
查看排行榜