Interconnects AI

GLM-5.3: How Chinese labs keep stride with the frontier

8.5内容质量
GLM-5.3: How Chinese labs keep stride with the frontier

TL;DR · AI 摘要

Z.ai发布的GLM-5.3模型在多个基准测试中超越国际竞品,仅用750B参数实现领先性能,凸显中国实验室在后训练技术上的突破。

核心要点

  • GLM-5.3参数量仅为750B,却超越Kimi K3等参数量更大的模型
  • Z.ai通过后训练(post-training)实现性能突破,而非单纯扩大预训练规模
  • THUDM团队自2019年持续深耕,GLM系列已迭代至5.3版本

结构提纲

按章节快速跳转。

  1. Z.ai宣布GLM-5.3模型在多个基准测试中超越国际竞品。

  2. 750B参数的GLM-5.3性能接近Kimi K3(2300B参数)和GPT-5.6-Sol。

  3. Z.ai专注后训练优化,而Kimi侧重预训练阶段的模型规模扩展。

  4. THUDM团队自2019年持续迭代GLM系列,最新版本为GLM-5.3。

  5. 中国数据产业的成熟为模型训练提供了高质量数据支撑。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GLM-5.3技术突破
    • 模型性能
      • 超越Kimi K3/GPT-5.6-Sol
      • 750B参数效率
    • 技术路线
      • 后训练优化
      • 预训练vs微调平衡
    • 发展背景
      • THUDM团队积累
      • 中国数据产业支撑

金句 / Highlights

值得收藏与分享的关键句。

#GLM-5.3#模型训练#中国AI实验室#后训练技术
打开原文

##### 常规说明:我正在出差,因此无法为这篇文章录制语音。编辑——在发送邮件后,我添加了关于中国数据产业的第五个要点。

今天,Z.ai 宣布推出他们的GLM-5.3模型,目前仅在编程计划中提供,即将通过他们的API提供,并在两周后上线Hugging Face(开放权重)。该模型表现非常出色,得分有显著提升。在许多基准测试中,该模型已超越Moonshot AI的Kimi K3,在某些测试中甚至超过了Claude Fable 5或GPT-5.6-Sol。

Image 1
Image 1

以下是更完整的对比:

Image 2
Image 2

这使得该模型在智能编程基准测试中基本达到前沿水平,仅需约750B参数——仅为Kimi K3的三分之一!Z.ai的博文非常直白,开篇就提出一个大胆的声明:

我们对GLM-5.3所做的唯一改动就是扩大后训练规模。

GLM-5.3与GLM-5.2使用相同的基模型,但进行了大幅扩展的后训练。简单粗暴地说,与更侧重预训练的Kimi相比,Z.ai似乎在后训练方面有独特优势。此次发布后,引发了大量讨论:中国为何能如此迅速跟进?这样一个小型模型如何能与领先的美国公开模型相媲美?这些结果是否真实?

最简单的解释是Z.ai在他们擅长的领域非常专业——值得回顾的是,他们在这一系列模型上的研发时间比业内几乎所有公司都要长。以下是GLM模型的简要历史:

  • 智谱AI成立 – 2019年
  • GLM(通用语言模型)——2021年3月THUDM(清华大学数据挖掘/知识工程组)发布。权重

今年6月22日发布的GLM 5.2引发了广泛关注 – 发布数周后,我经常听到认识的AI研究人员仍在使用该模型,因其速度优势(部分团队在内部集群部署以获得比公开版本更快的性能)和简洁性(作为无回滚机制的模型,在前沿AI系统开发中更易用)。GLM-5.2完全经受住了市场期待。

我自己也曾经历过类似的否认过程,心想“他们是怎么做到的?这些模型肯定没有看起来那么好。”美国公司拥有显著的资源优势却无法在能力上拉开差距,这种反差令人困惑。普遍的答案是知识蒸馏,我曾撰文详细分析过这一技术,但我不认为这是主要因素。值得注意的是,最近有一篇论文展示了从前沿模型中提取推理轨迹的简单方法——这类技术中国实验室显然可以大规模应用。我困惑于为何美国实验室未能更快修复这一问题,反而转向政府寻求政策帮助。这在逻辑上说不通。

Z.ai的博客直言不讳,与以强化学习为主的训练体系相呼应。他们表示使用了“更多环境、更多样化的任务以及投入更多计算资源进行训练”。你无法简单地通过“蒸馏”来复制强化学习环境、大规模运行这些环境的基础设施,或有效混合这些环境的算法。

那么,如果中国实验室不是依赖蒸馏技术,他们是如何做到的?他们是否在进行benchmaxxing?benchmaxxing的公认定义是让模型过度关注测试集,导致实际表现与纸面成绩存在显著差异。决定性因素远比技术细节更宏观(当然,技术细节确实重要,但不同实验室之间的差异更难区分):

  1. Z.ai的发布周期可能只有几天,而非OpenAI或Anthropic的数月。 OpenAI和Anthropic的内部模型很可能远优于Z.ai和Moonshot AI。然而,这些美国公司通常需要数月时间才向公众发布模型,这种延迟在前沿领域的产品采用决策中大幅提升了中国实验室的竞争力。简单来说——中国实验室利用美国实验室在发布前进行测试所耗费的时间持续在基准测试上优化(SpaceXAI在此方面很可能与中国的实验室差距更小)。在进展如此迅速的当下,这很可能是中国实验室能保持前沿地位的最重要因素。迄今为止,这种策略对美国实验室来说在经济上仍是可接受的,因为他们的模型仍存在巨大需求。
  1. 是的,Z.ai 可能比 OpenAI 或 Anthropic 更在意公开基准测试表现。 这些基准测试,例如在人工分析智能指数(Artificial Analysis Intelligence Index)或类似聚合平台中取得高分,会直接影响其股价。在许多方面,他们需要这么做才能持续融资并维持团队士气,因为作为挑战美国巨头的顽强后起之秀是一个非常吸引人的故事。

微妙的基准测试优化并不一定源于绝望或类似压力,而是整个行业中大量实验室的行业标准。许多公司的数据获取策略是购买其在基准测试中落后的数据。

  1. Z.ai 并没有将 GLM-5.3 推到过热的程度(至少不是有意为之,他们也会检查这种情况)。目前每家实验室都在处理强化学习(RL)扩展的粗糙边缘。Anthropic 的 Opus 5 和 Sonnet 5 模型尽管在基准测试中表现惊人,但声誉却褒贬不一。整个行业都处于同一条船上,因此有些模型权重更容易使用,但他们在发布博客中提到的基准测试成绩是真实可靠的。
  1. GLM-5.3 很可能比 Claude Fable 或 GPT Sol 的能力范围更窄。 当 GPT-5.2 发布时,除了代理编码(agentic coding)之外,外界评价褒贬不一。同时,OpenAI 和 Anthropic 支持着大量拥有无数应用场景的大型企业。这是在采用曲线早期阶段作为公司的优势——你可以瞄准最有价值的应用场景。在后训练阶段,稍微少关注一些会大大简化最终模型的组装过程。

我稍微夸大了这一点,因为 Z.ai

据报道已实现10亿美元的年度经常性收入,这得益于其强大的本地部署业务。

****同样,旗舰 GLM 模型尚未具备视觉能力。作为纯文本模型,这显然有助于 Z.ai 获得更具竞争力的分数,但这也意味着竞争更加激烈。另一方面则是像 Inkling-Small 这样的模型,其设计目标是实现多模态能力。

  1. (新增) 强化学习数据行业在中国正在兴起。我们关注的许多来源和传闻渠道都提到,数据行业在中国正在蓬勃发展——这主要由美国数据公司向中国模型实验室销售推动。这可能表现为中国的实验室大量购买美国前沿实验室使用的相同强化学习环境,并更快推出下游强化学习模型。我们对这一市场的规模和影响仍存在较大不确定性,但可以肯定的是,它正在变得越来越重要。
  1. Z.ai 是一家极其擅长大语言模型(LLM)的组织——其计算效率很可能远超 OpenAI 或 Anthropic。 这一点必须再次强调。这家公司的技术团队非常出色。他们与清华大学有密切联系,而清华大学是众多顶尖中国计算机科学家的聚集地。这种丰富且充满热情的人才储备,对他们的成功至关重要,其重要性不亚于任何西方同行。

Image 3Image 4Image 5

来自我参观清华大学的经历。

总体来看,他们似乎正在通过 GLM 系列模型执行一项非常合理的战略。祝贺他们发布新模型!我期待模型权重的公开,以便进行更深入的测试(我通常使用像 Fireworks 或 Baseten 这样的美国开源权重推理服务)。

发表评论

这是经济领域强大网络能力普及的又一步。Z.ai 已经承认了这一点,表示

GLM-5.3 是我们迄今为止在网络安全任务中最强大的模型。它在漏洞发现、漏洞分析和复杂多步骤安全任务方面实现了显著改进。这些能力可以帮助防御者更早发现弱点、验证风险并加速修复。

它们也带来了明确的双重用途风险。因此,我们采取了分阶段的发布策略。选定的安全合作伙伴将首先在受控环境中评估 GLM-5.3。随后将提供更广泛的访问权限和 API 接口。一旦完成必要的安全评估和发布准备工作,我们将公布 GLM-5.3 的完整模型权重。

他们还承认正在通过请求分类器和推理链监控(在模型对齐的基础上)来监控平台上的推理过程。细节决定成败,目前尚不清楚每家 AI 实验室在执行层面能达到何种水平。能力扩散的程度取决于最低标准。

归根结底,当真正开源权重的模型出现时,这种安全措施几乎无关紧要。如果不是 GLM-5.3,也将会是其他模型。随着时间推移,具备这些能力的模型规模正在减小,变得更容易修改和部署(可能没有安全防护)。Z.ai 做了一些正确的事情,包括推动漏洞发现和主动管理,但任何单一公司都无法独自应对这一挑战。

我们需要政府或行业联盟主导的工业级指导,立即为这一转变做好准备,覆盖所有软件领域。