How Open-Weight Models Changed the AI Landscape

TL;DR · AI 摘要
开源权重模型推动了AI领域内的快速协作与创新,但文章信息密度较低,缺乏深入的技术细节。
核心要点
- 开源权重模型允许不同团队共享训练参数,促进AI领域协作。
- DeepSeek、Moonshot AI和Zhipu AI通过开源权重模型实现了技术迭代。
- 开源权重模型与开源代码不同,通常不公开训练数据和代码。
结构提纲
按章节快速跳转。
- §引言
文章讨论了开源权重模型如何改变AI领域的发展格局。
开源权重模型允许用户下载和使用训练参数,但通常不公开训练数据和代码。
DeepSeek、Moonshot AI和Zhipu AI通过开源权重模型实现了技术迭代。
开源权重模型促进了AI领域的快速协作与创新。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开源权重模型的影响
- 定义
- 允许下载和使用训练参数
- 不公开训练数据和代码
- 案例
- DeepSeek
- Moonshot AI
- Zhipu AI
- 影响
- 促进AI领域协作
- 推动技术迭代
金句 / Highlights
值得收藏与分享的关键句。
开源权重模型允许不同团队共享训练参数,促进AI领域协作。
DeepSeek、Moonshot AI和Zhipu AI通过开源权重模型实现了技术迭代。
开源权重模型与开源代码不同,通常不公开训练数据和代码。
开放权重模型如何改变人工智能格局
ByteByteGo
2026年6月16日
2026年现实世界中DevSecOps的5个事实(赞助)
Datadog分析了数以万计的生产应用程序,揭示了风险实际出现的位置以及这对今天处理安全问题的团队意味着什么。下载完整报告,深入了解关键发现,包括:
- 为什么87%的组织在生产环境中存在可被利用的漏洞,以及为什么生命周期结束的运行时和过时的依赖项在悄然推动这一数字
- 如何通过专注于对业务构成实际风险的漏洞,将警报噪音减少80%
- 为什么第一天的库、AMI和Docker镜像更新存在隐藏的危险,以及供应链攻击是如何利用它们的
获取报告
2024年12月,一家名为DeepSeek的人工智能实验室发布了一个6710亿参数的语言模型,并附有一份技术报告,详细描述了他们是如何构建这个模型的。六个月后,另一支名为Moonshot AI的团队以此报告为起点。他们将设计扩展到了万亿参数,遇到了在该规模下出现的训练不稳定性问题,发明了一种新的优化器来解决这个问题,并发布了他们自己的模型。八个月后,第三支名为Zhipu AI的团队将DeepSeek的另一项创新整合到了他们的架构中,并贡献了他们自己的训练框架。
这三支团队隶属于不同的组织。然而,他们通过公开的模型发布间接地进行了合作,每家公司都从其前驱所做的工作中学习。这种合作之所以成为可能,是因为开放权重模型的兴起,即使竞争对手也可以从彼此身上学习。过去十八个月中,这种类型的合作速度发生了变化,而变化的原因可以追溯到这些团队在公开环境中所做的架构和训练选择。
在本文中,我们将探讨开放权重模型如何改变了人工智能领域。
免责声明:本文基于来自各种来源的公开信息。如果您发现任何不准确之处,请在评论中指出。
开放权重与封闭权重
每个现代大型语言模型背后都有两件重要的事情:
- 第一个是训练参数,这些参数是模型在训练过程中学习到的数字,通常有数百亿个。这些参数是让模型“知道”事物的关键。
- 第二个是产生这些参数的一切内容,包括训练数据和训练代码。
封闭权重模型是公司通过API进行保护的模型。用户将一些文本发送到官方API端点,公司的服务器在他们的硬件上运行模型,然后返回一个响应。参数保留在组织内部,在个人硬件上运行模型或为特定任务进行调整仍然是遥不可及的。
开放权重模型是公司发布了训练参数的模型。任何人都可以下载这些参数,在自己的硬件上运行模型,并根据自己的数据进行调整。然而,训练数据和完整的训练代码通常仍然保持私有。
之所以使用“开放权重”而不是“开源”这一术语,原因就在于此。
在传统软件中,“开源”意味着完整的源代码可供检查和复制。目前市场上大多数被宣传为开源的AI模型实际上只是“开放权重”,即训练好的模型是公开的,但产生该模型的过程仍然是封闭的。这一区别非常重要,因为发布的权重,配合详细的的技术报告,才使得其他团队能够研究其设计并在此基础上进行开发。
不同的开放权重模型使用不同的许可证,从非常宽松的MIT和Apache 2.0许可证到带有特定商业限制的自定义许可证,因此生态系统中的实际自由程度各不相同。
请看下图,它显示了访问封闭权重模型和开放权重模型之间的区别:
MoE 架构
2025 年和 2026 年发布的每一大型开放权重 LLM 都共享相同的架构骨架。它被称为“专家混合”变压器,简称 MoE。
现代 LLM 由堆叠的“块”构建而成。每个块有两个主要部分:一个注意力层,用于确定哪些先前的词对下一个词重要;以及一个前馈层,用于执行实际的计算。
在常规(“密集”)模型中,每个参数都会对模型处理的每个词激活。通过添加更多参数来创建更智能的模型意味着运行成本会随着参数数量线性增长。当参数数量达到数百亿时,这变得不切实际。
MoE 通过将每个块中的单个前馈层替换为多个较小的“专家”子网络,以及一个小型的路由组件来解决这个问题,该组件会为每个词选择使用哪些专家。该模型可以在许多专家之间存储知识,但每个词只需计算其中的几个。
这就是为什么每个 MoE 模型的两个数字很重要:
- 第一个是总参数,它代表模型的完整内存占用和知识容量。
- 第二个是激活参数,它代表模型在每个词上实际进行计算的部分。激活参数决定了推理速度和每个查询的成本。
例如,DeepSeek V3 总共有 6710 亿个参数,但每个词只有 370 亿个激活参数。Kimi K2 总共有 10000 亿个参数,但每个词有 320 亿个激活参数。Qwen3 总共有 2350 亿个参数,每个词有 220 亿个激活参数。在比较运行这些模型的成本时,激活参数的数量才是关键,而不是总参数数量。如果两个模型的激活参数数量相似,一个拥有 10000 亿参数的模型和一个拥有 2350 亿参数的模型,其每个查询的成本大致相同。
请看下图,它显示了 MoE 块是如何工作的:
初学者通常认为 MoE 中的专家是按主题专门化的,例如有数学专家、代码专家等。但实际情况与这种画面不同。路由器是根据每个词选择专家,而不是根据每个问题,专家专门化的模式大多超出人类的理解。路由是细粒度的,生成句子时,单个句子会通过许多不同的专家组合。
MoE 架构解释了为什么每个前沿的开放权重团队都在使用大致相同的方法。有趣的不同之处在于团队在该设计方法内部所做的设计选择,而这些选择最明显地体现在三个地方。
将 AI 代理从游乐场带入生产环境的技巧(赞助)
每家组织都在探索如何采用 AI 代理或 MCP 服务器,但其中有多少已经投入生产?
如果这些模型尚未投入生产,那么身份验证、访问控制和代理身份问题的可能性有多大?
观看 Descope 提供的按需网络研讨会,了解以下内容:
- 实际的 MCP 和代理 AI 应用案例
- 阻止模型投入生产的身份挑战
- 构建安全、可扩展的 AI 代理和 MCP 服务器的实用建议
[观看网络研讨会](#)
注意力策略
第一个差异点在于团队如何处理注意力机制。
每次模型生成一个词时,它都会回顾对话中的每一个先前词,以确定接下来应该生成什么。为了避免在每一步都重新计算这种回顾,模型会缓存之前词的信息。这种缓存被称为 KV 缓存(“keys and values” 的缩写),随着对话的延长,缓存也会增长。对于长对话,KV 缓存会成为主要的内存瓶颈。
目前出现了三种不同的管理策略:
- Grouped-Query Attention (GQA):在注意力头组之间共享缓存信息,从而在实现相对简单的前提下减少内存使用。Qwen3 和 Llama 4 都使用了 GQA。在三种策略中,GQA 最容易实现,也是业界最广泛采用的。
- Multi-Head Latent Attention (MLA):在存储前将缓存信息压缩成更小的潜在表示,然后在模型需要使用时再进行解压缩。MLA 由 DeepSeek 引入,并被 Kimi K2 采用。与 GQA 相比,MLA 节省了更多内存,但增加了压缩和解压缩步骤的计算开销。
- Sparse Attention:只选择最相关的先前词进行关注,而不是关注所有词。DeepSeek 在 V3.2 中引入了他们自己的版本,称为 DeepSeek Sparse Attention,随后 Zhipu AI 的 GLM-5 也采用了该策略。当上下文非常长时,Sparse Attention 最有用,因为关注所有词会变得昂贵,但需要精心设计以避免跳过重要词。
每种策略的选择取决于团队优化的目标,无论是工程的简洁性、内存效率还是上下文长度。
下面的图表展示了这三种注意力策略并排对比:
专家数量和稀疏性
团队之间的第二个分歧点在于他们使用 MoE 模式(Mixture of Experts)的激进程度。
在 2025 年和 2026 年发布的主流开源模型中,专家数量从 16 到 384 不等。这种较大的范围反映了业界对稀疏性推进程度的真正分歧。
在固定的计算预算下,增加专家数量可以降低训练和验证损失,这意味着模型在相同计算量下能学习得更好。但代价是内存。更多的专家意味着需要驻留在内存中的总参数数量更多,即使每个词只激活少数几个专家。Kimi K2 的万亿级总参数无论每个词激活多少专家,都需要多 GPU 集群,而 Llama 4 Scout 的 1090 亿总参数可以运行在单个高内存服务器上。两者属于同一架构家族,但部署现实情况存在显著差异。
关于是否应包含一个“共享专家”(shared expert),该专家处理每个单词并提供一个基础能力下限,也存在分歧。DeepSeek V3、Llama 4 和 Kimi K2 都包含了这样的共享专家。Qwen3 在其之前的 Qwen2.5-MoE 中使用过共享专家,但在最新版本中去掉了,而他们的技术报告并未说明原因。目前在该领域对共享专家的共识仍然难以达成,这一点值得指出,因为初学者通常会假设在资源充足的实验室中,技术问题已经解决。实际上,许多问题仍然存在开放性。
Llama 4 采取了一种特别独特的方法。它并没有让模型的每一层都成为 MoE 层,而是交替使用密集层和 MoE 层。同时,Llama 4 将每个单词路由到一个单独的专家和共享专家,而不是像 DeepSeek V3 那样路由到八个专家。这样每个单词激活的专家数量减少,但每个专家的规模更大,这代表了与该领域其他模型不同的架构选择。
下面的图表展示了这些模型中专家数量的变化情况:
训练方法
团队之间在训练方法上也存在第三个分歧点。
模型的行为由两部分组成:架构是一部分,训练是另一部分,而近年来,训练部分已成为更具意义的差异所在。
预训练是模型学习在数万亿个文本标记中预测下一个单词的过程。预训练赋予模型对语言和世界的基本知识。不同团队在训练规模上有所不同,DeepSeek V3 在 14.8 万亿个标记上进行训练,而 Qwen3 则训练到了 36 万亿个标记。然而,总体的训练方法在各团队之间仍然相似。
后训练是预训练之后发生的一切,目前模型在后训练阶段的差异最大。这里有三种技术值得关注。
- 第一种是使用可验证奖励的强化学习。模型生成一个输出,然后检查该输出是否符合目标正确性。代码是否编译成功?数学问题的答案是否正确?模型会因正确输出而获得奖励,并调整以避免错误输出。这正是 DeepSeek R1 取得突破的关键,其部分方法已被开放权重生态系统广泛采用。
- 第二种是知识蒸馏。一个非常大的“教师”模型被训练,然后其输出用于训练较小的“学生”模型。Llama 4 在预训练期间与一个名为 Behemoth 的 2 万亿参数教师模型共同进行知识蒸馏。Qwen3 则从其旗舰模型蒸馏到家族中的较小模型。
- 第三种是合成代理数据。团队构建了加载真实工具(如 API、shell 和数据库)的模拟环境,并奖励模型在这些环境中完成任务。Kimi K2 的技术报告描述了一个大规模的流水线,用于在模拟和现实世界环境中生成工具使用演示。
除了这些技术之外,训练基础设施本身也已成为一项重要的贡献。近期生态系统中有两个例子尤为突出。
- MuonClip:Kimi K2 团队开发了这个优化器,因为他们在万亿参数级别的训练中遇到了不稳定性。使用 MuonClip 后,他们在 15.5 万亿个标记上进行训练,期间没有出现任何损失峰值。
- Slime:智谱 AI 构建了这个异步强化学习框架,以提高训练吞吐量,从而在相同的计算预算下允许进行更多的训练迭代。
这两方面的贡献可能在生态系统中比任何特定的架构选择都更具可重用性。架构正在趋于一致,而训练现在是各团队进行差异化尝试的地方。
请看下图,它展示了这些训练方法在整个流程中的位置:
借鉴与构建模式
当将这三种方法放在一起观察时,会发现它们都遵循一种模式。
- DeepSeek V2 引入了 MLA。
- DeepSeek V3 保留了 MLA,并改进了 MoE 设计,训练该模型的花费约为 550 万美元,使用了 14.8 万亿个 token。
- Moonshot AI 的 Kimi K2 以 DeepSeek V3 为起点,将设计扩展到万亿参数级别,并在扩展过程中发现了新的训练不稳定性,从而贡献了 MuonClip。
- DeepSeek V3.2 引入了稀疏注意力机制。
- Zhipu AI 的 GLM-5 采用了这种稀疏注意力机制,并在训练后阶段贡献了一个新的框架 Slime。
每个团队都基于前一个团队发布的创新进行构建,同时又为下一个团队提供了可以继续构建的内容。这些创新都依赖于公开的权重和详细的技术报告。
请看下图,它展示了过去十八个月中创新如何在各团队之间传播:
这是一个关于开放权重生态系统的观察,而不是对开放权重“获胜”或封闭权重团队落后做出的判断。封闭权重团队正在从事不同的工作,针对不同的目标进行优化,许多创新出于选择而保持私有。然而,开放权重生态系统却产生了一种此前规模较小的技术对话。
结论
这里提到的具体模型可能在几个月内就会被超越。然而,阅读这些模型的框架很可能仍然适用。
现代开放权重的大型语言模型共享一个共同的骨架,即 MoE 变换器,其中总参数和激活参数代表了两种不同的成本。在这一骨架中,团队在三个地方进行差异化尝试:
- 第一个是注意力策略,选择 GQA、MLA 或稀疏注意力。
- 第二个是使用稀疏性的程度,从 16 个专家到 384 个专家不等。
- 第三个是训练后的方法,借鉴强化学习、蒸馏、合成代理数据或新型训练基础设施。
模型发布的许可证决定了团队和个人实际上可以对模型做什么,而“开放权重”在技术上仍然比传统的开源概念更狭窄。
这一阶段人工智能工程中最有趣的进展,是开放权重模型通过其发布的设计所激发的创新。
参考资料
- DeepSeek V3 技术报告
- DeepSeek V2 技术报告(引入 MLA)
- Kimi K2 技术报告
- Qwen3 技术报告
- Llama 4 宣布(Meta)
- GLM-5 模型卡片和详细技术信息(Z.ai)
- DeepSeek-R1 技术报告
- DeepSeek V3.2(稀疏注意力)宣布