Interconnects AI

Kimi K3: The open-weights escalation

8.5内容质量
Kimi K3: The open-weights escalation

TL;DR · AI 摘要

Kimi K3开放权重可能缩小中美AI模型性能差距至3-5个月,展现中国模型的前沿竞争力。

核心要点

  • Kimi K3是2.8T参数MoE模型,性能接近美国前沿模型Claude Fable和GPT-5.6
  • 中国模型与美国模型的性能差距从6-9个月缩短至3-5个月
  • Moonshot AI用更少资源实现与Anthropic、OpenAI同等技术水平

结构提纲

按章节快速跳转。

  1. Moonshot AI于7月16日发布Kimi K3模型,计划7月27日开放权重。

  2. Kimi K3在多个榜单排名前列,展现接近美国前沿模型的性能。

  3. 中国模型通过数据、算法等多维度优化缩小与美国的差距。

  4. 开放权重可能改变AI生态格局,加速技术扩散。

  5. Moonshot团队的创新文化是技术突破的重要驱动力。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Kimi K3开放权重的影响
    • 模型性能
      • 2.8T参数MoE架构
      • 多榜单前列表现
    • 中美竞争
      • 性能差距缩短至3-5个月
      • 资源效率优势
    • 技术启示
      • 数据/算法/架构协同优化
      • 团队文化驱动创新

金句 / Highlights

值得收藏与分享的关键句。

#AI模型#Moonshot AI#中美AI竞争#开放权重
打开原文

Kimi K3:开放权重的升级 - Nathan Lambert

Kimi K3:开放权重的升级

对人工智能生态系统全球影响的思考

Nathan Lambert

2026年7月20日

文章配音

0:00

-20:03

您的浏览器不支持音频播放,请升级浏览器。

7月16日星期四,Moonshot AI发布了其最新的旗舰模型Kimi K3。K3是一款2.8万亿参数的混合专家模型,其权重将于7月27日开放。本文在假设Moonshot AI兑现开放权重承诺的前提下,对生态系统的现状进行了反思。这是一种更为极端的平衡视角,如果中国拥有同样强大但封闭的模型(即K3从未开放),许多结论将趋于中间立场。

关键事实是,无论是开放模型与封闭模型之间,还是美国模型与中国模型之间的性能差距,都已从争论中的6-9个月缩短至3-5个月。

从发布材料来看,K3是一款真正的前沿模型。自DeepSeek R1以来,这是开放模型距离前沿最近的一次。DeepSeek R1的情况有所不同,当时是一家中国实验室迅速转向推理模型,并比许多美国公司更快地发布了模型。而Kimi K3则体现了中国实验室在已知领域扩展的执行力:数据、算法、架构、工具、环境等。

在Vals AI指数中,Kimi K3总体排名第2;在Artificial Analysis的智能指数中,总体排名第3(仅落后于Claude Fable和GPT-5.6 Sol Max,且成本更低);在前端代码竞技场中,总体排名第1;还有更多令人印象深刻的表现。Moonshot AI凭借远少于AnthropicOpenAI的资源,正与这两家公司展开激烈竞争。

显然,这是有史以来最强的开放模型。从该模型的表现来看,如果美国封闭前沿模型通过对抗性蒸馏对K3有所贡献,这种贡献最多只是相对较小的程度。那些曾关注蒸馏恐慌并得出错误结论(认为中国AI实验室只能通过知识产权盗窃生产优质模型)的AI观察者,将意识到一个事实:中国公司与领先的美国公司一样,同样擅长构建模型。Moonshot AI正在解决OpenAI或Anthropic团队所解决的许多相同问题。我确信将会有更多关于蒸馏的讨论和压力,但现有证据已表明,中国公司能够做到的远不止快速跟进。

在我访问中国期间,与Kimi团队的一些核心成员交流后,我清楚地看到他们拥有令人难以置信的文化氛围,甚至可以说是一种独特的气质,同时在GPU资源有限的环境下仍保有表达自由。在模型构建高度依赖扩展能力的领域,构建优质模型的能力仍取决于个人执行力、动机和表达。在访问过他们之后,这一结果并不令人意外。在访问过许多AI公司后,很少有公司能像他们这样立即展现出如此鲜明的文化特色。

同时,中国在人工智能领域的应用趋势起步时间晚于美国。因此,虽然中国实验室的计算资源远少于美国同行,但这些资源中更多的部分可以用于模型训练。当我开玩笑地提到OpenAI平均研究人员可能拥有的计算资源(比如几千台H100等效机器)时,Kimi团队的研究人员感到非常震惊。Kimi模型的组织架构和构建方法显然反映了这种差异,但要在没有大量专有信息的情况下明确说明这种差异的具体表现,是非常困难的。

当前顶尖模型性能的状况大致如下:

  • Anthropic – Claude Fable 5
  • OpenAI – GPT 5.6 Sol
  • Moonshot AI – Kimi K3(开源权重*)
  • SpaceXAI – Grok 4.5
  • Zhipu(Z.ai)– GLM 5.2(开源权重)
  • Meta – Muse Spark 1.1
  • DeepMind – Gemini Flash 3.5
  • Alibaba – Qwen 3.7 Max(3.8版本已宣布,写作时将开源权重)

看到DeepMind及其他一些美国科技巨头目前处于这样的位置,令人感到惊讶。在很多方面,X AI团队应获得更多认可。Artificial Analysis提供的视觉总结如下:

此次发布及其他近期事件已导致在开源与闭源模型平衡中可能结果的走向发生重大转变。我将逐一分析这些变化。

在很多方面,这感觉像是一个新时代的开始。一个竞争更加激烈,但同时对全球范围内部署强大技术的协调需求也更高的时代。

1. 中国重申对开源人工智能的承诺——对短期风险有不同解读

许多人在最近才开始关注中国的AI领域,因此他们可能得出结论,认为公开发布模型是中国的核心战略。实际上,我认为大多数实验室的核心战略更接近Anthropic或OpenAI——构建尽可能强大的智能系统。通过多年跟踪和与中国的实验室互动,我认为他们最初选择公开发布模型的最佳解释是出于实际考虑。他们需要公开发布模型以获得采用、关注和反馈(尤其是在高价值的湾区市场)。

长期以来,中国在政策层面几乎没有明确说明开源AI的作用以及可能的“国家级战略”。据我所知,没有高级领导人曾公开评论过开源AI。这一局面本周也发生了变化,习近平主席在世界人工智能大会(WAIC)上发表主题演讲,并明确表示将中国的AI生态系统未来承诺给开源和全球传播。这一承诺与目前发布的最强开源权重模型的宣布发生在同一周,这标志着现代AI早期历史上的一个明确里程碑。

这一承诺出现在中国AI产业讨论多种潜在发展路径的时期——他们是否会保持开放?他们能否在扩展规模方面跟上美国实验室的步伐?中国是否存在日益增长的收入市场?在这些议题中,关注点一直集中在中国的风险容忍度、公司变现能力,以及任何可能促使公司停止公开发布最佳模型的相关原因。

通过将习近平主席的承诺与一个非常强大的模型发布时间相联系,中国隐含地表达了其对发布开源权重模型的风险容忍度。目前来看,这表明中国对诸如强大的网络安全能力(或生物危害)等议题的潜在风险有特定解读。

最简单的解释是,中国政府显然在密切关注模型可能带来的风险——其技术监管范围可能比美国政府的氛围监管更广泛——如果评估到风险,他们将采取行动。简单来说,他们认为当前的前沿模型并没有实质性的风险。

同时,中国的经济决策者认为采用人工智能是件好事,这样他们之后可以在该行业获利——通过扩大市场分布(正如中国在过去几十年在汽车、太阳能、先进制造等多个领域所做的一样)。

在经历了数月对Claude Mythos模型的炒作和恐慌宣传的美国AI媒体环境中,这些观点可能显得有些令人震惊。这种惊讶恰恰是绝佳的基础——全球并不完全认同我们在美国听到的关于AI的叙事。

2. 开放模型作为前沿实验室的经济阿喀琉斯之踵

许多引导AI讨论的叙述者有明确的动机,即降低人们对最佳开放AI模型能力的感知。Dean Ball——他个人支持开放模型,但目前在OpenAI工作——曾发表过一篇广受评论的帖子,其中对Kimi进行了反思,并对开放模型发表了以下看法。理解这一观点非常重要,因为它聚焦于开放模型在AI建设经济层面的作用。Dean表示:

开放权重模型本质上属于减速主义,我始终对所谓的“加速主义者”对开放权重模型如此兴奋感到惊讶。

解释为什么开放权重模型是一种减速主义,对于理解即将到来的世界秩序至关重要。他确实是对的。

从经济角度而言,开放模型对前沿实验室来说是减速主义的,这将减缓AI领域的净投资和资本支出部署。这是因为强大的开放权重AI模型大幅降低了封闭实验室的利润潜力。这会产生两个影响。首先,AI实验室用于未来模型再投资的利润更少。其次,市场会认为这些公司的终端价值较低,因此未来融资轮次将受阻。这些因素共同作用将延缓最具变革性的AI模型的出现时间,但我并不认为这些影响足够强大到阻止OpenAI和Anthropic成为全球估值最高的公司之一。

对我来说,这些是社会的净收益。因为开放权重模型通过将智能的入门价格设定在某个性能水平,从而加速AI在经济中的扩散。开放模型还鼓励定制化。问题是,这种扩散本质上比前沿AI实验室的产品要慢得多,因为后者销售的是直接由开发者使用的工具。开放模型的潜力在于几乎每家企业都可以利用它们来构建特定领域的智能体。这种经济扩散需要极其漫长的时间!我曾将这种现象描述为开放权重模型起步较慢,但可能具有更大的指数级增长潜力。问题是,如果封闭模型在原始能力上过于领先,这种定制化的能力可能变得无关紧要。

The combination of increased diffusion and decreased concentration of power in the AI labs I see to be very positive for the AI transition. It gives us more time to figure out the hard problems of new capabilities and lets more stakeholders impact the story – any one company is very likely to have issues with controlling the world’s most important technology safely.

It is, of course, important to me in this world for the best models to still be made by the U.S. companies, which will allow the US to control the trajectory of the technology and its values. I also expect this to be the case, as the U.S. has larger capital markets that are willing to invest in AI (and a growing share of profits), but it is not a given.

Interconnects AI is a reader-supported publication. Consider becoming a subscriber.

3. China’s efficiency advantage

Kimi’s launch blog has some technical details that confirm the sort of improvements that are supplying the consistent model improvements we feel. To select one:

Kimi K3 is built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes), two architectural updates designed to improve how information flows across sequence length and model depth. We have also scaled up Mixture of Experts (MoE) sparsity, effectively activating 16 out of 896 experts when paired with a Stable LatentMoE framework. Together with refined training and data recipes, these structural changes yield an approximate 2.5× improvement in overall scaling efficiency compared to Kimi K2 , allowing the model to convert compute into intelligence more effectively.

Training efficiency really adds up. They will result in continued, incredible steps for the models.

As an aside, tracing the path of this particular innovation through the ecosystem is an interesting example. Kimi Delta Attention (KDA) was introduced in the Kimi Linear paper , which is similar to the Gated DeltaNet used for Olmo Hybrid (my last Olmo model while at Ai2). Qwen’s latest models switched to a related architecture and the recent Nemotron models also are hybrid (but still closer to Mamba than Gated DeltaNet). It’s awesome to see new architecture ideas like these, which were heavily progressed by academia, get so quickly translated into frontier-scale models. Gated Delta Networks were introduced in late 2024, building on ideas from Mamba. By mid 2026, they’re in frontier models.

I chose to focus on this example, partially because the Kimi team put a cool number to innovations between models, but primarily to give space to a broader discussion of China’s resource efficiency.

It is becoming clear that the Chinese labs are far more capital efficient. In a world where scaling laws dictate that intelligence is proportional to effective capital – which buys compute, data, & talent – that may be the greatest strength your AI industry could ever have. There are many possible explanations for why this is the case, such as Chinese researchers being paid less while being more effective at LLM research puzzles, but we will probably never get such specific reasons.

自我撰写关于中国的技术笔记以来,我听到越来越多关于中国新兴数据产业的消息(尽管其预算远不及Anthropic用于数据的十亿美元级规模),并且了解到中国实验室通过规避出口管制获得了有意义的训练算力。中国公司目前的推理需求并不像美国同行那样迫切(直到最近,Moonshot AI不得不暂停新订阅以控制其K3模型的访问量——而该模型的API服务仍在运行),因此它们的算力可以更多地用于训练。这些领域对实验室能力的真实情况有重大影响,但我们对这些领域的了解非常有限。

现实情况是,这些中国实验室所筹集的资本规模比美国AI生态系统任何细分领域都小几个数量级。最直接的对比对象是OpenAI和Anthropic,它们的公开模型表现略好一些。而Google和Meta等公司虽然拥有历史上最大的现金流,却在模型构建方面相对滞后。至于美国的新兴实验室,竞争形势更加激烈——Thinking Machines最近发布了他们的首个模型Inkling,该模型表现强劲,但与Kimi K3不在同一量级。

这些资源更充足的美国公司仍有可能迎头赶上,但必须高度重视我们对模型质量的公开评估,而非寄托于希望——希望往往反映了认知偏差。如果中国实验室确实拥有潜在优势,他们可能继续利用这一优势构建比所有竞争对手都更强的模型!许多结果都是可能的,K3的出现应显著提高多数人对中国在AI能力领域短期内全面领先的概率判断——即使这并非最可能的预测结果。

资本效率的大幅提升很可能源于方法论差异:美国实验室正在投入大量精力以戏剧性、跨越式的方式推动前沿突破,而中国实验室则更专注于追赶——这种追赶成本更低。正如学生模型在知识蒸馏中通常能超越教师模型(不仅限于中国实验室的对抗蒸馏),"追赶"的策略可能比"开创下一个范式"的策略更能产生强大的模型。

4. 不断壮大的前沿开源模型生态系统

Kimi K3发布后的那个周末,在撰写本文并广泛讨论相关事件时,阿里巴巴宣布即将推出2.4万亿参数的Qwen 3.8模型,并将开放权重。历史上,阿里巴巴一直通过其云业务将最大模型作为API-only服务提供,因此这一举措标志着又一个重大转变,为开源模型经济的新篇章打开了大门。即使该模型在基准测试中落后于Kimi K3,这也表明中国公司可能不仅在维持其开源模型战略现状,还可能进一步加大投入。

如果Qwen 3.8模型很快发布(即在下一次Gemini模型发布之前),它可能将Google在"拥有最聪明模型的实验室"排行榜上的位置推至第八名——这个榜单上中国公司正在不断攀升。还有其他传闻称将很快出现更多强大的中国模型,DeepSeek V4预计也将结束其"预览版"阶段。

留言评论

5. 一个长期开源权重政策故事的开端

我认为如果Claude Mythos今天以开源权重模型的形式发布,其带来的负面影响将相对较小。尽管这一观点颇具挑战性(因为我们对公共网络安全评估的了解非常有限,且AI生态系统本身复杂,同时我信任Anthropic的许多人),但我仍然坚持这一立场。这些风险被夸大了。

问题在于,对于最强的AI模型来说,这种情况不会一直持续。更强的模型即将到来,随之而来的风险也会增加,因此,让最先进的模型在类似开源权重模型发布数月前以受控、封闭的方式进行访问,这将是一个极其安全的平衡状态。

用户能够高度控制的开源权重模型将始终存在——你无法有效禁止数字产品,尤其是来自恶意行为者的数字产品——因为全球AI训练的可访问性已证明比许多分析师预期的要持久得多。

然而,当我写下这些文字时,美国政府仍在考虑更多限制开源权重模型的措施。最新动态来自Axios:

背后情况:据Axios报道,美国商务部去年曾考虑将多家中国AI实验室加入其“实体清单”,这将有效切断美国在未获得许可的情况下对其的访问。一位接近政府的消息人士透露,国家安全局和白宫国家网络主任办公室去年也考虑发布有关中国AI实验室威胁的警告,实际上劝阻美国公司使用其技术。该消息人士还补充说,白宫曾考虑实施一项行政命令,规定美国公司只有在能够保证安全并承担泄露责任的情况下,才能托管中国模型。据另一位接近政府的消息人士称,商务部去年夏天还在政府内部传播了利用其职权以确保国内供应链安全、针对中国开源模型的草案规则。

这将使美国陷入非常不对称的境地:美国最优秀的模型在网络安全任务上设有防护措施,但全球行为者却可以访问强大的中国开源权重模型来探测我们的防御。这是许多例子之一,禁止开源权重模型不仅损害了AI的自由市场,还会在短期内使生态系统更加不安全。还有其他非常糟糕的后果,例如减缓AI应用和AI研究的扩散,正如我之前讨论的那样。

这些平衡状态非常难以维持,尤其是当AI工具加速模型进步时,但保持开放与封闭之间的现状至关重要。一个真正独占前沿能力的模型(例如Mythos发布时的情况)如果同时是开源权重模型,那么在我们进入能力未知领域时将带来严重风险。模型的进步将非常迅速,而对其总体能力的衡量也变得越来越困难。

因此,我们陷入了一个世界:我们试图在开放模型上找到平衡点。不希望如此强大的能力在全球瞬间扩散是合理的,但与此同时,模型的开发者有动力夸大其能力,而竞争对手则有动力夸大其风险。最终,一切都归结于对风险向量的谨慎测量和主动加固社会应对能力。

This careening train of policy debates, model releases, and raucous reactions is only going to continue from today. We’ve been on a train of rapid progress, where all the key ideas of how AI should play out are tested, since the release of Claude Opus 4.5 last December, which sent us down the agentic pathway. The key to making good decisions here is evaluation capabilities , independent of the companies with the largest financial stakes. One of many actions needed then, as we enter the AGI era of AI governance , is an Operation Warp Speed style approach of bootstrapping state capacity (and other independent actors) that can evaluate models accurately, and study emerging risks.

Conclusion: The wake-up call

Open-weight models, by accelerating the diffusion of capabilities, are a massive escalation in the good and the potential bad of AI. For now, the bad side of frontier language models has been largely hypothetical, but that will not always remain the case.

Having open weight models be slightly behind the closed frontier is our natural buffer to mitigate the risks. The key point is that we must collectively act to mitigate potential harms as they appear, and whether open-weight models are 3 or 6 or 9 months behind, that is still a very short timeline. If we regulate open-weight models heavy-handedly, I suspect much of the world will be lulled into thinking we no longer need to act. All we would’ve done is slightly delayed the inevitable — open models will continue to cross all the key capability thresholds eventually and regardless of legality.

Understanding and benefiting from this open-closed dance must be a collective action from the AI community across all sectors of power and influence over the coming years.

Kimi K3 is a watershed moment because frontier open-weight models are now real. Many hypotheses will be tested on where risks of open-weight models truly land — I suspect it’ll be narrower than many expect, and many risks of AI will still be proliferated by closed and “safer” APIs. The evaluation of these risks will evolve in time with an acceleration of AI’s integration in our economy. We cannot get one without the other, and we will continue to get both.

With this, 2025 was when open models started to be taken more seriously — especially when China leaped ahead with such a clear lead — as people realized that it would not be a unipolar world, with only American, closed AI labs determining the trajectory. 2026 is when those previously discussed, potential risks and accelerations due to truly frontier, open-weight models landed.

A large portion of the response was for the fourth bullet, which compared the inevitable outcome of open models to AI communism, which I think missed the mark. Specifically, the use of the word communism without explanation caused much of the blowback.

Previous

Next