The Algorithmic Bridge

Moonshot is Chinese But Its AI Models Are From Another Planet

8.5内容质量
Moonshot is Chinese But Its AI Models Are From Another Planet

TL;DR · AI 摘要

Moonshot的Kimi K3模型达到美国前沿AI模型水平,可能改变全球AI格局。

核心要点

  • Kimi K3性能与Anthropic的Mythos/Fable及OpenAI的GPT-5.6相当。
  • 中国AI模型效率提升可能改变全球竞争格局。
  • 开源释放将加剧中美AI地缘政治博弈。

结构提纲

按章节快速跳转。

  1. 揭示MoonshotKimi K3模型突破性进展及其全球影响。

  2. Kimi K3在基准测试中达到美国顶级模型水平,效率成本比更优。

  3. 通过硬件限制下的效率优化实现性能跃升,验证中国AI研发能力。

  4. 模型开源可能迫使美国重新评估AI安全策略并加剧全球竞争。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Kimi K3模型突破
    • 性能表现
      • 对标GPT-5.6/Mythos
      • 效率成本比优势
    • 技术影响
      • 验证中国AI研发能力
      • 开源释放时间表
    • 地缘政治
      • 中美AI竞争升级
      • 美国监管策略调整

金句 / Highlights

值得收藏与分享的关键句。

#AI模型#开源#地缘政治#Moonshot
打开原文

Moonshot 是中国公司,但其 AI 模型来自另一个星球

OpenAI、Anthropic 和美国正陷入困境

Alberto Romero

2026 年 7 月 18 日

大家好,我是 Alberto!👋 每周,我会发布关于文化、哲学和商业的长篇 AI 分析。付费订阅者可在周一获取操作指南,周五获取新闻评论。如果你想成为付费订阅者,这里有按钮:

本周我正在休假,但特意抽出时间撰写这篇关于 Moonshot 的 Kimi K3 深度分析。Kimi K3 是首个达到美国前沿模型水平的中国 AI 模型,而且它是开源的。

Yutong Liu / Better Images of AI / Joining the Table / CC-BY 4.0

Moonshot 的 Kimi K3 是首个达到美国顶级前沿模型水平的中国开源模型。在某些领域,其性能与 AnthropicMythos/Fable 和 OpenAIGPT-5.6 相当。对于还记得 2025 年 1 月 DeepSeek 崛起的读者来说,这正是 Moonshot 的“DeepSeek 时刻”,但更令人震撼:专家曾估算中国与西方顶级 AI 模型之间存在 6 到 9 个月的差距。

现在,这个差距已缩短至零个月、零周、零天。1

DeepSeek 证明了即使在硬件严重受限的情况下,中国也能打造出比美国 AI 实验室更高效的开源模型,且性能损失极小。Moonshot 在此基础上进一步证明,中国可以利用这些受限条件下的效率优势,打造出与美国顶级 AI 实验室相当智能水平的开源模型。预计这将引发 AI 领域地缘政治讨论的强度和紧迫性显著上升(至少在 Moonshot 于 7 月 27 日公布模型权重后)。如果美国政府认为 Mythos 的威胁足以让西方盟友退出,那么当中国拥有 Mythos 同等级的模型时,它又会作何反应?一次糟糕的监管决策可能让全球领先于美国。

但在深入分析之前,让我们先客观回顾一下该模型的能力及其在前沿 AI 生态系统中的相对位置:为什么它会引起轰动?这是新的“DeepSeek 时刻”吗?它在整体性能上真的与美国最佳模型相当,还是仅在次要基准测试中表现优异?所有这些问题都可以归结为一个:Kimi K3 究竟有多强?

一、KIMI K3 究竟有多强?

首先需要关注的是其自报的性能数据。

来源:Moonshot

从能力角度看,K3 在多个基准测试中位列第一、第二或第三,且在编程和代理评估中展现出更优的性能成本比。它基本上比 Opus-4.8 和 GPT-5.5 高出一个层级,几乎与 Mythos/Fable 和 GPT-5.6 相当。这意味着,如果 Anthropic 或 OpenAI 出现一次失误,中国将可能成为全球主要的 AI 超级大国(除非在芯片和制造工艺方面存在明显劣势,而这些是 AI 模型的硬件基础;相关内容将在后文详细说明)。

当然,Moonshot 自身的表述可能存在夸大其词的动机。但独立分析师基本持相同观点。这并非 Moonshot 单方面美化其模型,而是行业普遍认知。以下是一些关于 Kimi K3 表现优异的简要汇总。

基准测试机构 Artificial Analysis 对比 Kimi K3 与 Anthropic 和 OpenAI 顶级模型(分别用蓝色、棕色和黑色表示)的分析:

来源:Artificial Analysis

Kimi K2.6 的能力与智能跃升显著。K3 仅略逊于近期发布的 Fable 和 GPT-5.6,且价格处于 GPT 的水平(Claude 更昂贵):“每项任务成本($0.94)与 GPT-5.6 Sol($1.04)相近,仅为 Opus 4.8($1.80)价格的一半。”根据 Artificial Analysis 的指标,Kimi K3 是 API 用户极具吸引力的模型(它是唯一一个进入 Artificial Analysis “最具吸引力象限”的前沿能力模型)。

总体而言,K3 在企业领域将是一个有趣的折中方案,因为它在较差的开源模型低廉价格与同级别封闭模型高昂价格之间找到了一个舒适的位置。

另一家基准测试公司 Arena 报告称,Kimi K3 在前端编码方面明显优于 Fable。这是 K3 能力首次引发病毒式传播的成果,但我认为这种宣传被严重夸大了,因为 Arena 的一个基准测试实际上几乎毫无意义。它只是增加了其他所有将 K3 评为非常出色水平的基准测试——“远优于 Fable”是一种不切实际的夸张。(下方病毒式传播图表的 x 轴在 1,450 处被截断,以使差异看起来更大。)

来源:Arena

我的意思是,我们既可以为技术竞争感到兴奋,也可以担心中国“领先”了,但一旦你看到下方“美国 vs 中国优势”图表中绿色的面积,你就会冷静下来。让我们不要让兴奋模糊了判断,导致分析变得糟糕。

事实上,K3 在 Arena 的整体文本排名中明显较低。

K3 的其他出色表现还包括:创意写作排名第一、Vercel 的 Next.js 代理基准测试排名第一、以及在长期软件工程基准测试 deepSWE 中排名第三。

来源:Towards AI

来源:Vercel

从基准测试中获得的整体印象——以及我阅读的评论(尽管是轶事,但增加了氛围)——是 Moonshot 对该模型的描述是准确的。它显然是一款前沿模型;这一点无可否认,中国已经追上了美国,但顶尖实验室——Anthropic 和 OpenAI——仍然略微领先。底线是,美国实验室再也无法享受与前沿模型之间的舒适差距了。

我们刚刚用“非常出色”回答了“Kimi K3 究竟有多好”这个问题,这直接引出了我们的第二个问题:

Kimi K3 为何如此出色?

二、Kimi K3 为何如此出色?

这是一个价值百万美元的问题。一个规模较小、资源受限的中国开源实验室,是如何与拥有巨额资金、资源丰富、政府宠儿般的美国实验室势均力敌的?为了回答这个看似更难且更出人意料的问题,我们需要考虑几个因素:规模、训练效率、算法进步和硬件限制。还有一些更不愉快的可能性:在中国 AI 领域,与美国不同,所有人都是“有罪”直到被证明“无罪”。Moonshot 是否从现有的美国模型中蒸馏出了知识?他们是否在基准测试中作弊,或者对模型进行了“benchmaxxing”?行业秘密是否泄露或扩散了?

让我们来看看。

A sneak peek at the positive response, which amounts to “Moonshot, like DeepSeek before them, seem clearly cut from a different cloth,” can be summed up this way: constraints breed creativity. Contrary to what it might seem, K3 is great because of Moonshot’s limitations as a small Chinese lab rather than despite them.

There are plenty of technical details in the blog post on Kimi K3 (thank you, open source). I don’t want to bother you with too much jargon, but a bit of it is always necessary to understand what’s going on. The first detail, and a rather surprising one, is that K3 is huge . The habit of using parameter count as a proxy for model capability faded away with the increasing closeness of the top labs in recent years. (Do you remember the GPT-4 circle vs GPT-3 circle viral image?) But open models don’t have time for secrecy, only progress and transparency. So we know K3 is 2.8 trillion parameters. According to Moonshot, it’s the first open model in the world in the 3T range. (Top models from OpenAI and Anthropic are thought to be in that or slightly higher range.)

Here’s a chart of the size increases of open models over time and a comparison between K3 and OpenAI’s open-source model (everyone went crazy that OpenAI would open a model, which is in itself funny when written down, and it gets only funnier when you look at the size comparison):

Source: Semianalysis

One reason not to get too excited about the number itself is that size is and isn’t a proxy for capability. You can have a smaller model that’s better than a bigger one, no problem. But, if done well, a large pre-train will naturally be better than a small one. So, although it’s a significant factor in capability, depending on who says “mine is bigger,” you can or can’t trust it to be a reliable heuristic for quality. (I won’t say here who I trust and who I don’t, but my reliability ranking is quite… broad.)

Another reason is sparsity.

Kimi K3 is extremely sparse, meaning that even if there are 2.8 trillion parameters in the model, the active ones at any given time are a tiny fraction of that. To be precise, K3 is a mixture of experts with almost 900 experts (specialized groups of parameters that are called on only when they are useful for the current task). Only 16 are active at a time, which means the model can draw on a very large pool of capabilities without using all of them for every request.

Combined with additional custom changes to how data moves through the model (Kimi Delta Attention and Attention Residuals—you don’t need to know what those are except in the sense that they enable two-digit efficiency gains at negligible cost increases), as well as improvements on the training process (INT4-native quantization), inference (expert parallelism) and data quality, Kimi K3 is roughly 2.5 times more scale-efficient—efficient at turning energy into intelligence—than Kimi K2. In short: Moonshot engineers are masters of turning scraps into gold.

In case you’re interested, here’s a snapshot of Kimi K3’s architecture:

There’s one common thread that should not go unnoticed here. Moonshot and DeepSeek are alike to the same degree that American labs are to one another, but not for the same reasons.

Anthropic 和 OpenAI 追求相同目标(例如递归自我改进)并保持相似发展速度的原因在于,硅谷的人工智能人才流动性极高。他们彼此熟识,自然会将一个实验室的秘密传递给另一个实验室,甚至无法通过保密协议或知识产权主张来阻止这种信息流动。人工智能行业的商业机密对世界其他地区是保密的,但在这些实验室之间却并非如此。

然而,Moonshot 和 DeepSeek 的相似性源于它们诞生于同一生态系统——一个开放但受到严重限制的生态系统,这个生态系统需要围绕稀缺性而非丰裕性发展。由于硬件短缺的强烈激励,它们倾向于保持开放以利用其他实验室的发现并共同成长,同时保持对寻找替代路径的极致专注,这些路径必须考虑资源限制。这意味着它们不需要像 OpenAI 和 Anthropic 那样共享 DNA,而是共享一个愿景:用更少的资源实现更多。

“约束激发创造力”这一理念大多是口号,但也被认真研究过。一项跨学科整合研究表明,创造力与约束之间存在U型关系。约束过少会导致漫无目的,约束过多则会导致停滞。在我看来,OpenAI 和 Anthropic 处于U型曲线的一端,它们过于富裕,以至于除非商业压力迫使它们关注效率,否则不会过多关注效率问题(相反,它们会重置限制,仿佛这等同于让模型尽可能便宜)。xAI 可能是美国人工智能生态系统中这一现象最明显的例子:巨大的数据中心,零聚焦。

中国初创公司则处于U型曲线的中间位置:硬件受限,但能够通过技术实力和极其优秀的团队来弥补。这些团队不会通过暴力扩展模型规模,而是首先确保相应的效率提升已经到位。(别误会我:美国实验室也有极其优秀的团队,但它们可能没有那么强烈的动机将这些才能完全用于克服并不存在的约束。)

作为谷歌DeepMind研究员的Anika曾表示:“Moonshot证明了‘训练是效率可压缩的’……一个有品位的小实验室可以压缩制造前沿模型所需的计算资源,即使它无法负担部署模型的成本。前沿技术不再是金钱可以购买的东西。”

但创造力也意味着黑客手段。

一个小型AI团队可以部署许多廉价技巧来利用封闭式进展。这条通向卓越的替代路径让我重新评估Kimi K3的能力:所有这些关于效率和智能的进展是否都属实,还是中国再次抄袭了美国?

这一直是“中国为何能如此迅速赶上美国人工智能努力”的常见解释。Anthropic首席执行官Dario Amodei表示,Anthropic已检测到多个来自中国实体(包括但不限于Moonshot)的“工业级行动”,这些行动试图提炼Claude模型。尽管Amodei对中国的强硬立场经常成为嘲笑的对象,但这一问题并非微不足道。引用Anthropic二月博客文章中的内容:

蒸馏攻击通过允许外国实验室(包括受中国共产党控制的实验室)以其他方式关闭出口管制旨在保护的竞争优势,从而削弱[芯片出口]管制。

第一个问题是商业性质的。进行蒸馏的实验室可以在极短的时间和成本下,为其自身模型带来巨大的能力提升。第二个问题是地缘政治层面的。这使得出口管制措施变得毫无意义。只要Nvidia将其芯片出售给美国实验室,而这些实验室随后通过蒸馏提取出相应能力,中国实验室本身就不需要这些芯片。

要实施蒸馏攻击,外部实验室会创建虚假账户和代理服务,与最佳模型进行大量交互以获取聊天信息——甚至提取推理轨迹——并利用这些信息对较差的模型进行后续训练,使其在基准测试中表现更优。这形成了一种类似师生共生关系(在这种情况下更偏向寄生关系,因为Anthropic并未从中受益)。Anthropic特别提到Moonshot的攻击方式时指出,其攻击规模估计涉及340万次交互,涵盖代理、代码和计算机使用任务:

Moonshot(Kimi模型)使用了数百个跨越多个访问路径的虚假账户。多样化的账户类型使这次行动更难被识别为协调行动。我们通过请求元数据将这次行动归因于Moonshot高级员工的公开资料。在后续阶段,Moonshot采用了更针对性的方法,试图提取并重建Claude的推理轨迹。

由于该信息发布于2月,完全有可能此次行动被用于后续训练Kimi K2.6(2026年4月发布),甚至Kimi K3。

我认为这种对中国快速进步的解释总体上是可信的,但难以解释所有中国模型的性能提升。以Kimi K3为例,证据表明并非如此(或至少不足以解释其全部能力提升):在多个基准测试中,K3的表现优于Anthropic和OpenAI的最佳公开模型;你几乎无法将教师模型蒸馏成更优的学生模型。

西方生态系统的研究分析普遍认同这一观点。以下是OpenAI研究员的观点:

另一位OpenAI研究员的观点:

Replit首席执行官Amjad Masad的观点:

Nathan Lambert(在开源AI和中国AI领域均有重要影响力的人士,他在2026年5月的一篇帖子中记录了与中囯实验室会面的见闻)表示:

在5月的帖子中,他列举了中美在AI发展方式上最显著的差异。其中包括:愿意做基础工作来改进模型(与西方世界更常见的过度个人主义形成对比)、较少的自我意识,以及思维更活跃、不受既有观念束缚、更愿意接受新技术和方法的年轻团队。

那么,如何将Lambert归因于中国人民的这些积极特质与Anthropic关于蒸馏的声明调和?很简单:两者兼而有之。中国AI实验室可以从美国AI实验室进行蒸馏,同时自身在构建这项技术方面也非常出色。

我想要表达的是:仅基于Anthropic的声明就忽视中国人才、努力和成就,这是不公平的。340万次交互足以产生重要影响——甚至可能足以支持一次强有力的定向微调训练——但这不足以得出Claude能够解释Kimi K3整体能力的结论。同时,将Anthropic对蒸馏技术的担忧轻描淡写地一笔带过,同样也是不公平的,因为蒸馏技术在中国追赶过程中确实发挥过作用。

这里出现了两个事实:

你无法通过耍小聪明来缩小与前沿技术的差距。

在那个层级竞争的人,没有一个是圣人。

现在,如果"Kimi K3为何表现如此出色"是百万美元的问题,那么"西方人工智能努力在面对中国开源模型表现如此出色时意味着什么"就是万亿美元的问题——字面意义上也是如此,因为人工智能行业的整体市场规模约为1万亿美元。

III. KIMI K3 是否标志着美国人工智能危机的黎明?

是的。现在让我们详细说明。

使用7天免费试用继续阅读

订阅《算法之桥》以继续阅读本文,并获得7天免费访问完整文章档案库的权限。

开始试用

已经是付费订阅者?

上一篇

下一篇