Kimi K3 vs Claude Fable 5 on DeepSWE: Cost and Coding
TL;DR · AI 摘要
Kimi K3在DeepSWE基准测试中以1/3成本超越Claude Fable 5,多次尝试后性能反超,但后者可靠性更高。
核心要点
- Kimi K3单次任务成本仅4.65美元,为Claude Fable 5的1/3
- Kimi K3在pass@4指标上达到89.4%,优于Claude Fable 5的88.5%
- Claude Fable 5四次尝试解决58项任务,Kimi K3仅解决45项
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Kimi K3 vs Claude Fable 5对比
- 性能指标
- pass@1差距1.4%
- pass@4 Kimi领先
- 成本分析
- Kimi成本1/3 Claude
- 可靠性差异
- Claude四次尝试解决更多任务
金句 / Highlights
值得收藏与分享的关键句。
Kimi K3在pass@4指标上达到89.4%,优于Claude Fable 5的88.5%。
Kimi K3单次任务成本4.65美元,Claude Fable 5为13.41美元。
Claude Fable 5四次尝试解决58项任务,Kimi K3仅解决45项。
Kimi K3 与 Claude Fable 5 在 DeepSWE 上的对比:成本与编码
关键要点
Kimi K3 在质量上与 Claude Fable 5 相当,每项解决任务的成本仅为后者三分之一,且作为开源模型,可为团队提供部署的完全控制权。
- Kimi K3 与 Claude Fable 5 在 DeepSWE 的 pass@1 指标上表现接近:Fable 以 69.9% 对 68.5% 领先,差距为 1.4 分。
- 给予模型更多尝试机会后,Kimi K3 反而领先。它在 pass@2(82.0 vs 80.2)和 pass@4(89.4% vs 88.5%)上表现更优。
- Kimi K3 成本显著更低:每轮 \$4.65 对比 \$13.41,每美元可解决的任务数是后者的 2.8 倍。
- Claude Fable 5 的可靠性更高:在四次连续解决任务(58 vs 45)上表现更稳定。
在 DeepSWE 上的 Kimi K3 与 Claude Fable 5 对比中,这是一个测试模型在多种任务类型和编程语言中软件工程能力的基准。本月最引人注目的模型并非排行榜首位的模型,而是 Kimi K3——这个新推出的开源模型以 1.4 分的差距落后于 Claude Fable 5,但价格仅为后者的三分之一。
Kimi K3 于 2026 年 7 月 16 日进入 DeepSWE,以最大努力进行了 452 次评估:包含 113 个来自真实开源仓库的长期需求,每个需求进行四次尝试,由隐藏测试套件进行通过/失败评分。我们将其与 Claude Fable 5 的最佳设置(xhigh)进行对比,这是 Anthropic 的最强配置和此前的基准领先者。以下所有数据均来自此次运行,因此可能与其他公开的 Kimi K3 与 Claude Fable 5 对比数据存在差异。
DeepSWE 评分表:pass@1 与 pass@k
在 DeepSWE 官方评分下,Fable xhigh 在首次尝试中解决了 69.9% 的任务,Kimi K3 最大解决率为 68.5%。一个开源模型与 Anthropic 旗舰模型之间仅相差 1.4 分,而 K3 相比其他模型的 38 分跃升是本数据集中模型版本间最大的差距。
当允许更大的 pass@k 值时,排名会发生反转。pass@2 上 Kimi 领先(82.0 vs 80.2),pass@4 上 Kimi 以 89.4% 超过 Fable 的 88.5% 和 Sol 的 85.8%;在整个 44 配置导出中,只有两个便宜的 GPT 配置(Luna max 和 GPT-5.5 high,90.3%)曾达到更高水平。
覆盖范围与可靠性:Kimi K3 与 Fable 5 的差异
将 pass@1 分解为覆盖范围(至少解决一次的任务)和可靠性(这些任务的通过率),这两个模型占据不同位置。Kimi 覆盖了 89.4% 的基准测试——高于任何峰值,仅有 12 个任务从未解决(Fable:13 个)。但其在四次尝试中的可靠性较低:76.6% 的可靠性,仅 45 个任务四次全部解决,而 Fable 的可靠性为 79.0%,解决了 58 个任务。Fable 更加稳定和确定性更强;Kimi 的覆盖范围更广,这解释了它在 pass@2 和 @4 上的提升。
成本对比:Kimi K3 与 Claude Fable 5 定价
- Kimi K3:每轮 \$4.65。Fable xhigh:\$13.41。完整的 452 轮扫描:\$2,103 对比 \$6,010。
- 每解决一个任务,Kimi 可提供 14.7 次解决每 \$100,而 Fable 仅为 5.3 次——每美元的工作量是后者的 2.8 倍。
- Kimi 的处理时间更长,但随着模型开源和推理优化,这一情况无疑会改善!
Kimi K3 与 Claude Fable 5 的相似性如何?
Kimi K3 与 Fable 的任务间相关性为 0.72,是整个基准测试中跨厂商相似度最高的组合。事实上,导出结果中相似度排名前四的跨厂商组合均为 Kimi-K3 与 Anthropic 的配对。在我们分析的所有组合中,这是首次出现没有任务出现一方全对另一方全错的情况。两者均解决了 96 项任务,Kimi 独立解决了 5 项,Fable 独立解决了 4 项,有 8 项任务两者均未解决。
两者的失败模式也高度一致:65% 的失败案例对两者而言都是接近正确答案的失误,且两者都能保护仓库现有测试套件(11% vs 10% 的基线回归)。
实际上,Kimi K3 与 Claude Fable 5 在几乎所有任务上都表现出相似的成功与失败模式,因此将它们组合使用几乎无法获得多样性优势:两者的联合覆盖了 113 项任务中的 105 项,仅比 Kimi 单独覆盖的 101 项略高。
Kimi K3 与 Fable 5 的编程语言对比
Kimi 在 Go 语言任务上表现明显优于 Fable(79 vs 71)。Fable 在其他四种语言中占优:Python 74-68,JavaScript 70-65,TypeScript 64-60,Rust 75-65。
这里最有趣的细节是 K3 在 Rust 任务上的表现与 Fable 非常接近——没有其他模型(甚至包括 GPT 5.6 Sol)在 Rust 方面表现得如此出色。
意义解读
Kimi K3 现在已成为理性选择的默认方案:接近旗舰级的覆盖范围,所有旗舰级配置中最高的 pass@4 表现,价格仅为 Fable 的 1/4。
在 Together AI 上运行 Kimi K3
Kimi K3 作为开放权重模型发布,这使得上述 pass@4 覆盖范围和成本结构可以按照您的需求使用。一旦权重可用,Together AI 的推理堆栈即可在生产规模上服务 Kimi K3 这类开放模型,使您无需支付前沿令牌的高价即可实现更广泛的 pass@k 覆盖。请参阅 Together AI 推理定价以评估其与您的工作负载的匹配程度。
常见问题
Kimi K3 比 Claude Fable 5 更好吗?
这取决于评估指标。Claude Fable 5 在 DeepSWE 的单次尝试可靠性上表现更优(pass@1 69.9% vs 68.5%),且能解决更多四次尝试全对的任务。Kimi K3 在 pass@2 和 pass@4 指标上表现更优,且成本显著更低,因此对于高吞吐量或可重试的代理工作来说,Kimi K3 是更具性价比的选择。
Kimi K3 比 Claude Fable 5 便宜多少?
在我们的测试中,Kimi K3 每次部署成本为 4.65 美元,而 Claude Fable 5 在 xhigh 设置下为 13.41 美元,价格仅为后者的三分之一。按每项解决任务计算,Kimi K3 每 100 美元可解决 14.7 项任务,而 Fable 仅能解决 5.3 项,约为前者的 2.8 倍。
Kimi K3 是开放权重模型吗?
是的。Kimi K3 是 Moonshot AI 发布的开放权重模型,因此一旦权重发布,即可通过自托管或推理服务提供商进行部署。Claude Fable 5 是闭源模型,仅可通过 Anthropic 及其合作伙伴获取。
对于编程任务,Kimi K3 和 Claude Fable 5 哪个更好?
两者在编程任务上表现接近。根据我们的语言分析,Kimi K3 在 Go 语言上表现明显优于 Fable,而 Claude Fable 5 在 Python、JavaScript、TypeScript 和 Rust 上占优。Fable 在单次尝试中表现更稳定,而 Kimi 在多次尝试中能覆盖更广泛的任务范围。
DeepSWE 中的 pass@k 是什么?
pass@k 衡量的是在 k 次任务尝试中至少有一次通过隐藏测试套件。pass@1 奖励首次尝试就正确;更高的 k 值奖励那些经过多次尝试最终能解决问题的模型。随着 k 值增加,Kimi K3 的优势会逐渐扩大。