Together AI Blog

GLM-5.3 vs. Claude Fable 5 on DeepSWE: Cost, Coding, and Routing

8.5内容质量

TL;DR · AI 摘要

GLM-5.3在DeepSWE基准测试中成本仅为Claude Fable 5的1/5,且在多尝试指标上表现更优。

核心要点

  • GLM-5.3每任务成本为$3.99,Claude Fable 5为$21.63,成本差距达5.4倍。
  • 在pass@4指标上,GLM-5.3为87.6%,Claude Fable 5为84.1%。
  • 每$100支出,GLM-5.3可解决17个任务,Claude Fable 5仅3个。

结构提纲

按章节快速跳转。

  1. 介绍GLM-5.3Claude Fable 5DeepSWE基准测试中的比较背景。

  2. 分析两个模型在pass@1和pass@k指标上的表现差异。

  3. 对比GLM-5.3与Claude Fable 5的每任务成本及任务解决效率。

  4. 总结成本优势下GLM-5.3的综合竞争力及适用场景。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GLM-5.3 vs Claude Fable 5
    • 性能对比
      • pass@1: 69.0% vs 69.7%
      • pass@4: 87.6% vs 84.1%
    • 成本分析
      • $3.99 vs $21.63/任务
      • 17 vs 3任务/$100

金句 / Highlights

值得收藏与分享的关键句。

#GLM-5.3#Claude Fable 5#DeepSWE#模型比较
打开原文

GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的对比:成本、编码与路由

关键结论

GLM-5.3 与 Claude Fable 5 在 DeepSWE 准确性上表现接近,但 GLM-5.3 每任务成本仅为 Fable 5 的五分之一,并在所有多尝试指标中占优。当两个模型质量如此接近时,价格差距就成为唯一决定因素。

  • 首次尝试持平。Fable 5 首次通过率 69.7%,GLM-5.3 为 69.0%,0.7 分的差距在误差范围内。
  • GLM-5.3 在重试中占优。它在 pass@2(81.1% vs. 77.1%)和 pass@4(87.6% vs. 84.1%)上均领先,既具备更高上限又成本更低。
  • 成本差距达 5.4 倍。GLM-5.3 每次部署 3.99 美元,Fable 5 需要 21.63 美元。每 100 美元投入,GLM-5.3 可解决 17 个任务,Fable 仅能解决 3 个。
  • 它们近乎替代品。每任务相关性达 0.65,是本组最高的一致性,同时运行两个模型增加的覆盖率有限。建议保留低成本模型,仅在 Rust 和序列化任务中升级至 Fable。

在 DeepSWE 基准测试中,该测试通过多种任务类型和编程语言评估模型的软件工程能力,GLM-5.3 与 Claude Fable 5 的质量几乎无法区分。Fable 5 首次通过率领先 0.7 分,但其每次部署成本是 GLM-5.3 的 5.4 倍,也是 DeepSWE 板上最昂贵的配置。这种组合引发了一个关键问题:当精度相同时,高价带来的额外价值是什么?

DeepSWE · 对比分析

GLM 5.3 与 Claude Fable 5 快速对比

| 模型 | pass@1 | 平均成本 | 每 100 美元解决任务数 | 输出 token | 步数 | |--------------|--------------|------------|------------------------|------------|------| | glm-5.3 [max] | 69.0% ± 2.7% | 3.99 美元 | 17 | 80k | 124 | | claude-fable-5 [max] | 69.7% ± 2.3% | 21.63 美元 | 3 | 114k | 85 |

我们在所有 113 个 DeepSWE 任务上运行了 GLM-5.3(max)与 Claude Fable 5(max),每任务进行四次试验,总计 904 次部署(每模型 452 次)。两者均属于低回归的严谨学派,这也是它们表现如此相似的原因。下文所有数据均来自此次运行,可能与其他公开的 GLM-5.3 vs. Claude Fable 5 评分表存在差异。

DeepSWE 评分表:pass@1 与 pass@k

单次尝试时双方平局。根据 DeepSWE 官方评分,Fable 5 首次尝试通过率 69.7%,GLM-5.3 为 69.0%,差距在误差带内。允许重试后模型开始分化,且 GLM-5.3 表现更优。两次尝试时 GLM-5.3 通过率 81.1% vs. 77.1%,四次尝试时达到 87.6% vs. 84.1%。

开源模型以 Fable 五分之一的价格实现了相当的首次通过率,且在允许重试后展现出更高的上限。在任何尝试次数上,为 Fable 支付 5.4 倍费用都无法获得额外覆盖率。

成本对比:GLM-5.3 与 Claude Fable 5 定价

GLM-5.3 每次部署 3.99 美元,成本仅为 Fable 5(21.63 美元)的 1/5.4:每 100 美元可解决 17 个任务,而 Fable 仅能解决 3 个。Fable 是板上最昂贵的配置,但 GLM 的成本优势并未伴随速度劣势。GLM-5.3 每次部署平均耗时 35 分钟,与 Fable 的 34 分钟基本持平。

token 分布解释了运行特征。GLM-5.3 虽然需要更多步骤(124 步 vs. 85 步),但输出 token 更少(80k vs. 114k)。Fable 每步生成更多内容,GLM 则通过更多但成本更低的步骤实现目标。两者速度相当,但仅 GLM-5.3 成本仅为对方的五分之一。

覆盖范围与可靠性:GLM-5.3 与 Fable 5 的差异

将 pass@1 拆解为覆盖率(至少解决一次的任务)和可靠性(这些任务的通过率),两者在指标平面上都接近同一角落,GLM 略微延伸得更远。GLM-5.3 的覆盖率更高(87.6%),优于 Fable 的 84.1%。Fable 每次尝试的可靠性略高(82.0%),相比 GLM 的 78.8%,且在四连击任务中解决更多(56 个 vs. 48 个)。

实际上两者都表现得像有纪律的通才,GLM 以略微降低单次尝试可靠性为代价,实现了更广泛的基准覆盖。

失败模式:模型出错的方式

这是两者家族相似性最明显的部分。两种模型仅在 11% 的失败案例中回归现有测试套件,远低于 GPT 系列的 20%,因此无需严格的回归防护即可安全采用。

差异微乎其微。Fable 承担了更多重大失误(18% vs. GLM 的 16%),意味着其错误时更可能犯严重错误。GLM 更常因接近正确而失败(61% vs. 57%)。总体而言,两者以相似的纪律性失败,这正是它们结果高度相关的原因。

按任务类型划分的优劣势领域

尽管 pass@1 指标平局,但领域分布并不完全相同。GLM-5.3 在结构化、解释器风格任务中占优:查询和配置(88 vs. 72)、语言和运行时内部(83 vs. 78)、状态反应(73 vs. 64)、并发与持久性(62 vs. 45)以及程序分析(64 vs. 56)。其中并发任务的 17 分差距是 Fable 最弱的领域。

Fable 在精确契约领域表现更佳:数据建模与序列化(88 vs. 79)、构建与运维(71 vs. 68)以及协议一致性(55 vs. 44),这是 GLM 最弱的领域。GLM 在五个领域胜出,Fable 仅在三个领域占优,而 Fable 在并发任务上 45% 的表现是其唯一能与 GLM 抗衡的领域。

GLM-5.3 与 Claude Fable 5 的编程语言对比

Fable 的优势几乎完全依赖于单一语言。其 Rust 表现为 85%(GLM 为 70%),15 分的差距是本次对比中最大的单语言差距。序列化密集型任务自然成为这种优势的配套领域。

GLM 在 JavaScript 上表现最佳(90 vs. 75),Go 语言接近平局(76 vs. 71),TypeScript 也表现不俗(61 vs. 57)。Fable 在 Python 上略胜一筹(70 vs. 66)。除 Rust 和序列化密集型任务外,Fable 的 5.4 倍溢价在任何其他语言上都未能带来显著的准确性优势。

GLM-5.3 与 Claude Fable 5 的相似性

对于希望同时使用两者的用户来说,这里有个关键点。GLM-5.3 与 Fable 的任务相关性为 0.65,是本组配对中最高的。两者共同解决 88 个任务,GLM 独自解决 11 个,Fable 独自解决 7 个,另有 7 个任务两者均无法解决,且双方都没有出现完全无法解决的案例。

它们的联合覆盖了 113 个任务中的 106 个(93.8%),但由于它们在相似任务上成功与失败的模式高度重合,将两者配对带来的多样性提升,不如与 GPT 系列模型配对显著。它们几乎是可互换的替代品,而当两个模型可以互换时,应选择成本更低的那个。

两者之间的路由策略:组合投资

如果确实需要同时使用两者,顺序和经济性仍倾向于将开源模型作为前端。首先运行 GLM-5.3,仅在测试套件拒绝答案时升级到 Fable:以每任务 $10.74 的成本解决 81.1% 的任务。这比单独使用 Fable 的表现高出 11 个百分点(69.7%),且成本仅为 Fable 单独使用时的一半($21.63)。

鉴于0.65的相关性,诚实的建议更简单:对于大多数工作,GLM-5.3单独使用即可捕捉到Fable几乎所有的功能,成本仅为Fable的五分之一,只有在需要Rust和序列化专长时才值得升级到Fable。

含义

Fable 5和GLM-5.3在首次尝试的准确性上统计学上持平,但这种平局就此结束。GLM-5.3的成本仅为Fable的1/5.4,在pass@2、pass@4和覆盖率上表现更优,输出更简洁,在回归测试中保持同等严谨性,并在八个领域中的五个领域胜出,同时拥有当前最佳的JavaScript能力。

Fable是此处测量的最昂贵模型,与GLM相比仅在三个领域胜出,并拥有真正的Rust和序列化优势。由于两者在0.65相关性下近乎替代品,同时运行两者的组合收益有限。实际建议是将GLM-5.3作为默认选择,仅在需要Rust或序列化关键任务时,将Fable作为昂贵的有限升级选项。查看新的GLM 5.3 Flash API。

DeepSWE · 完整结果

GLM 5.3 vs Claude Fable 5,逐项指标对比

指标

GLM 5.3 [最大值]

Fable 5 [最大值]

pass@1(官方评分)

69.0%

69.7%

pass@1(错误视为失败)

68.8%

67.3%

pass@2 / pass@4

81.1 / 87.6%

77.1 / 84.1%

覆盖率 / 可靠性

87.6

/ 78.8%

84.1 /

82.0%

Solid(4/4)/ walls(0/4)

48 /

14

56

/ 18

每次部署成本 / 总成本

3.99美元 / 1,806美元

21.63美元 / 9,346美元

每100美元解决数

平均分钟数 / 步骤数

35 / 124

34 / 85

平均峰值上下文 / 输出令牌

155k / 80k

205k / 114k

失败分析(接近成功 / 大失败 / 回归)

61% /

16%

/ 11%

赢得领域(共8个)

5

赢得语言

2(JavaScript,TypeScript)

3(Rust全面领先,Python,Go)

每任务相关性 / 联合覆盖

0.65 / 106个/113(93.8%)

GLM→Fable级联(准确率 / 成本)

81.1% / 10.74美元

(对比Fable单独使用69.7% / 21.63美元)

Oracle 1次尝试路由器

78.5%

基础设施错误

1

16

113个DeepSWE任务 · 每种配置4次试验 · 两者均最大努力 · 总共904次部署

常见问题

GLM-5.3比Claude Fable 5更好吗?

在DeepSWE测试中,两者首次尝试的统计学表现持平:Fable 5以69.7%的pass@1领先GLM-5.3的69.0%。GLM-5.3在所有后续指标中均占优,包括pass@2(81.1% vs 77.1%)、pass@4(87.6% vs 84.1%)和覆盖率,且每次部署成本仅为Fable的1/5.4。Fable在四次尝试中解决了更多任务(56 vs 48),因此在单次尝试中略显稳定。

GLM-5.3比Claude Fable 5便宜多少?

在我们的测试中,GLM-5.3每次部署成本为3.99美元,而Claude Fable 5在最大努力模式下为21.63美元,差距达5.4倍。按每解决任务计算,GLM-5.3每100美元可解决17个任务,而Fable仅能解决3个。

对于编程任务,GLM-5.3和Claude Fable 5哪个更好?

这取决于语言和任务类型。GLM-5.3在JavaScript(90 vs 75)、Go(76 vs 71)和TypeScript(61 vs 57)中表现更优,并在包括并发性和持久性在内的五个领域中领先(62 vs 45)。Claude Fable 5在Rust(85 vs 70)、Python(70 vs 66)和精确契约领域(如数据建模和序列化88 vs 79)表现更佳。

是否应该在GLM-5.3和Claude Fable 5之间进行路由?

仅需选择性使用。这两个模型是我们测量过的任务对中相关性最高的(0.65),因此它们在大部分任务上成败一致,联合覆盖了113个任务中的106个。GLM优先的级联方式可达到每任务81.1%的准确率,成本为10.74美元,远超单独使用Fable的69.7%准确率/21.63美元成本。但对大多数团队而言,更大的收益是直接默认使用GLM-5.3,仅在需要Rust或序列化关键任务时使用Fable。

GLM-5.3 是否开放权重?

是的。GLM-5.3 是开放权重模型,因此可以本地部署或通过推理服务提供商(如 Together AI)进行服务。Claude Fable 5 是闭源模型,仅可通过 Anthropic 及其合作伙伴访问。

DeepSWE 中的 pass@k 是什么?

pass@k 衡量在 k 次任务尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励首次尝试即成功,更高的 k 值奖励经过多次尝试最终能找到解决方案的模型。随着 k 值增加,GLM-5.3 的优势会更加明显。

方法与注意事项

  • 数据:使用 DeepSWE v1.1 导出数据,每种配置下 113 个任务 × 4 次试验,均在最大努力模式下运行,数据来自已发布的每轮试验记录。每方 452 次试验。
  • 评分:头条 pass 率使用 DeepSWE 官方评分(包含 included_in_score,排除基础设施错误)。Fable 因模型路由产生 16 个基础设施错误,其严格将错误视为失败的评分是 67.3,低于官方评分 69.7。GLM-5.3 仅有 1 个基础设施错误。
  • pass@2、pass@4、覆盖率、联合评估和相关性 使用每任务通过次数进行计算。
  • 成本:使用已发布的每轮试验成本(cost_usd)。Fable 的成本与轨迹总成本(total_cost_usd)完全一致,而 GLM 的成本仅基于索引。在分析时,GLM-5.3 批次的每轮轨迹 JSON 文件未在公共 CDN 上公开。
  • 失败分析 使用已发布的每项测试比例数据。接近成功指在保持基线不变的情况下,至少 80% 的新测试通过。回归指基线测试失效。领域分类使用基于工件的任务分类体系。
  • 级联机制 假设验证器根据任务决定升级和独立性。预期准确率在顺序上是对称的,但成本不是,因此应优先使用低成本模型。鉴于 0.65 的相关性,组合收益有限。理想路由器是每任务最优的单次选择,是任何单次路由器的上限。