Together AI Blog

GLM-5.3 vs. GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing

8.5内容质量

TL;DR · AI 摘要

GLM-5.3在多次尝试下表现优于GPT-5.6 Sol,且成本更低,但单次尝试中GPT-5.6 Sol稍胜一筹。组合使用可覆盖106/113任务,性价比达85.9%。

核心要点

  • GLM-5.3单次尝试成本3.99美元,解决率69.0%,GPT-5.6 Sol成本8.37美元,解决率72.7%
  • 四次尝试后GLM-5.3解决率87.6%,领先GPT-5.6 Sol的85.8%
  • 组合策略可覆盖93.8%任务,单任务成本6.61美元

结构提纲

按章节快速跳转。

  1. 提出GLM-5.3GPT-5.6 SolDeepSWE基准测试中的性能与成本对比研究。

  2. GPT-5.6 Sol在pass@1指标上领先3.7个百分点,但成本是GLM-5.3的2.1倍。

  3. GLM-5.3在pass@4指标上超越GPT-5.6 Sol,且每100美元可解决17个任务。

  4. GLM-5.3的输出效率为80k tokens/124步骤,GPT-5.6 Sol为60k tokens/61步骤。

  5. 两者组合可覆盖106/113任务,GLM-5.3失败时更少产生回归问题。

  6. 建议优先使用GLM-5.3,失败时升级至GPT-5.6 Sol,实现成本与性能的平衡。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GLM-5.3 vs GPT-5.6 Sol on DeepSWE
    • 性能对比
      • pass@1: GPT-5.6 Sol 72.7% vs GLM-5.3 69.0%
      • pass@4: GLM-5.3 87.6% vs GPT-5.6 Sol 85.8%
    • 成本分析
      • GLM-5.3: $3.99/任务 vs GPT-5.6 Sol: $8.37/任务
    • 覆盖与可靠性
      • 组合覆盖106/113任务
      • GLM-5.3失败回归率11%

金句 / Highlights

值得收藏与分享的关键句。

#GLM-5.3#GPT-5.6#DeepSWE#模型对比
打开原文

GLM-5.3 与 GPT-5.6 Sol 在 DeepSWE 上的对比:成本、编码与路由

关键结论

不要二选一。优先运行 GLM-5.3,当测试失败时再升级到 GPT-5.6 Sol。这种级联方案能以每项 \$6.61 的成本解决 85.9% 的 DeepSWE 任务。单独使用 Sol 可解决 72.7% 的任务,成本为 \$8.37。相较之下,Sol 的准确率高出 13 个百分点,但成本高出 21%。

  • Sol 在单次尝试中略胜一筹:72.7% 的 pass@1 对比 GLM-5.3 的 69.0%,3.7 个百分点的差距在两三个标准差范围内。
  • GLM-5.3 在后续重试中表现更优:在 pass@2(81.1% vs. 81.0%)与 pass@4(87.6% vs. 85.8%)上均领先。
  • 成本差距达 2.1 倍:GLM-5.3 每次运行 \$3.99,Sol 则为 \$8.37。每 \$100 花费下,GLM-5.3 可解决 17 项任务,Sol 仅能解决 9 项。
  • Sol 的执行速度更快且更稳定:每次运行耗时 19 分钟、61 步,对比 GLM 的 35 分钟、124 步。在 61 项任务中,Sol 以 4:4 的成功率完胜 GLM 的 48 项。
  • GLM-5.3 的失败更"干净":其失败案例中仅 11% 涉及已通过的测试,而 Sol 的这一比例为 20%。建议对 Sol 的差异进行回归分析。
  • 两者相关性较低(每任务 0.43 相关系数),但共同覆盖了 113 项任务中的 106 项,这种互补性正是级联方案有效的原因。

我们对 GLM-5.3(max)与 GPT-5.6 Sol(max)在全部 113 项 DeepSWE 任务上进行了四轮测试,总计 904 次运行(每模型 452 次)。Sol 是精度旗舰,GLM-5.3 是开源模型中的挑战者,已大幅缩小差距。下文所有数据均来自此次测试,可能与其他公开对比结果存在差异。

DeepSWE · 直接对比

GLM 5.3 与 GPT 5.6 Sol 快速对比

| 模型 | pass@1 | 平均成本 | 每 \$100 解决数 | 输出 token | 步数 | |--------------|--------------|----------|----------------|------------|-------| | glm-5.3 [max] | 69.0% ± 2.7% | \$3.99 | 17 | 80k | 124 | | gpt-5.6-sol [max] | 72.7% ± 2.2% | \$8.37 | 9 | 60k | 61 |

GPT-5.6 Sol 仍保持着 DeepSWE 基准测试中单次尝试的最高纪录,该基准测试涵盖多种任务类型和编程语言的软件工程能力评估。GLM-5.3 以不到 4 个百分点的差距、半价成本紧随其后,且在允许多次尝试时即实现反超。这是开源模型首次如此接近前沿水平,值得探讨的问题是:Sol 的溢价究竟带来了哪些实际价值?

DeepSWE 评分榜:pass@1 与 pass@k

单次尝试中 Sol 略胜:根据 DeepSWE 官方评分,Sol 的 pass@1 为 72.7%,GLM-5.3 为 69.0%。允许重试后形势反转:两次尝试时 GLM-5.3(81.1%)已与 Sol(81.0%)持平;四次尝试时 GLM-5.3 的 pass@4(87.6%)领先 Sol(85.8%)。开源模型的覆盖范围更广,因此在任何 best-of-k 场景中都是更精确的选择,且其额外尝试次数的成本仅为 Sol 的一半。

成本对比:GLM-5.3 与 GPT-5.6 Sol 定价

每次运行 \$3.99 的 GLM-5.3 比 Sol(\$8.37)便宜 2.1 倍,价值上体现为每 \$100 可解决 17 项任务,而 Sol 仅能解决 9 项。Sol 通过降低延迟来弥补溢价:平均耗时 19 分钟、61 步(对比 GLM 的 35 分钟、124 步),输出 token 为 60k(对比 GLM 的 80k)。这种权衡异常清晰:Sol 是更快更简洁的执行者,GLM-5.3 是成本更低但采用更长路径的模型。若有人工等待需求,Sol 仅凭延迟优势就值得溢价;若考虑预算或批量队列,GLM-5.3 是更优选择。

覆盖范围 vs. 可靠性:精度 vs. 覆盖能力

将 pass@1 和 pass@4 拆分为覆盖率(四次尝试中至少解决一次的任务)和可靠性(四次均解决的任务),这种拆分非常清晰。Sol 代表精度的极端:84.5% 的可靠性,61 项任务四次全解决,这是模型精准触达目标的标志。GLM-5.3 则在另一维度表现突出:覆盖率 87.6%(高于 Sol 的 85.8%),但可靠性下降至 78.8%,稳定解决的任务也减少至 48 项。这种覆盖率优势正是其 pass@4 领先的直接体现。GLM-5.3 覆盖了更多基准测试内容,但每次触达的成功率略低于 Sol。

失败模式:各模型的错误方式

失败模式存在显著差异,且拆分结果更倾向于开源模型。Sol 在 20% 的失败案例中破坏了仓库现有测试套件,这是 GPT 系列模型的典型回归特征。GLM-5.3 的这一比例降至 11%;当它出现错误时,通常表现为向前偏移的近似错误,保持基线完整性的近似错误率高达 61%(Sol 为 54%)。因此,成本较低的模型在无需严格回归防护时也更安全。在采用 Sol 的代码差异前,建议先进行完整的回归测试。GLM-5.3 对此类防护的依赖程度更低。

各模型按任务类型的优势领域

领域分布呈现四六分的均衡格局。Sol 在数据建模和序列化(92%)、构建与运维工具(73%)、并发与持久性(72%)以及协议一致性(59%)领域占优,这些正是强调精确契约的系统级工作。GLM-5.3 在查询与配置语言(88%,为表格中最高单细胞值)、语言与运行时内部机制(83%)、有状态响应性(73%)以及程序分析(64-64 平局)领域表现突出,这些属于结构化、解释器风格的工作。GLM-5.3 的明显短板是协议一致性(44%),落后 Sol 15 个百分点。Sol 没有单一薄弱领域,其整体表现均衡。任务类型分类由每个基准提示的 LLM 完成。

GLM-5.3 与 GPT-5.6 Sol 的编程语言对比

GLM-5.3 在 JavaScript 领域表现突出(90%),比 Sol 的 75% 高出 15 个百分点,且为所有模型中 JavaScript 的最佳成绩。它在 Rust 领域也领先(70% vs 60%)。Sol 在 Python(74% vs 66%)、Go(79% vs 76%)和 TypeScript(66% vs 61%)领域占优。路由规则简单明了:JavaScript 和 Rust 交给 GLM-5.3,其余交给 Sol,GLM-5.3 几乎在所有领域都是成本更低的次优选择。

GLM-5.3 与 GPT-5.6 Sol 的差异程度

差异足以进行路由决策。单任务相关性为 0.43,这对整体表现相近的两个模型而言是真实分歧。两者都能解决 90 项任务;GLM-5.3 独立解决 9 项,Sol 独立解决 7 项,另有 7 项两者均无法解决。它们的联合覆盖率达 106/113 项任务(93.8%),硬性分歧单向明显:GLM-5.3 四次全解决两项 Sol 从未触及的任务(koota-pair-relation-tracking、participle-grammar-conflict-analysis),而 Sol 没有任何 GLM-5.3 无法解决的任务。开源模型触及了旗舰模型无法到达的领域。

两者之间的路由:组合策略

That divergence plus the price makes the cascade the best row on the board. Run GLM-5.3 first and escalate to Sol only when your test suite rejects the answer: 85.9% solved at \$6.61 per task. That is thirteen points above Sol alone (72.7%) and still cheaper than one Sol rollout (\$8.37), because the open model clears most of the queue at half of Sol's price and the hard remainder gets a second independent attempt. The cascade also beats a perfect one-shot oracle router (83.8%), because two independent attempts beat one perfect pick. Expected accuracy is the same whichever model leads, but GLM-first is cheaper (\$6.61 against \$9.47), so lead with the lower-cost model.

What it means

GPT-5.6 Sol keeps the single-shot crown and the things that come with it: the highest first-try rate, the highest reliability, and by far the fastest and most concise runs. You pay roughly double for that, and you must guardrail its 20% regression rate. GLM-5.3 is the value and best-of-k pick: within four points on the first shot, ahead on pass@2, pass@4, and coverage, at half the price, with a cleaner failure profile and the best JavaScript on the board. Its real weaknesses against Sol are protocol conformance and raw speed. And because the two genuinely diverge, the sharpest deployment is neither alone. It is GLM-5.3 as a lower-cost front end with Sol as the verifier-gated escalation, which lands flagship-beating coverage for less than the flagship's own per-task price. Check out new GLM 5.3 Flash API.

DeepSWE · Full Results

GLM 5.3 vs GPT 5.6 Sol, metric by metric

Metric

GLM 5.3 [max]

GPT 5.6 Sol [max]

pass@1 (official scoring)

69.0%

72.7%

pass@1 (errors as failures)

68.8%

72.3%

pass@2 / pass@4

81.1 / 87.6%

81.0 / 85.8%

Coverage / reliability

87.6

/ 78.8%

85.8 /

84.5%

Solid (4/4) / walls (0/4)

48 /

14

/ 16

Cost per rollout / total

$3.99 / $1,806

$8.37 / $3,783

Solves per $100

Avg minutes / steps

35 / 124

19 / 61

Avg peak context / output tokens

155k

/ 80k

187k /

Failure anatomy (near miss / regression)

61% / 11%

54% / 20%

Domains won (of 8)

4

Languages won

2 (JavaScript, Rust)

3 (Python, Go, TypeScript)

Per-task correlation / union

0.43 / 106 of 113 (93.8%)

Cascade GLM → Sol (accuracy / cost)

85.9% / $6.61

(vs Sol alone 72.7% / $8.37)

Oracle 1-shot router

83.8%

Infra errors

1

2

113 DeepSWE tasks · 4 trials per config · both at max effort · 904 rollouts total

FAQs

Is GLM-5.3 better than GPT-5.6 Sol?

It depends on the metric. GPT-5.6 Sol wins single-attempt quality on DeepSWE (pass@1 72.7% against 69.0%), solves more tasks four for four (61 against 48), and is roughly twice as fast per rollout. GLM-5.3 ties pass@2 and wins pass@4 (87.6% against 85.8%) at half the cost per rollout, so it is the stronger value pick for high-volume or retry-tolerant agent work.

How much cheaper is GLM-5.3 than GPT-5.6 Sol?

In our run, GLM-5.3 cost \$3.99 per rollout against \$8.37 for GPT-5.6 Sol at max effort, about 2.1x lower. Measured per solved task, GLM-5.3 returned 17 solves per \$100 against Sol's 9, roughly twice the solved work per dollar.

Which is better for coding, GLM-5.3 or GPT-5.6 Sol?

他们对任务进行了分配。GLM-5.3在JavaScript(90对75)和Rust(70对60)上表现更优;Sol则在Python(74对66)、Go(79对76)和TypeScript(66对61)上领先。按任务领域划分,双方各取得4项胜利:Sol在精确合约和系统开发领域占优,GLM-5.3则在查询语言、配置语言、运行时内部机制和状态反应性领域表现更好。

我应该在GLM-5.3和GPT-5.6 Sol之间进行路由切换吗?

如果能够验证结果,答案是肯定的。两者相关性仅为0.43,且失败模式不同。先运行GLM-5.3并通过测试套件验证输出结果,当测试套件拒绝输出时再升级到Sol,这种组合方式每任务成本6.61美元,正确率可达85.9%,优于单独使用Sol(72.7%,8.37美元/任务)和完美单次路由预言机(83.8%)。两者组合覆盖了113个任务中的106个。

DeepSWE中的pass@k指标是什么含义?

pass@k衡量的是在k次任务尝试中至少有一次通过隐藏测试套件。pass@1奖励首次尝试就通过的能力;更高的k值奖励模型在多次尝试后最终找到解决方案的能力。随着k值增加,GLM-5.3的优势会逐渐扩大。

方法与注意事项

  • 数据来源:使用DeepSWE v1.1导出数据,包含113个任务,每个配置进行4次试验,双方均以最大努力完成,数据来自已发布的每轮试验记录。每方共进行452次试验。
  • 评分方式:主要通过率采用DeepSWE官方评分(包含通过测试,排除基础设施错误)。GLM-5.3有1个基础设施错误,Sol有2个,因此官方评分与严格评分几乎一致。pass@2、pass@4、覆盖率、联合通过率和相关性使用每任务通过次数计算。
  • 成本计算:成本数据来自索引中公布的每轮试验成本(美元)。在分析时,GLM-5.3批次的每轮轨迹JSON未在公共CDN上,因此本分析仅限索引级别。
  • 失败分析:使用已发布的每项测试通过率数据。接近失败指在保持基准不变的情况下,至少有80%的新测试通过;回归指基准测试失效。领域分类使用基于工件的任务分类体系。
  • 级联机制:假设验证器根据任务决定是否升级和独立判断。预期准确率在顺序上是对称的,但成本不是,因此应优先使用低成本模型。预言机路由是每个任务的最佳单次选择,是任何单次路由的上限。