GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing
TL;DR · AI 摘要
GLM-5.3 Flash以1/17成本解决15倍任务,首次尝试性能落后5.6%但多次重试后差距缩小至2.6%。
核心要点
- GLM-5.3 Flash成本为GLM-5.3的1/17,但每100美元解决任务数是其15倍。
- 首次尝试性能差距5.6%,但第四次尝试差距缩小至2.6%。
- Flash在93个任务中表现稳定,而GLM-5.3仅解决99个任务。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GLM-5.3 vs Flash对比
- 性能对比
- pass@1差距5.6%
- pass@4差距2.6%
- 成本分析
- 成本17倍差异
- 任务解决效率15倍
- 稳定性分析
- 93任务稳定性提升
- 3个突破性任务
金句 / Highlights
值得收藏与分享的关键句。
Flash成本为GLM-5.3的1/17($0.24 vs $3.99),但每100美元解决任务数达264 vs 17。
首次尝试性能差距5.6%(69.0% vs 63.4%),但第四次尝试差距缩小至2.6%。
Flash在93个任务中表现稳定,而GLM-5.3仅解决99个任务。
GLM-5.3 与 GLM-5.3 Flash 在 DeepSWE 上的对比:成本、编码与路由
关键结论
优先运行 GLM-5.3 Flash,仅在测试拒绝答案时升级至完整版 GLM-5.3。这种级联方式以每项 \$1.70 的成本解决 80.9% 的 DeepSWE 任务。单独使用 GLM-5.3 以 \$3.99 的成本解决 69.0% 的任务。前者在准确率上高出 12 个百分点,成本降低 57%。如果必须选择单一模型,应选择 Flash:首次尝试时落后 5.6 个百分点,但到第四次尝试时仅落后 2.6 个百分点,因为蒸馏过程牺牲的是可靠性,而可靠性正是重试所能弥补的关键。
- 差距源于首次尝试效果。首次通过率 pass@1 为 69.0% 对比 63.4%,第二次尝试差距缩小至 4 个百分点,第四次尝试差距进一步缩小至 2.6 个百分点(87.6% 对比 85.0%)。
- 价格差距达 17 倍。完整版每轮 \$3.99,Flash 版仅 \$0.24。每 \$100 花费可解决任务数:Flash 版 264 项,完整版仅 17 项。
- 能力得以保留,但一致性下降。完整版解决的 99 项任务中,Flash 仍能解决 93 项。它稳定解决了父模型存在波动的 15 项任务,甚至突破了父模型完全无法解决的 3 项任务。
- Flash 无法将努力转化为优势。在波动任务中,完整版 61% 的长轮次运行能通过,而 Flash 仅 46%,低于抛硬币的预期线。
- 真实退化:谨慎性。在与完整版的对比中,Flash 在 6.9% 的运行中破坏了已通过的基线测试,而完整版仅 4.4%,因此需通过回归测试进行防护。
现已发布 · 美国托管
在 Together AI 上运行 GLM 5.3 Flash
每轮运行成本降低 17 倍,支持函数调用和 JSON 模式,兼容 OpenAI API,通过美国基础设施提供服务。
查看模型
GLM-5.3 与 GLM-5.3 Flash 属于同一家族的两个版本。GLM-5.3 是完整开放权重模型;GLM-5.3 Flash 是其蒸馏版本,运行成本仅为完整版的 1/17。每个团队对闪存版本的疑问始终是:质量会有多大损失?在 DeepSWE 这个测试模型软件工程能力的基准上,答案比首次通过率差距显示的要小,因为 Flash 并非完整模型的缩略版。它是能力的重新分配,真正失去的并非头条数字所指的性能,而是稳定性。
DeepSWE · 一瞥
GLM 5.3 与 GLM 5.3 Flash 的头条数据对比
| 模型 | pass@1 | 平均成本 | 每 \$100 解决数 | 平均输出 token | 平均步骤 | |------|--------|----------|----------------|----------------|----------| | GLM 5.3 [最大] | 69.0% ± 2.7 | \$3.99 | 17 | 80k | 125 | | GLM 5.3 Flash [最大] | 63.4% ± 4.1 | \$0.24 | 264 | 73k | 123 |
113 个 DeepSWE 任务 · 每个配置 4 次试验 · 均以最大努力运行 · 总计 900 次运行
我们针对所有 113 个 DeepSWE 任务,对 GLM-5.3(最大)与 GLM-5.3 Flash(最大)进行了四次试验,总计 900 次运行(452 次完整版,448 次 Flash 版)。以下是对完整对比和蒸馏分析的综合呈现。所有图表数据均来自此次运行,因此可能与其他公开的 GLM-5.3 与 GLM-5.3 Flash 对比结果存在差异。
DeepSWE 评分榜:pass@1 与 pass@k
单次运行时,完整版领先 5.6 个百分点(69.0% 对比 63.4%)。这一领先优势是首次尝试的产物。到第二次尝试时差距缩小至 4 个百分点,第四次尝试时进一步缩小至 2.6 个百分点(87.6% 对比 85.0%)。蒸馏过程使 Flash 丧失了更多单次运行的精致表现,而非上限能力。对于任何 best-of-k 工作负载,有效质量损失低于 3 个百分点,成本仅为完整版的 1/17。从 5.6 到 2.6 的跌幅揭示了变化的线索,下一节将详细解释。
蒸馏的真实代价:一致性,而非能力
对每个模型的每项任务进行分类,标记为“墙”(0/4通过)、“易出错”(部分通过)或“稳定”(全部通过),然后追踪完整模型的任务在Flash中的分布情况。
右上角的零值对应以下结论:完整模型在48项任务中能稳定解决4项,没有一项在Flash中变得无法解决。其中一半任务保持完全稳定,另一半仅失去一致性。覆盖率保留数据也说明相同问题:完整模型能至少解决99项任务,而Flash仍能解决其中的93项(94%)。蒸馏过程并未消除解决这些任务的能力,而是消除了可靠性。与能力损失不同,一致性损失正是重试机制能够恢复的,这也是为什么pass@4的差距远小于pass@1的差距。
成本对比:GLM-5.3 与 GLM-5.3 Flash 的定价和速度
以0.24美元对比3.99美元,Flash的单次部署成本仅为完整模型的1/17:每100美元可获得264次解决,而完整模型仅能获得17次。通常的Flash折中方案(每token速度更慢)并未出现。Flash反而更快,平均耗时26分钟,而完整模型需要35分钟。它并非通过减少步骤实现提速:两者执行的步骤数相同(123 vs 125)。全部速度差异源于单步延迟,Flash每步仅需12.5秒,而完整模型需要17.0秒。更小的模型在更小的窗口(平均峰值上下文145k vs 完整模型的155k)中,每步执行速度约快27%。
一致性消失之处:蒸馏从边缘侵蚀能力
按完整模型解决任务的可靠性分组,然后测量Flash在每个组别的平均通过率。
结果显示清晰的单调梯度:完整模型解决任务越可靠,Flash保留的相应能力越多。蒸馏从能力分布的边缘开始侵蚀,却保留了核心部分。它强化了模型能力边界,而非整体压缩能力分布曲线。
GLM-5.3 Flash 丧失了通过艰苦尝试达成目标的能力
这是易出错性的机制,也是研究中最令人意外的发现。对于易出错任务,关键问题是更长的运行是否更可能成功。相同任务、相同难度,仅运行次数不同。
- 完整 GLM-5.3:在61%的易出错任务中,成功运行的步数多于失败运行。完整模型能通过思考找到解决方案,努力转化为成功。
- GLM-5.3 Flash:仅46%,低于抛硬币的预期水平。对于易出错任务,Flash是否成功与运行时长基本无关。
因此,蒸馏不仅使模型每步能力略有下降,更彻底剥夺了模型通过额外努力达成目标的能力。这也不是随机探索:Flash在单任务内的步数方差略低于完整模型(变异系数0.12 vs 0.14)。它每次运行长度基本相同,有时成功有时失败。失去的是完整模型能将艰苦尝试转化为解决方案的搜索能力。
各领域及编程语言中的优势分布
损失仅是故事的一半。Flash在特定领域重新获得了能力:
- 完整模型的15项易出错任务在Flash中变为稳定任务,稳定了原模型存在不确定性的领域。
- Flash解决了完整模型完全无法处理的3项任务。
- 按领域来看并非全面落后:并发性与持久性+8(62至70)、Python+5(66至71)、数据建模+4(79至83)、协议+3(44至48)。它在JavaScript、查询与配置、有状态响应性、Rust和语言内部机制方面让位于其他模型。
在八个领域中,完整模型获得5分而Flash获得3分;在语言领域,完整模型获得4分(Go、TypeScript、JavaScript、Rust),而Flash仅获得1分(Python)。完整模型在推理密集型和JavaScript密集型任务中表现更优;Flash则在系统级和Python任务中占优。单独来看Flash的JavaScript表现令人担忧,但该结果基于5个任务的样本且受单一任务驱动,应将其视为趋势性参考而非确定结论。总体来看,蒸馏改变了模型性能分布而非单纯降低水平。
精准度与覆盖范围的权衡
完整模型在覆盖-可靠性平面上位于右上方:87.6%覆盖率和78.8%可靠性,而Flash为85.0%和74.7%。完整模型在48个任务中实现4:4的完美通过率,而Flash仅在39个任务中达成;完整模型在14个任务上无法突破,而Flash在17个任务上受阻。蒸馏虽在两个维度上均有所削减,但Flash的运行间方差增长幅度超过平均值下降幅度(pass@1标准差4.1 vs 2.7),这与整体表现的一致性特征一致。
唯一的真实退化:附带损害
并非所有方面都对Flash有利。除准确性和一致性外,蒸馏使模型在避免附带损害方面明显减弱。以非错误部署中破坏至少一个已通过基线测试的比例衡量:
- GLM-5.3:4.4%
- GLM-5.3 Flash:6.9%
当Flash采取行动时,破坏现有代码的可能性比完整模型高出50%以上。这是其表现劣于而非仅成本低于完整模型的唯一维度,也是需要增设防护措施的领域:在未审查的情况下接受Flash差异前,应运行完整的回归测试套件。
二者间的路由:同源级联
由于Flash牺牲的质量较小且大多可恢复,而节省的成本显著,因此同源级联可直接实现成本削减。首先运行Flash,仅在验证器拒绝答案时升级至完整模型:80.9%的通过率对应每任务1.70美元,高于完整模型自身单次尝试的69.0%通过率(价格不到其一半)。两者任务间相关性为0.61,联合覆盖113个任务中的102个(90.3%),因此低成本阶段可处理大部分任务队列,完整模型仅处理剩余难题,这些难题会获得第二次独立尝试。
意义解读
将GLM-5.3蒸馏为GLM-5.3 Flash是一把手术刀而非大锤。它保留了能力并交换了稳定性:完整模型所有固有任务无一变为不可解,pass@4差距为2.6分而非5.6分。它消除了使模型能通过艰苦尝试达成目标的搜索能力,努力回报率从61%降至46%,这才是不稳定性的真正来源。它重塑了性能分布而非缩小规模,在并发性、Python、数据建模和协议领域取得进展的同时让出JavaScript和查询任务,其中最令人担忧的JavaScript下降仅是五任务样本中单个任务的影响。其唯一真实退化是谨慎性,基线破坏率从4.4%升至6.9%。
经济学占据主导地位:每轮部署成本降低17倍,每100美元可解决264个问题,墙钟时间更快,且质量仅低于最佳k值3个百分点。默认使用GLM-5.3 Flash处理成本和吞吐量受限的工作负载及任何最佳k值流水线。当任务以JavaScript或查询为主,或需要首次尝试可靠性时,应使用完整版GLM-5.3。使用Flash时需通过回归运行进行验证。如果运行完整模型,应在前端使用Flash以将费用减少超过一半。
数据表:GLM-5.3 与 GLM-5.3 Flash 对比,完整结果
DeepSWE · 数据表
完整对比,逐项指标分析
指标
GLM 5.3(最大值)
GLM 5.3 Flash(最大值)
pass@1(官方)
69.0%
63.4%
pass@2 / pass@3 / pass@4
81.1 / 85.4 / 87.6%
77.1 / 82.1 / 85.0%
覆盖率 / 可靠性
87.6 / 78.8%
85.0 / 74.7%
Solid(4/4)/ walls(0/4)
48 / 14
39 / 17
每轮部署成本
平均分钟数 / 步数 / 每步秒数
35 / 125 / 17.0秒
26 / 123 / 12.5秒
平均输出token数 / 峰值上下文长度
80k / 155k
73k / 145k
失败回归占比 / 基线崩溃率
61%临近,11% / 4.4%
61%临近,13% / 6.9%
在Flash中变为不可解的完整Solid任务数
48个中0个
在易碎任务上的努力回报(更深入运行胜出)
61%
46%
覆盖率保留率(完整版99个已解决中的保留率)
93(94%)
在8个领域中获胜的领域数
5
3
获胜语言
4
(Go、TS、JS、Rust)
1(Python)
Flash优势(Flash > 完整版)
并发性+8,Python+5,数据+4,协议+3
每任务相关性 / 并集
0.61 / 102个中的113(90.3%)
Cascade Flash → 完整版(准确率 / 成本)
80.9% / 1.70美元
(对比完整版单独使用69.0% / 3.99美元)
基础设施错误
1
0
DeepSWE v1.1 · 113任务 × 每配置4次试验 · 两者均在最大努力下 · Flash成本使用当前每任务0.24美元平均值
方法与注意事项
- 数据:DeepSWE v1.1导出数据,113任务按每配置4次试验进行,两者均在最大努力下。GLM-5.3有452次试验,其中1次基础设施错误;GLM-5.3 Flash在452次试验中有448次无基础设施错误,因此少数任务有3次Flash试验,类别和通过率使用每个任务的实际试验次数。
- 类别:wall = 0次通过,solid = 所有试验通过,flaky = 部分通过。覆盖率 = 至少解决一次。保留率分组按完整模型的每任务结果对任务进行分组。
- 努力回报:在每个易碎任务中,通过试验的平均代理步数与失败试验的平均代理步数的对比,报告为通过次数超过失败次数的易碎任务占比。这控制了任务难度。行为方差是任务内步数的标准差系数。
- 附带损害:非错误轮次中基线测试损坏(p2p < 1)的比例。每步时间是平均持续时间除以平均步数。步数、token数、分钟数和峰值上下文长度均为平均值,与DeepSWE网站一致。
- Flash成本使用当前每任务0.24美元平均值。领域使用基于工件的分类法。每个GLM-5.3批次的每回合轨迹JSON均未在公共CDN上,因此所有结果均为索引级别。
- 语言划分是小样本。特别是JavaScript仅基于五个任务,因此单任务移动会改变单元格数值。
常见问题解答
GLM-5.3 Flash与GLM-5.3相比表现如何?
接近,且允许的尝试次数越多越接近。GLM-5.3在pass@1上领先5.6个百分点(69.0% vs 63.4%),但在pass@4上差距缩小至2.6个百分点(87.6% vs 85.0%)。GLM-5.3解决的48个任务中没有任务在Flash中变为不可解,因此损失的是可靠性而非能力。
GLM-5.3 Flash比GLM-5.3便宜多少?
在我们的测试中,GLM-5.3 Flash 每次部署成本为 0.24 美元,而 GLM-5.3 在最大努力模式下成本为 3.99 美元,成本低约 17 倍。按每个解决任务计算,Flash 每 100 美元可解决 264 个任务,而完整模型仅能解决 17 个任务,Flash 的任务解决效率是完整模型的 16 倍。
对于编程任务,GLM-5.3 和 GLM-5.3 Flash 哪个更优?
这取决于具体需求。GLM-5.3 支持五种语言中的四种(Go、TypeScript、JavaScript、Rust)和八个领域中的五个,在首次尝试可靠性及需要复杂推理的任务中表现更优。GLM-5.3 Flash 在并发性(70 vs 62)、Python 支持(71 vs 66)、数据建模(83 vs 79)和协议开发(48 vs 44)方面表现更突出。
是否应该在 GLM-5.3 Flash 和 GLM-5.3 之间进行路由?
如果能验证结果,建议采用混合策略。先运行 GLM-5.3 Flash 并在测试套件拒绝输出时升级到 GLM-5.3,每任务成本 1.70 美元即可达到 80.9% 的成功率,这比单独使用 GLM-5.3(3.99 美元/任务,成功率 69.0%)成本低 50% 以上。任务相关性系数为 0.61,两者组合可覆盖 113 个任务中的 102 个。
是否可以不经过审查直接接受 GLM-5.3 Flash 的输出?
建议添加回归验证环节。GLM-5.3 Flash 在非错误部署中会导致至少一个已通过基准测试失败的比例为 6.9%,而 GLM-5.3 仅为 4.4%,因此其干扰现有代码的可能性高出 50% 以上。在接受代码变更前执行完整回归测试可显著缩小这一差距。
DeepSWE 中的 pass@k 指标是什么含义?
pass@k 表示在 k 次任务尝试中至少有一次通过隐藏测试套件的比例。pass@1 表示首次尝试即通过的奖励,更高的 k 值则奖励那些经过多次尝试最终能解决问题的模型。随着 k 值增加,GLM-5.3 Flash 的性能差距会缩小,这也是它适合用于允许重试的流水线场景的原因。