DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding
TL;DR · AI 摘要
DeepSeek-V4 Flash 0731成本仅为GPT-5.6 Luna的1/6,但组合使用时在准确率和成本上均优于单独使用Luna。
核心要点
- GPT-5.6 Luna单次任务准确率67.2%,DeepSeek-V4 Flash为53.3%,但后者成本仅0.10美元/任务。
- DeepSeek-V4 Flash失败时仅破坏9%测试用例,低于Luna的15%。
- 先用DeepSeek-V4 Flash再用Luna的组合策略,任务解决成本降低37%至0.385美元/任务。
结构提纲
按章节快速跳转。
- §引言
对比DeepSeek-V4 Flash与GPT-5.6 Luna在DeepSWE任务中的成本与性能差异。
GPT-5.6 Luna在单次任务准确率领先14个百分点,但成本是DeepSeek的6倍。
DeepSeek-V4 Flash每任务成本0.10美元,解决效率为Luna的4.8倍。
先用DeepSeek再用Luna的组合策略在成本和准确率上均优于单独使用任一模型。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 模型成本与性能对比
- DeepSeek-V4 Flash
- 低成本(0.10美元/任务)
- 组合策略优势
- GPT-5.6 Luna
- 高准确率(67.2%)
- 高成本(0.61美元/任务)
- DeepSWE任务
- 113个真实开源任务
金句 / Highlights
值得收藏与分享的关键句。
DeepSeek-V4 Flash每任务成本0.10美元,是Luna(0.61美元)的1/6。
组合策略解决78.9%任务,成本0.385美元/任务,比Luna单独使用便宜37%。
DeepSeek-V4 Flash失败时仅破坏9%测试用例,低于Luna的15%。
DeepSeek-V4 Flash 0731 与 GPT-5.6 Luna 在 DeepSWE 上的对比:成本与编码能力
关键结论
虽然 GPT-5.6 Luna 在所有质量指标上都是更强的工程师,但 DeepSeek-V4 Flash 0731 的成本足够低,使得 DeepSeek 优先的级联方案在准确性和成本上都优于 Luna 单独运行。
- GPT-5.6 Luna 在 DeepSWE 首次通过率(pass@1)上以 67.2% 对 53.3% 明显领先,领先优势达 14 个百分点,并在每次尝试次数相等时始终占据优势。
- DeepSeek-V4 Flash 是 DeepSWE 板上最便宜的模型:每轮 0.10 美元,而 Luna 需要 0.61 美元,每 100 美元可解决 532 个问题,而 Luna 仅能解决 110 个。
- DeepSeek-V4 Flash 的失败更干净,在 9% 的失败案例中会破坏仓库的现有测试套件,而 Luna 的失败率是 15%。
- 首先运行 DeepSeek-V4 Flash,仅在失败时升级到 Luna,每项任务成本 0.385 美元即可解决 78.9% 的任务:比 Luna 单独运行更准确,且便宜 37%。
立即体验 · 开源权重
在 Together AI 上运行 DeepSeek-V4 Flash
DeepSWE 板上最便宜的模型,每项任务约 10 美分。在生产规模上优先使用低成本的初级阶段,无需支付前沿令牌的高价。
进入体验区
DeepSeek-V4 Flash 0731 是整个 DeepSWE 板上最便宜的模型:每项任务约 10 美分!GPT-5.6 Luna 是一款可靠的高端旗舰模型,每项任务运行成本为 0.61 美元,大约是 DeepSeek 价格的六倍。因此,问题的关键不在于谁在排行榜上胜出(Luna 明显领先),而在于六分之一的价格能为您带来什么,需要付出什么代价,以及两者结合是否能超越各自单独运行的表现。
我们对 DeepSeek-V4 Flash 0731(最大版本)与 GPT-5.6 Luna(最大版本)在所有 113 个 DeepSWE 任务上进行了测试:这些任务来自真实开源仓库的长期功能请求,每个任务进行四次试验,由隐藏的测试套件进行通过/失败评分。总共进行了 900 次运行(DeepSeek 方面 452 次,Luna 方面 448 次)。以下所有数据均来自此次运行,因此可能与其他公开评分表存在差异。
一目了然
DeepSWE · 正面交锋
DeepSeek-V4 Flash 与 GPT-5.6 Luna 快速对比
模型
首次通过率
平均成本
输出令牌
步骤
gpt-5.6-luna [max]
67% ± 4%
$0.61
73k
102
deepseek-v4-flash [max]
53% ± 4%
$0.10
108k
153
Luna 的成本是 DeepSeek 的约 6 倍,但准确率高出约 14 个百分点;DeepSeek 虽然输出令牌和步骤更多,但以每轮 0.10 美元的价格,是该系列中性价比最突出的模型。
DeepSWE 排名榜:首次通过率与多次尝试通过率
Luna 在单次尝试中明显领先:根据 DeepSWE 官方评分,Luna 的首次通过率为 67.2%,而 DeepSeek 为 53.3%,领先 14 个百分点,相对准确率高出约 26%。在尝试次数相等时,Luna 在所有 k 值上都保持领先(两次尝试时 81.6% 对 70.1%,四次尝试时 90.3% 对 80.5%)。从原始解决问题的能力来看,这并非势均力敌的竞争。
但 DeepSWE 正是那种可以并行进行多次尝试的工作负载,在这种情况下,经济性完全改变了局面。DeepSeek 的两次尝试通过率(70.1%)已超过 Luna 的单次尝试(67.2%),而两次 DeepSeek 尝试的成本仅为 0.20 美元,而 Luna 需要 0.61 美元。如果验证器能够选择成功的运行,低成本模型以三分之一的价格就能达到旗舰模型首次尝试的质量,甚至在下面提到的任何路由技巧应用之前就能实现。
成本对比:DeepSeek-V4 Flash 与 GPT-5.6 Luna 定价
- 每项任务 0.61 美元的 Luna,每 100 美元仅能解决 110 个问题,而 DeepSeek 能解决 532 个:低成本模型的价值优势达到 4.8 倍。每轮运行的成本差距约为 6 倍。
- 低成本模型无法为你带来的唯一东西是速度,这与通常“闪亮”模型故事形成反差:在此场景中,DeepSeek 的速度更慢,完成任务的中位数耗时为 23 分钟和 148 步,而 Luna 仅需 16 分钟和 92 步。DeepSeek 的输出量更大(中位数 104k 个 token,而 Luna 为 70k),但它的优势在于成本而非时间。
- 这个时钟时间差距部分源于模型的新颖性;随着推理引擎的优化,这一差距预计会缩小。
故障模式:DeepSeek 的失败方式比旗舰模型更从容
低成本模型另一个悄然获胜的领域是纪律性。当 DeepSeek 失败时,仅在 9% 的故障情况下会破坏现有测试套件,而 Luna 的比例为 15%——这与 GPT 系列模型在 Sol 和其他 OpenAI 系谱模型中常见的 15-20% 回归特征一致。两者主要都以“接近但未完全失败”(DeepSeek 69%,Luna 66%)的方式失败,但更昂贵的 Luna 模型反而更可能破坏原本正常运行的代码。如果你部署 Luna,必须在完整回归测试后才启用;DeepSeek 则需要这种保护措施的频率更低。
按任务领域对比 DeepSeek-V4 Flash 与 GPT-5.6 Luna
将 113 个任务按代码实际内容分类后,Luna 在 8 个领域中赢得 7 个。其最大优势集中在需要深度推理的领域:程序分析(69 vs 33)、并发与持久性(70 vs 38)、语言与运行时内部机制(86 vs 59),每个领域差距约 30 分。这些领域真正体现了模型能力的差异,而 DeepSeek 在这些领域表现明显不足。
DeepSeek 仅在单一领域占据优势,且这一领域具有代表性:查询与配置语言(78 vs 70)。SQL 构建器、窗口函数、键集分页、配置解析器等任务中,结构化、符合模式、遵循惯例的工作正是低成本模型真正具有竞争力的领域,甚至在某些方面领先。每当任务要求在整个系统中保持严格不变量时,Luna 的能力便凸显出来。
按编程语言对比 DeepSeek-V4 Flash 与 GPT-5.6 Luna
Luna 在五种语言中全部胜出,但差距幅度提示了使用 DeepSeek 时的注意事项。DeepSeek 在 Rust(55 vs 60)和 Go(62 vs 79)中表现尚可,但其 JavaScript 表现暴跌至 35(Luna 为 60),这是整个对比中最弱的单个数据点,差距达 25 分。DeepSeek 的 Python 也表现疲软(49 vs 65)。如果你的代码栈以 JavaScript 为主,低成本模型反而会带来更高的成本;如果以配置语言、查询语言或 Rust 为主,DeepSeek 则能缩小大部分差距。
DeepSeek-V4 Flash 与 GPT-5.6 Luna 的相似性如何?
相似度低于低成本模型之间的对比。按任务计算的相关性为 0.50,多样性分布明显失衡:两者共同解决 87 个任务,Luna 独自解决 15 个,而 DeepSeek 独自仅解决 4 个。关键的是,DeepSeek 没有任何任务是 Luna 完全未覆盖的领域(DeepSeek 方面没有“全胜”任务),而 Luna 却有 4 个 DeepSeek 完全未触及的任务(go-critic-doc-link-checker、langchain-request-coalescing、meriyah-explicit-resource-declarations、superjson-error-stack-serialization)。两者覆盖了 113 个任务中的 106 个(93.8%),但几乎全部是 Luna 的能力范围。从纯粹多样性角度看,DeepSeek 增加的贡献微乎其微。
组合策略:为何这种级联方式仍然有效
因此,这种模型组合似乎毫无意义。实际上并非如此,原因在于价格。先运行 DeepSeek,仅当测试套件拒绝其答案时再升级至 Luna:每任务成本 0.385 美元,解决率高达 78.9%。仔细阅读这句话。其准确性高于单独使用 Luna(67.2%,提升 11.7 分),且成本更低(0.61 美元),仅为 Luna 每任务成本的约 63%。
近似免费的第一阶段是整个策略的关键:DeepSeek 以每例约一毛钱的价格处理了约53%的任务队列,因此 Luna 的处理成本仅针对剩余的困难部分,而到达 Luna 的任务还能获得一次独立的第二次尝试。这种级联方式甚至优于完美的单次选择路由器(74.3%),因为两次尝试胜过一次完美选择。无论哪种模型领先,准确性都相同,但 DeepSeek 优先的方案成本更低(0.385 美元 vs 0.64 美元),因此始终应优先使用低成本模型。
这对组合的上限为93.8%;7项任务(包括 gql-incremental-graphql-delivery 和 bandit-structured-nosec-directives)始终无法解决,需要更强的第三种模型,而非更优的路由策略。
意义解读
单独来看,DeepSeek-V4 Flash 0731 是一个中等水平的模型,仅在查询和配置领域表现突出,具有清晰的失败模式、灾难性的 JavaScript 弱点,但价格无法匹敌。GPT-5.6 Luna 在所有质量指标上都优于 DeepSeek:pass@1 高出14个百分点,8个领域中领先7个,支持全部5种语言,处理速度也更快。你为其支付约6倍的费用,还需承担 GPT 家族特有的回归习惯作为安全防护。旗舰型号每项任务仅需0.61美元,确实价格亲民,当质量是首要考量时,它自然成为默认选择。但 DeepSeek 最精妙的用法并非替代 Luna,而是作为 Luna 的前端。一个仅需一毛钱、能处理一半任务的第一阶段,让你以低于旗舰价格的成本获得超越旗舰的精度。当低成本模型如此廉价时,级联策略不再是妥协方案,而是最优解。
附录:数据表
DeepSWE · 附录
DeepSeek-V4 Flash 与 GPT-5.6 Luna:完整数据表
指标
DeepSeek-V4 Flash 0731(最大值)
GPT-5.6 Luna(最大值)
pass@1(官方评分)
53.3%
67.2%
pass@1(错误视为失败)
pass@2 / pass@4
70.1 / 80.5%
81.6 / 90.3%
覆盖率 / 可靠性
80.5 / 66.2%
90.3 / 74.8%
稳定性(4/4)/ 墙障(0/4)
23 / 22
43 / 11
每部署成本 / 总成本
0.10 美元 / 45 美元
0.61 美元 / 273 美元
每100美元解决数
532
110
中位数分钟 / 步骤
23 / 148
16 / 92
中位数峰值上下文 / 输出令牌
202k / 104k
202k / 70k
失败分析
69% 近似失败,9% 回归失败
66% 近似失败,15% 回归失败
赢得的领域(共8个)
1(查询 & 配置)
7
赢得的语言
无
全部5种
每任务相关性 / 并集
0.50 / 106 of 113(93.8%)
级联 DeepSeek > Luna(精度 / 成本)
78.9% / 0.385 美元
vs Luna 单独使用 67.2% / 0.61 美元
单次选择路由器
74.3%
排行榜排名(共52个配置)
第30名
第13名
基础设施错误
0
常见问题
GPT-5.6 Luna 是否优于 DeepSeek-V4 Flash?
在质量方面是的。GPT-5.6 Luna 在 DeepSWE pass@1 指标上以67.2%对53.3%领先,每次尝试次数相同时均占优,赢得7个任务领域(共8个)和全部5种语言,且速度更快。DeepSeek-V4 Flash 在价格上具有约6倍优势,且失败时表现更干净。
DeepSeek-V4 Flash 比 GPT-5.6 Luna 便宜多少?
在我们的测试中,DeepSeek-V4 Flash 每次部署成本约0.10美元,而 GPT-5.6 Luna 需要0.61美元,约为后者的六分之一。按每项任务计算,DeepSeek 每100美元可解决532项任务,而 Luna 仅能解决110项,约为前者的4.8倍。
应该将 DeepSeek-V4 Flash 和 GPT-5.6 Luna 一起使用吗?
是的,采用级联方式。在我们的测试中,先运行 DeepSeek,仅在测试套件拒绝答案时升级至 Luna,以每项任务0.385美元的成本解决了78.9%的任务:比单独使用 Luna(67.2%)更准确,且成本更低(0.61美元)。始终优先使用低成本模型;无论哪种方式准确性相同,但 DeepSeek 优先方案成本更低。
编码方面,DeepSeek-V4 Flash 和 GPT-5.6 Luna 哪个更好?
在我们的分析中,Luna 在所有编程语言上都表现更优,但领先优势因语言而异。DeepSeek 在 Rust 语言上表现不错,在查询和配置类工作中具有竞争力,甚至在某些领域占据优势。其 JavaScript 能力是本次对比中最薄弱的环节(35 vs 60),因此对 JavaScript 依赖度高的技术栈不应仅依赖这种低成本模型。
DeepSWE 中的 pass@k 是什么?
pass@k 衡量在 k 次任务尝试中至少有一次通过隐藏测试套件。pass@1 奖励首次尝试就通过的能力;更高的 k 值则奖励经过多次尝试最终找到解决方案的能力。DeepSeek 的 pass@2(70.1%)已经超越 Luna 的 pass@1(67.2%),这正是并行尝试和级联经济模型生效的关键所在。