DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing
TL;DR · AI 摘要
DeepSeek V4 Pro 0813成本仅为GPT-5.6 Sol的1/35,但多次尝试后表现更优,适合预算有限且允许重试的任务。
核心要点
- DeepSeek V4 Pro 0813每轮成本0.24美元,GPT-5.6 Sol为8.37美元,价格差距达35倍。
- 四次尝试后DeepSeek V4 Pro 88.5%通过率超越GPT-5.6 Sol的85.8%。
- 每100美元预算,DeepSeek V4 Pro可解决260个任务,GPT-5.6 Sol仅9个。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 模型成本与性能对比
- 成本对比
- DeepSeek V4 Pro 0.24美元/轮
- GPT-5.6 Sol 8.37美元/轮
- 性能对比
- GPT-5.6 Sol首次通过率72.7%
- DeepSeek V4 Pro四次尝试通过率88.5%
- 适用场景
- 预算有限选DeepSeek
- 实时需求选GPT-5.6 Sol
金句 / Highlights
值得收藏与分享的关键句。
GPT-5.6 Sol首次尝试通过率72.7%,DeepSeek V4 Pro 0813为62.8%。
DeepSeek V4 Pro 0813四次尝试后通过率88.5%,超越GPT-5.6 Sol的85.8%。
每100美元预算,DeepSeek V4 Pro解决260个任务,GPT-5.6 Sol仅解决9个。
DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 在 DeepSWE 上的对比:成本、编码与路由
关键结论
不要二选一。优先运行 DeepSeek V4 Pro 0813,当测试失败时再升级至 GPT-5.6 Sol。这种级联方案能以每项 \$3.35 的成本解决 83.0% 的 DeepSWE 任务。单独使用 Sol 仅能解决 72.7% 的任务,成本为 \$8.37。Sol 的准确率高 10 个百分点,但成本是 Pro 的 60%。
- Sol 在首轮测试中表现更优。首次通过率 72.7% vs 62.8%,并在二次尝试中保持领先(81.0% vs 78.5%)。
- Pro 在四次尝试中胜出。四次通过率 88.5% vs 85.8%。在四次尝试中,低成本模型能覆盖更多任务。
- 价格差距达 35 倍。每次执行 \$0.24 vs \$8.37。每 \$100 花费,Pro 可解决 261 项任务,Sol 仅能解决 9 项。
- Sol 更快更稳定。每次执行耗时 17 分钟 53 步 vs Pro 的 35 分钟 146 步,且四次全通过任务数 61 项 vs 35 项。
- Sol 的失败更易引发连锁问题。20% 的失败会破坏已通过的测试,而 Pro 仅为 11%。对 Sol 的输出需进行回归测试拦截。
现已发布 · 美国托管
在 Together AI 上运行 DeepSeek-V4 Pro 0813
1.05M 上下文长度,支持函数调用和 JSON 模式,兼容 OpenAI API,部署在美国基础设施。
查看模型
在 DeepSWE 基准测试中,我们对 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 进行了对比。该基准测试通过多种任务类型和编程语言评估模型的软件工程能力。GPT-5.6 Sol 是当前最精准的单次尝试工程师,而 DeepSeek V4 Pro 0813 的成本仅为它的 1/35。有趣的问题不是哪个模型首次尝试更准确(显然是 Sol),而是这 35 倍的价格差距实际带来了什么,以及低成本模型是否能弥补这一差距。
DeepSWE · 对比分析
DeepSeek-V4 Pro 0813 与 GPT-5.6 Sol 快速对比
| 模型 | 首次通过率 | 平均成本 | 每 \$100 解决任务数 | 输出 token | 步数 | |------|------------|----------|---------------------|-------------|------| | gpt-5.6-sol [max] | 72.7% ± 2.2% | \$8.37 | 9 | 59k | 53 | | deepseek-v4-pro-0813 [max] | 62.8% ± 3.1% | \$0.24 | 260 | 101k | 146 |
我们对 DeepSeek V4 Pro 0813(max)和 GPT-5.6 Sol(max)在所有 113 个 DeepSWE 任务上进行了四轮测试,总计 904 次执行(每模型 452 次)。Sol 是精准度标杆,Pro 是性价比异常值。以下所有数据均来自此次运行,可能与其它公开的 DeepSeek V4 Pro 0813 vs GPT-5.6 Sol 评分表存在差异。
DeepSWE 评分表:首次通过率与多次尝试通过率
单次尝试中,Sol 明显领先:72.7% 首次通过率 vs Pro 的 62.8%(官方评分)。但随着重试次数增加,差距逐渐缩小并反转:两次尝试时 Pro 已接近(78.5% vs 81.0%),四次尝试时 Pro 的 88.5% 四次通过率已超过 Sol 的 85.8%。低成本模型覆盖范围更广;它需要多次尝试,但每次尝试几乎免费。如果工作负载允许运行 best-of-k,Sol 的精度优势将大幅削弱。
成本对比:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 定价
DeepSeek V4 Pro 0813 每次执行 \$0.24,是 Sol(\$8.37)的 1/35。从价值角度看,每 \$100 可解决 260 项任务,而 Sol 仅能解决 9 项。但低价并未带来速度或简洁性:Pro 的中位数执行需要 146 步和 35 分钟,输出 101k token,而 Sol 仅需 53 步、17 分钟和 59k token。Sol 是快速且简洁的专家,Pro 则通过更长路径达到相似覆盖范围。如果有人类等待,Sol 仅凭延迟就值得其溢价;如果预算或队列在等待,Pro 的性价比无出其右。
覆盖范围与可靠性:精准度 vs 覆盖范围
将 pass@1 拆分为覆盖率和可靠性,这种划分非常清晰。Sol 是精准度的代表:84.5% 的可靠性,61 项任务实现四次四次解决,这是模型精准触达目标的标志。DeepSeek V4 Pro 0813 则转向另一个维度:更广的覆盖率(88.5% 对比 85.8%),但可靠性显著降低(71.0%),且稳固任务数量更少(35 对比 61)。这就是从侧面看到的 pass@4 交叉点:Pro 覆盖的基准测试项目比 Sol 更多,但每次触达的成功率更低。
失败模式:各模型出错的方式
失败特征存在显著差异。Sol 在 20% 的失败案例中破坏了仓库的现有测试套件,这是 GPT 系列的回归特征。DeepSeek V4 Pro 0813 的保守性远高于 11%;当它失败时,通常表现为接近正确但未完全达成的失败,基准保持完整。因此,性价比更高的模型在未经审查时也更安全:在采用 Sol 的 diff 之前,应为其设置完整的回归门禁,而 Pro 对此类防护的需求更少。
按任务类型划分的优劣势
Sol 的质量优势覆盖广泛:在 8 个领域中赢得 6 个,其中数据建模和序列化以 92% 的表现领先(比 Pro 高出 28 分),此外查询/配置(80%)、并发(72%)、构建/运维(73%)、程序分析(64%)和协议一致性(59%)均表现优异。它未能胜出的两个领域较为狭窄:语言和运行时内部功能以 75-75 平局,而 DeepSeek V4 Pro 0813 在有状态响应性(66 对比 64)上实现唯一领域优势。在所有需要精准满足序列化契约的任务中,Sol 的表现均明显优于对手。
DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 按编程语言对比
Sol 在五种语言中赢得四种(Python 74%,Go 79%,TypeScript 66%,JavaScript 75%),Python 和 Go 的领先优势尤为明显。例外是 Rust,DeepSeek V4 Pro 0813 以 65 对比 60 略胜一筹:这是 Sol 相对于同类表现欠佳的唯一语言,也是 Pro 完全胜出的领域。如果技术栈是 Python 或 Go,Sol 的优势明显;如果是 Rust,Pro 的表现略优且成本大幅降低。
DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的差异程度
差异程度中等。任务级相关性为 0.54,是 DeepSeek-Pro 组合中最高的。两者共同解决 90 项任务;Pro 独自解决 10 项,Sol 独自解决 7 项,6 项任务两者均无法解决。它们的联合覆盖率达 113 项中的 107 项(94.7%)。对组合投资组合而言,一个关键差异是:DeepSeek V4 Pro 0813 没有解决 Sol 完全未覆盖的任务,而 Sol 在 Pro 完全无法解决的两个任务(pebble-durability-wait-apis、textual-kitty-key-phases)上实现四次四次解决。因此,Pro 相比 Sol 并未显著扩展新领域;它增加的价值在于以最低成本完成共享任务的能力。
两者之间的路由策略:组合投资组合
这正是级联策略胜出的原因。首先运行 DeepSeek V4 Pro 0813,仅当测试套件拒绝答案时才升级到 Sol:每项任务成本 3.35 美元,解决率达 83.0%。这比 Sol 独立运行时的 72.7% 高出 10 个百分点,且成本不到 Sol 单独运行时每项任务价格(8.37 美元)的一半。几乎免费的第一阶段处理了大部分任务队列,因此 Sol 的高价仅适用于剩余的困难任务,且到达 Sol 的任务还能获得第二次独立尝试。级联策略甚至优于完美的单次 oracle 路由器(80.8%),因为两次独立尝试胜过一次完美选择。无论哪种模型优先,准确率相同,但优先使用 Pro 的成本更低(3.35 美元 vs 8.44 美元),因此始终应优先选择低成本模型。
GPT-5.6 Sol 是在首次尝试时同时需要准确性和低延迟的场景下的首选单模型方案:pass@1 最高、可靠性最强、响应最快且输出最简洁,并在 8 个领域中覆盖 6 个。为此你需要支付 DeepSeek V4 Pro 0813 的 35 倍成本,且必须防范其 20% 的性能回退风险。DeepSeek V4 Pro 0813 是性价比和最佳 k 选方案:接近旗舰级的覆盖范围、更高的四次尝试上限、更清晰的失败模式,每次部署成本仅 0.24 美元。但这对模型最精妙的用法并非单独使用,而是将 Pro 作为 Sol 的前端接口。一个低成本的预处理阶段完成大部分工作后,Sol 只在真正需要时被调用,从而以不到 Sol 一半的价格实现旗舰级覆盖能力。
数据表:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 对比(完整结果)
DeepSWE · 完整结果
指标
pass@1(官方评分)
62.8%
72.7%
pass@1(错误视为失败)
72.3%
pass@2 / pass@4
78.5 /
88.5%
81.0
/ 85.8%
覆盖范围 / 可靠性
88.5
/ 71.0%
85.8 /
84.5%
Solid(4/4)/ walls(0/4)
35 /
13
61
/ 16
每次部署成本 / 总成本
$0.24 / $109
$8.37 / $3,783
每 100 美元解决任务数
261
中位数耗时 / 步骤数
35 / 146
17 / 53
中位数峰值上下文 / 输出 token 数
232k / 101k
177k / 59k
失败模式(近似 / 回退)
66% /
11%
54% / 20%
获胜领域(8 个中)
1(有状态)
6(1 平局)
获胜语言
1(Rust)
4
基础设施错误
0
2
任务相关性 / 总数
0.54 / 107 of 113 (94.7%)
Oracle 1 次尝试路由器
80.8%
级联 Pro 到 Sol(准确率 / 成本)
83.0% / $3.35
(对比 Sol 独立使用 72.7% / $8.37)
常见问题
DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 更好吗?
取决于评估指标。GPT-5.6 Sol 在 DeepSWE 的单次尝试质量上占优(pass@1 72.7% vs 62.8%),四次尝试解决任务数量更多(61 vs 35),且每次部署速度更快。DeepSeek V4 Pro 0813 在 pass@4 指标上表现更优(88.5% vs 85.8%),且每次部署成本仅为 GPT-5.6 Sol 的 1/35,因此更适合需要高吞吐量或重试容忍的代理工作。
DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 便宜多少?
在我们的测试中,DeepSeek V4 Pro 0813 每次部署成本为 0.24 美元,而 GPT-5.6 Sol 在最大努力模式下为 8.37 美元,成本差距约 35 倍。按每解决任务成本计算,Pro 每 100 美元可解决 260 个任务,而 Sol 仅能解决 9 个,效率差距约 30 倍。
编程任务中 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 哪个更好?
GPT-5.6 Sol 在 Python(74)、Go(79)、TypeScript(66)和 JavaScript(75)领域表现领先,并在 8 个任务领域中赢得 6 个(数据建模和序列化领域达 92%)。DeepSeek V4 Pro 0813 在 Rust(65 vs 60)和有状态响应式编程(66 vs 64)领域占优。Sol 的部署速度更快;Pro 在多次尝试中覆盖范围更广。
是否应该在 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 之间进行路由?
如果能验证结果,建议采用此方案。先运行 DeepSeek V4 Pro 0813,当测试套件拒绝输出时升级到 GPT-5.6 Sol,可实现 83.0% 的准确率,每任务成本 3.35 美元,优于 Sol 独立使用(72.7% / 8.37 美元)和完美单次尝试 Oracle 路由器(80.8%)。两者结合可覆盖 113 个任务中的 107 个。
DeepSWE 中的 pass@k 是什么?
pass@k 衡量在 k 次任务尝试中至少有一次通过隐藏测试套件。pass@1 奖励首次尝试即成功;更高的 k 值奖励模型在多次尝试后最终找到解决方案的能力。随着 k 值增加,DeepSeek V4 Pro 0813 的优势会逐渐扩大。