DeepSeek V4 Pro 0813 vs Claude Fable 5 on DeepSWE: Cost, Coding, and Routing
TL;DR · AI 摘要
组合使用DeepSeek V4 Pro 0813和Claude Fable 5可解决82.7%的DeepSWE任务,成本仅8.28美元,比单独使用Claude节省62%费用。
核心要点
- DeepSeek V4 Pro 0813首次尝试解决62.8%任务,成本仅0.24美元/次
- Claude Fable 5首次尝试解决69.7%任务,但成本达21.63美元/次
- 组合策略每100美元可解决260个任务,Claude单独使用仅能解决3个
结构提纲
按章节快速跳转。
- §引言
对比DeepSeek V4 Pro 0813和Claude Fable 5在DeepSWE基准中的成本与性能差异。
展示两个模型在任务解决率、成本、处理速度等关键指标的对比结果。
分析组合使用策略如何实现成本与性能的最优平衡。
解释模型间任务失败模式差异如何提升整体系统覆盖率。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 模型成本与性能对比
- DeepSeek V4 Pro 0813
- 低成本高覆盖率
- 首次尝试62.8%成功率
- Claude Fable 5
- 高成本低覆盖率
- 首次尝试69.7%成功率
- 组合策略
- 82.7%任务解决率
- 成本降低62%
金句 / Highlights
值得收藏与分享的关键句。
组合策略解决82.7%任务,成本8.28美元,比单独使用Claude节省62%费用
DeepSeek V4 Pro 0813每100美元可解决260个任务,Claude仅能解决3个
两个模型任务失败模式相关性仅0.39,覆盖113个任务中的107个
DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的对比:成本、编码与路由
关键结论
优先运行 DeepSeek V4 Pro 0813,仅在失败时升级至 Claude Fable 5。这种级联方式以每项 8.28 美元的成本解决了 82.7% 的 DeepSWE 任务。单独使用 Fable 以每项 21.63 美元的成本解决 69.7% 的任务。Fable 的准确率高出 7 个百分点,但成本低 62%。
- 首次尝试 Fable 占优:69.7% 的 pass@1 对比 62.8%,领先 7 个百分点。
- 随后所有尝试中 Pro 占优:pass@2 相当(78.5% vs 77.1%),pass@4 时 Pro 高出 4.4 个百分点(88.5% vs 84.1%)。
- 价格差距达 90 倍:每轮 0.24 美元 vs 21.63 美元。每 100 美元支出,Pro 解决 260 项任务,Fable 仅解决 3 项。
- 失败任务类型不同:每项任务相关性仅 0.39,是目前测得的分歧最大的模型组合。两者共同覆盖 113 项任务中的 107 项,这种分歧正是路由机制生效的根本原因。
立即可用 · 美国托管
在 Together AI 上运行 DeepSeek-V4 Pro 0813
1.05M 上下文长度,支持函数调用和 JSON 模式,OpenAI 兼容 API,通过美国基础设施部署。
查看模型
在 DeepSWE 基准测试中,我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 进行了对比。该基准测试通过多种任务类型和编程语言评估模型的软件工程能力。这两个模型在价格表上处于完全不同的位置:Claude Fable 5 是 DeepSWE 板上最昂贵的部署方案,而 DeepSeek V4 Pro 0813 是最便宜的选项之一。Fable 在首次尝试时准确率高出 7 个百分点,但每轮成本是 Pro 的 90 倍。因此真正的问题不是哪个模型更好,而是这 90 倍的价格溢价实际购买了什么,以及何时值得支付。
DeepSWE · 正面对比
DeepSeek V4 Pro 0813 与 Claude Fable 5 快速对比
| 模型 | pass@1 | 平均成本 | 每 100 美元解决数 | 输出 token | 步数 | |------|--------|----------|------------------|------------|------| | claude-fable-5 [max] | 69.7% ± 2.3% | $21.63 | 3 | 115k | 79 | | deepseek-v4-pro-0813 [max] | 62.8% ± 3.1% | $0.24 | 260 | 101k | 146 |
我们对 DeepSeek V4 Pro 0813(max)与 Claude Fable 5(max)在所有 113 个 DeepSWE 任务上进行了对比测试,每个任务进行四轮试验,总计 904 次部署(各 452 次)。Fable 是昂贵的工匠,Pro 是性价比突出的特例。这两个模型在所有配对中分歧最大,这也成为它们最引人注目的特点。以下所有数据均来自此次测试,因此可能与其他公开的 DeepSeek V4 Pro 0813 与 Claude Fable 5 对比结果存在差异。
DeepSWE 评分榜:pass@1 与 pass@k
单次尝试 Fable 领先:69.7% 的 pass@1 对比 Pro 的 62.8%(官方评分)。但这种领先优势并不稳固。两次尝试后 Pro 追平(78.5 vs 77.1),四次尝试时 Pro 的 88.5% pass@4 超出 Fable 的 84.1% 超过 4 个百分点。对于成本是其 90 倍的 Fable 来说,它既没有占据性能上限,也没有在多次尝试中保持首次尝试的优势。低成本模型在覆盖范围和最佳 k 次尝试表现上都更胜一筹。
成本对比:DeepSeek V4 Pro 0813 与 Claude Fable 5 定价
DeepSeek V4 Pro 0813 每次部署仅需 0.24 美元,是 Fable(21.63 美元)的 90 分之一:每 100 美元可解决 260 项任务,而 Fable 仅能解决 3 项。这是我们测得的最悬殊的成本差距,且 Fable 是板上最昂贵的配置。值得注意的是,较低的价格并未带来预期的速度惩罚:Fable 的中位部署耗时 31 分钟,Pro 为 35 分钟,基本持平。这是因为 Fable 是板上输出最冗长的模型(115k 输出 token),尽管它仅需 79 步(对比 Pro 的 146 步)。Pro 需要更多步骤,但 Fable 每步输出更多内容。两个模型在速度上并无显著差异。
失败模式:各模型出错方式
两者在避免破坏现有功能方面都表现得非常克制:DeepSeek V4 Pro 0813和Fable在回归测试套件时仅在11%的失败案例中出现退化,远低于GPT家族的20%。差异体现在另一个方向:Fable在此类任务中承担了最大的重大失误比例(18% vs Pro的10%),这意味着当Fable出错时,其错误往往更加严重,解决方案可能完全偏离正确方向,而非仅仅遗漏个别边界情况。Pro在接近正确答案的案例中表现更优(66%接近正确 vs Fable的57%)。因此两者都可以在不进行严格回归验证的情况下安全采用,但Fable的失误类型在调试成本上更高。
按任务类型划分的优势领域
Fable在需要严密推理和精确契约的任务领域展现出卓越工艺:在8个任务中赢得6个,其中数据建模和序列化以88%的准确率领先(比Pro高出24个百分点),语言内部机制也达到78%。但DeepSeek V4 Pro 0813在两个关键领域表现突出:有状态响应性(66% vs 64%)和并发性与持久性(58% vs 45%),后者恰好是Fable最薄弱的领域,Fable在此类任务中仅取得45%的准确率,这是唯一一个低成本模型在工程能力上超越Fable的领域。
DeepSeek V4 Pro 0813 vs Claude Fable 5 按编程语言对比
Fable在五种编程语言中赢得四种,但真正证明其价值的是Rust:85% vs Pro的65%,20个百分点的差距是所有对比中最大的单语言差距。Fable显然是序列化和Rust领域的专家。在其他语言中差距相对较小(Python 70% vs 60%,Go 71% vs 67%,JavaScript 75% vs 65%),而DeepSeek V4 Pro 0813甚至在TypeScript上以61% vs 57%取得优势。除Rust和序列化领域外,支付90倍价格的性价比难以成立。
DeepSeek V4 Pro 0813和Claude Fable 5的差异性
这是它们最显著的特性。任务间相关性仅为0.39,是所有DeepSeek-Pro组合中最低的,表明两者确实存在实质性分歧。两者共同解决88个任务,Pro单独解决12个,Fable单独解决7个,仅有6个任务两者均无法解决。它们的联合覆盖率达94.7%(107/113),分歧呈现双向性:DeepSeek V4 Pro 0813在awilix-async-container-initialization任务中四战全胜,而Fable完全无法解决;Fable则在四个任务中四战全胜,而Pro完全无法解决(包括koota-query-predicates和testem-bail-on-test-failure)。这种互补性而非冗余性,是真正的价值所在。
任务路由策略:组合投资方案
这种多样性加上价格差异使级联策略极具吸引力。先运行DeepSeek V4 Pro 0813,仅在测试套件拒绝答案时升级到Fable:每任务8.28美元的费用下,82.7%的任务可被解决。这比单独使用Fable(69.7%)高出13个百分点,且费用不到Fable每任务价格(21.63美元)的一半。低成本的初始阶段处理了大部分任务,因此Fable的高价仅适用于剩余的困难任务,这些任务还能获得独立的二次尝试。这种级联策略甚至超越了完美单次决策的神谕路由(78.8%)。顺序不可调换:先用Pro每任务8.28美元,先用Fable则需21.71美元,两者准确率相同。
实际意义
Fable 5是这张对比表中最难证明其作为默认模型合理性的模型:其部署成本是所有模型中最高的,首轮尝试的领先优势会被重试消除,且没有四轮尝试的性能上限优势。仅在两个特定领域值得购买:Rust(85%)和序列化密集型任务(88%),在这些领域其质量确实能合理证明其高价。
DeepSeek V4 Pro 0813 是一个截然不同的配置:首次尝试即可达到接近 Fable 的精度,具有更高的上限,失败模式表现相当或更优,且成本仅为 Fable 的 1/90,但放弃了 Rust 和精确合约领域。由于两者是迄今为止我们测量到的最多样化组合,Fable 最佳的使用方式不是作为默认模型,而是作为低成本 Pro 模型的后续升级选项,仅在少数真正需要 Rust 或序列化专家的任务中才付费使用。
数据表:DeepSeek V4 Pro 0813 与 Claude Fable 5 对比,完整结果
DeepSWE · 完整结果
指标
Pass@1(官方评分)
62.8%
69.7%
Pass@1(错误视为失败)
67.3%
Pass@2 / pass@4
78.5 / 88.5%
77.1 / 84.1%
覆盖率 / 可靠性
88.5 / 71.0%
84.1 / 82.0%
Solid(4/4)/ walls(0/4)
35 / 13
56 / 18
每轮部署成本 / 总成本
$0.24 / $109
$21.63 / $9,346
每 100 美元解决数
261
中位数分钟 / 步骤
35 / 146
31 / 79
中位数峰值上下文 / 输出 token
232k / 101k
202k / 115k
失败分析(接近成功 / 大失败 / 回归)
66% / 10% / 11%
57% / 18% / 11%
获胜领域(共 8 个)
2(有状态、并发)
6
获胜语言
1(TypeScript)
4(Rust 完胜)
每任务相关性 / 联合
0.39 / 107 of 113(94.7%)
Pro → Fable 级联(精度 / 成本)
82.7% / $8.28
(对比单独使用 Fable 69.7% / $21.63)
Oracle 1 次路由
78.8%
基础设施错误
0
16
常见问题
DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗?
这取决于具体指标。Claude Fable 5 在 DeepSWE 的单次尝试质量上领先(pass@1 69.7% vs 62.8%),且在四次尝试中解决任务的数量更多(56 vs 35)。DeepSeek V4 Pro 0813 在 pass@2 表现持平,在 pass@4 上以 88.5% vs 84.1% 超出,且每轮部署成本仅为 Fable 的 1/90,因此对于高吞吐量或可重试的代理工作来说,是更具性价比的选择。
DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少?
在我们的测试中,DeepSeek V4 Pro 0813 每轮部署成本为 $0.24,而 Claude Fable 5 在最大努力模式下为 $21.63,成本相差约 90 倍。按每解决任务计算,Pro 每 100 美元可解决 260 个任务,而 Fable 仅能解决 3 个,效率相差约 80 倍。
对于编码任务,DeepSeek V4 Pro 0813 和 Claude Fable 5 哪个更好?
对于大多数编码任务,两者的差距小于价格差异。Claude Fable 5 在 Rust(85 vs 65)、Python、Go 和 JavaScript 上领先,并在 8 个任务领域中赢得 6 个,尤其擅长数据建模和序列化。DeepSeek V4 Pro 0813 在 TypeScript(61 vs 57)、有状态响应式编程以及并发和持久性(58 vs 45)上表现更优,而这些正是 Fable 的弱项领域。
是否应该在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间进行路由?
是的,如果你能验证结果。这两个模型是我们测量到的配对中每任务相关性最低的(0.39),但联合覆盖了 113 个任务中的 107 个。先运行 DeepSeek V4 Pro 0813,当测试套件拒绝其输出时升级到 Claude Fable 5,可达到每任务 $8.28 的 82.7% 准确率,优于单独使用 Fable 或完美的一次性路由 oracle。
DeepSWE 中的 pass@k 是什么?
pass@k 衡量在 k 次任务尝试中至少有一次通过隐藏测试套件。pass@1 奖励首次尝试就正确;更高的 k 值奖励那些经过多次尝试最终能解决问题的模型。随着 k 值增加,DeepSeek V4 Pro 0813 的优势会逐渐扩大。