T
traeai
登录

概念

DeepSWE

别名:DeepSWE任务

基于真实开源项目长期需求的代码生成评估基准。

已跟踪 17 条高相关材料

TraeAI 观察

相关材料

已收录 17 条与 DeepSWE 相关的内容,按评分排序。

Together AI Blog 图标

GLM-5.3 vs. Claude Fable 5 on DeepSWE: Cost, Coding, and Routing

Together AI Blog2243 字 (约 9 分钟)
85

GLM-5.3在DeepSWE基准测试中成本仅为Claude Fable 5的1/5,且在多尝试指标上表现更优。

入选理由:GLM-5.3每任务成本为$3.99,Claude Fable 5为$21.63,成本差距达5.4倍。

精选文章#GLM-5.3#Claude Fable 5#DeepSWE#模型比较英文
Together AI Blog 图标

GLM-5.3 vs. GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing

Together AI Blog2192 字 (约 9 分钟)
85

GLM-5.3在多次尝试下表现优于GPT-5.6 Sol,且成本更低,但单次尝试中GPT-5.6 Sol稍胜一筹。组合使用可覆盖106/113任务,性价比达85.9%。

入选理由:GLM-5.3单次尝试成本3.99美元,解决率69.0%,GPT-5.6 Sol成本8.37美元,解决率72.7%

精选文章#GLM-5.3#GPT-5.6#DeepSWE#模型对比英文
Together AI Blog 图标

GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing

Together AI Blog2838 字 (约 12 分钟)
85

GLM-5.3 Flash以1/17成本解决15倍任务,首次尝试性能落后5.6%但多次重试后差距缩小至2.6%。

入选理由:GLM-5.3 Flash成本为GLM-5.3的1/17,但每100美元解决任务数是其15倍。

精选文章#模型对比#GLM-5.3#DeepSWE#蒸馏模型英文
Together AI Blog 图标

DeepSeek-V4 Flash 0731 vs GPT-5.6 Luna on DeepSWE: Cost and Coding

Together AI Blog2024 字 (约 9 分钟)
85

DeepSeek-V4 Flash 0731成本仅为GPT-5.6 Luna的1/6,但组合使用时在准确率和成本上均优于单独使用Luna。

入选理由:GPT-5.6 Luna单次任务准确率67.2%,DeepSeek-V4 Flash为53.3%,但后者成本仅0.10美元/任务。

精选文章#模型比较#成本分析#AI#DeepSWE英文
Together AI Blog 图标

DeepSeek V4 Pro 0813 vs Claude Fable 5 on DeepSWE: Cost, Coding, and Routing

Together AI Blog1837 字 (约 8 分钟)
85

组合使用DeepSeek V4 Pro 0813和Claude Fable 5可解决82.7%的DeepSWE任务,成本仅8.28美元,比单独使用Claude节省62%费用。

入选理由:DeepSeek V4 Pro 0813首次尝试解决62.8%任务,成本仅0.24美元/次

精选文章#DeepSeek V4 Pro 0813#Claude Fable 5#DeepSWE#模型比较#成本分析英文
Together AI Blog 图标

DeepSeek V4 Pro 0813 vs GPT-5.6 Sol on DeepSWE: Cost, Coding, and Routing

Together AI Blog1888 字 (约 8 分钟)
85

DeepSeek V4 Pro 0813成本仅为GPT-5.6 Sol的1/35,但多次尝试后表现更优,适合预算有限且允许重试的任务。

入选理由:DeepSeek V4 Pro 0813每轮成本0.24美元,GPT-5.6 Sol为8.37美元,价格差距达35倍。

精选文章#DeepSeek V4 Pro#GPT-5.6 Sol#DeepSWE#成本分析#模型对比英文
Google DeepMind Blog 图标

Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

Google DeepMind Blog1562 字 (约 7 分钟)
85

Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别在效率、速度和网络安全应用方面有显著提升。

入选理由:Gemini 3.6 Flash 相比 3.5 Flash 输出令牌减少 17%,部分基准测试提升达 65%。

精选文章#Gemini#AI模型#DeepMind#机器学习英文
Together AI Blog 图标

Kimi K3 vs Claude Fable 5 on DeepSWE: Cost and Coding

Together AI Blog1176 字 (约 5 分钟)
85

Kimi K3在DeepSWE基准测试中以1/3成本超越Claude Fable 5,多次尝试后性能反超,但后者可靠性更高。

入选理由:Kimi K3单次任务成本仅4.65美元,为Claude Fable 5的1/3

精选文章#Kimi K3#Claude Fable 5#DeepSWE#模型比较英文
Strong results

Strong results

Aravind Srinivas(@AravSrinivas)83 字 (约 1 分钟)
85

Kimi K3在软件工程任务中性能与Claude Fable 5相当,但价格仅为后者35%。

入选理由:Kimi K3价格仅为Claude Fable 5的35%但性能相同

精选推文#模型对比#软件工程#AI性能#成本效益英文
昨天又有一个新的 coding benchmark  DeepSWE:https://t.co/3V65OaHScM

创新是无污染的任务,就是所有任务全新原创,从零编写,未基于现有 PR/Commi...

DeepSWE 是一个全新的编程基准测试,涵盖多种语言和真实世界复杂度,参考解决方案平均需要修改 668 行代码。

入选理由:DeepSWE 是一个全新的编程基准测试,涵盖多种语言和真实世界复杂度。

精选推文#DeepSWE#编程基准测试#GPT-5.5#多语言#真实世界复杂度中文
Claude Opus 4.8 Full Breakdown & Testing (AI News You Can Use)

Claude Opus 4.8 全面解析与实测(实用AI资讯)

The AI Advantage3130 字 (约 13 分钟)
72

Claude Opus 4.8是Anthropic对4.7版的快速修正,重点提升对模糊指令的理解能力以回归4.6的“用户友好”风格;虽在官方基准测试中表现优于GPT-4.5,但真实世界工程基准DeepSWE显示GPT-4.5当前更胜一筹,且4.8尚未参与该测试。

入选理由:Opus 4.8通过增强歧义理解能力修正了4.7过度字面化的问题,目标是恢复4.6版本广受好评的‘vibes’体验。

精选视频#Claude#Anthropic#大模型评测#DeepSWE#Agentic AI英文
DeepSWE 关于 Opus 4.8 的评分来了,强于 4.7 ,而且成本更低,效率更高,但是仍然落后 GPT5.5 很多,我还没有深度使用。甚至我还在用 4.6,没别的原因,就是便宜。

而且我现...

DeepSWE 评测显示 Opus 4.8 性能优于 4.7,成本更低、效率更高,但远逊于 GPT-5.5;作者仍用更便宜的 4.6,因价格优势;并质疑 Benchmark 可信度,更信真实用户反馈。

入选理由:Opus 4.8 性能强于 4.7,同时具备更低推理成本与更高效率,但未达 GPT-5.5 水平。

精选推文#大模型#评测#Opus#GPT-5.5#成本效益中文

跨材料问答 · DeepSWE

回答基于:DeepSWE 相关 17 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容