Nice paper showing just how far you can push an agent harness. In most setups, the default coding a...
openJiuwen通过动态调整机制显著提升agent性能,基准测试成绩领先官方榜单。
入选理由:openJiuwen在SWE-bench Verified达到82.6%,Terminal-Bench 2.1达87.19%
论文
别名:TB2.1
评估AI模型推理能力的基准测试框架
已跟踪 11 条高相关材料
最近变化
2026-09-01 · openJiuwen在SWE-bench Verified达到82.6%,Terminal-Bench 2.1达87.19%
为什么值得关注
Terminal-Bench 2.1 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Nice paper showing just how far you can push an agent harness. In most setups, the default coding a...
elvis(@omarsar0) · 8.5 分
openJiuwen通过动态调整机制显著提升agent性能,基准测试成绩领先官方榜单。
> open source AI summer ☀️
Julien Chaumond(@julien_c) · 8.5 分
开源AI模型在性能和多样性上取得显著进展,DeepSeek-V4-Flash-0731等模型推动行业创新。
Poolside’s Laguna S 2.1: the model factory delivers
Air Street Press · 8.5 分
Poolside的Laguna S 2.1模型在参数规模和训练效率上表现突出,适合关注AI模型工厂的工程师。
已收录 11 条与 Terminal-Bench 2.1 相关的内容,按评分排序。
openJiuwen通过动态调整机制显著提升agent性能,基准测试成绩领先官方榜单。
入选理由:openJiuwen在SWE-bench Verified达到82.6%,Terminal-Bench 2.1达87.19%
开源AI模型在性能和多样性上取得显著进展,DeepSeek-V4-Flash-0731等模型推动行业创新。
入选理由:DeepSeek-V4-Flash-0731模型参数量达304B,采用MoE架构
Poolside的Laguna S 2.1模型在参数规模和训练效率上表现突出,适合关注AI模型工厂的工程师。
入选理由:Laguna S 2.1拥有1180亿参数,量化后可运行于单台NVIDIA DGX Spark
Poolside AI的Laguna S2.1是当前在本地运行的最佳编码模型之一,其在Terminal-Bench 2.1和DeepSWE基准测试中表现优异。
入选理由:Laguna S2.1在Terminal-Bench 2.1得分70.2,超越5-25倍参数量的模型
Grok 4.5在终端基准测试中超越GPT-5.5且成本降低80%,但缺乏技术细节披露。
入选理由:Grok 4.5在Terminal Bench 2.1测试中较Opus 4.8 Max提升83.3%
OpenAI 发布 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三款模型,强调性能与效率的平衡,并引入多 Agent 协作机制。
入选理由:GPT-5.6 Sol 在 Terminal-Bench 2.1 基准测试中达到 91.9% 的性能。
Sakana Fugu 是一种基于多模型协调的系统,宣称能媲美 Fable 和 Mythos,但实际性能略逊,且其本质是模型路由而非单一模型。
入选理由:Sakana Fugu 是一种多模型协调系统,而非单一模型。
豆包2.1 Pro模型在芯片设计、代码生成等任务中表现优异,性能接近甚至超越国际头部模型,且价格仅为国外同类产品的四分之一。
入选理由:豆包2.1 Pro在Terminal Bench 2.1测试中与Claude Opus 4.7持平,在SciCode测试中甚至超越Opus 4.7和GPT-5.5。
MiniMax 推出 M3 开源模型,首次融合编码、代理与长上下文能力,在 SWE-Bench Pro 等基准上达 59%+,支持 1M 上下文窗口,推动开源大模型向多能型前沿迈进。
入选理由:MiniMax M3 在 SWE-Bench Pro 基准测试中取得 59.0% 正确率,领先多数开源模型。
GPT-5.6 仅向 20 家政府审批合作伙伴开放,普通用户暂无法使用。
入选理由:GPT-5.6 仅向约 20 家政府审批合作伙伴开放,普通开发者和用户无法使用。
GPT-5.6 Sol在Terminal-Bench 2.1测试中表现优异,但信息量不足,缺乏技术细节。
入选理由:GPT-5.6 Sol在Terminal-Bench 2.1测试中达到新高度。