elvis(@omarsar0)
Nice paper showing just how far you can push an agent harness. In most setups, the default coding a...
8.5内容质量

TL;DR · AI 摘要
openJiuwen通过动态调整机制显著提升agent性能,基准测试成绩领先官方榜单。
核心要点
- openJiuwen在SWE-bench Verified达到82.6%,Terminal-Bench 2.1达87.19%
- rail-based composition实现模块化agent组合与动态调整
- 运行时反馈机制使上下文和任务控制实时优化
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- openJiuwen
- 技术特点
- rail-based composition
- 运行时反馈调整
- 模块化架构
- 性能指标
- SWE-bench Verified 82.6%
- Terminal-Bench 2.1 87.19%
- 应用场景
- 代码生成
- 终端任务处理
金句 / Highlights
值得收藏与分享的关键句。
openJiuwen在SWE-bench Verified达到82.6%,超越官方榜单3.4分
rail-based composition支持单体代理、子代理和群体流程的组合
运行时反馈机制通过语义诊断和执行结果实时重塑上下文
模型策略保持固定,性能提升归因于harness设计创新
#Agent Harness#开源工具#基准测试#AI代理
打开原文elvis on X: "一篇优秀的论文,展示了代理框架能被推动到多远的极限。在大多数设置中,默认的编码代理框架是静态的。功能在设计时就被固定,运行过程中无法改变执行方式。openJiuwen 是一个开源框架,旨在解决这个问题。它在 SWE-bench Verified 上达到 82.6%,在 Terminal-Bench 2.1 上达到 87.19%,分别领先官方排行榜最强条目 3.4 和 3.39 个百分点。关于 openJiuwen 的工作原理:基于轨道的组合方式让开发者能够在一个共享的执行基板上组装单个代理、委托子代理和群体流程。运行时通过语义诊断、执行结果和任务进度动态重塑上下文、反馈和任务控制,而模型策略始终保持不变,因此性能提升归因于框架本身而非底层模型。论文:
arxiv.org/abs/2608.27969
论文讨论:
academy.dair.ai/papers/openjiu…
2026年9月1日 下午8:23
7.4K
次浏览
7
条评论
4
个点赞
58
个转发
62