elvis(@omarsar0)

Nice paper showing just how far you can push an agent harness. In most setups, the default coding a...

8.5内容质量
Nice paper showing just how far you can push an agent harness.

In most setups, the default coding a...

TL;DR · AI 摘要

openJiuwen通过动态调整机制显著提升agent性能,基准测试成绩领先官方榜单。

核心要点

  • openJiuwen在SWE-bench Verified达到82.6%,Terminal-Bench 2.1达87.19%
  • rail-based composition实现模块化agent组合与动态调整
  • 运行时反馈机制使上下文和任务控制实时优化

结构提纲

按章节快速跳转。

  1. 指出传统agent harness的静态设计缺陷并引出openJiuwen解决方案

  2. 展示openJiuwen在SWE-bench和Terminal-Bench的领先成绩

  3. 解析rail-based composition和运行时反馈调整机制

  4. 说明模型策略固定而harness动态优化的设计哲学

  5. 通过语义诊断、执行结果和任务进度进行实时调整

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • openJiuwen
    • 技术特点
      • rail-based composition
      • 运行时反馈调整
      • 模块化架构
    • 性能指标
      • SWE-bench Verified 82.6%
      • Terminal-Bench 2.1 87.19%
    • 应用场景
      • 代码生成
      • 终端任务处理

金句 / Highlights

值得收藏与分享的关键句。

#Agent Harness#开源工具#基准测试#AI代理
打开原文

elvis on X: "一篇优秀的论文,展示了代理框架能被推动到多远的极限。在大多数设置中,默认的编码代理框架是静态的。功能在设计时就被固定,运行过程中无法改变执行方式。openJiuwen 是一个开源框架,旨在解决这个问题。它在 SWE-bench Verified 上达到 82.6%,在 Terminal-Bench 2.1 上达到 87.19%,分别领先官方排行榜最强条目 3.4 和 3.39 个百分点。关于 openJiuwen 的工作原理:基于轨道的组合方式让开发者能够在一个共享的执行基板上组装单个代理、委托子代理和群体流程。运行时通过语义诊断、执行结果和任务进度动态重塑上下文、反馈和任务控制,而模型策略始终保持不变,因此性能提升归因于框架本身而非底层模型。论文:

arxiv.org/abs/2608.27969

论文讨论:

academy.dair.ai/papers/openjiu…

2026年9月1日 下午8:23

7.4K

次浏览

7

条评论

4

个点赞

58

个转发

62