meng shao(@shao__meng)

Lilian Weng 分享:如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ? 这篇 blog 是她把最近散落在 auto-research、自改进 a...

8.5内容质量
Lilian Weng 分享:如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ?

这篇 blog 是她把最近散落在 auto-research、自改进 a...

TL;DR · AI 摘要

Harness Engineering 是推动 AI 递归式自我改进(RSI)的关键,通过优化部署系统而非直接修改模型权重实现进展。

核心要点

  • Harness 层与基座智能同等重要,Claude Code 等案例验证其价值
  • MCE 通过双层优化提升 context 管理,skill 实例化为文件目录
  • DGM 在 SWE-bench Verified 上从 20% 涨到 50%,但依赖强基座模型

结构提纲

按章节快速跳转。

  1. 定义 RSI 与 Harness Engineering 的关系,强调系统优化优先于模型权重修改

  2. Harness 是 RSI 近期主战场,需通过系统设计而非模型重写实现递归改进

  3. 归纳 Workflow Automation、File System as Memory、Sub-agent 三类基础模式

  4. 从 Context Engineering 到 Meta-Harness 的多层优化路径

  5. DGM 在代码生成任务中实现性能提升,但存在算力与领域局限

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Harness Engineering 推动 RSI
    • 设计模式
      • Workflow Automation
      • File System as Memory
      • Sub-agent
    • 优化方法
      • ACE/MCE
      • Meta-Harness
      • Evolutionary Search
    • 案例验证
      • DGM 性能提升
      • SWE-bench 验证

金句 / Highlights

值得收藏与分享的关键句。

#AI#Harness Engineering#RSI#Context Engineering
打开原文

meng shao on X: "Lilian Weng 分享:如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ? 这篇 blog 是她把最近散落在 auto-research、自改进 agent、进化式程序搜索等方向的工作进行的一次收敛沉淀,推荐大家阅读: https://t.co/OIcqDY1YpJ # 核心论点:Harness 是 RSI 的近期主战场 Lilian https://t.co/ZpSqaY9zj9" / X

meng shao

@shao__meng

Lilian Weng 分享:如何通过 Harness Engineering 推动 AI 的递归式自我改进 (RSI) ? 这篇 blog 是她把最近散落在 auto-research、自改进 agent、进化式程序搜索等方向的工作进行的一次收敛沉淀,推荐大家阅读:

lilianweng.github.io/posts/2026-07-…

核心论点:Harness 是 RSI 的近期主战场 Lilian 认为,真正的 RSI 短期内不会从"模型直接重写自身权重"开始,而会从"模型改进部署它的系统"开始。这里的"部署系统"就是 harness——围绕基座模型编排执行、决定其如何思考/规划/调用工具/感知上下文/管理记忆/评估结果的系统。Claude Code、Codex 等成功 coding agent 已经证明:harness 层与基座智能同等重要。 这一定位把文章的视野从"模型智能"转向"运行时与软件系统设计",并明确了一条优化对象的演进路径: 指令 prompt → 结构化 context → workflow → harness 代码 → optimizer 代码 # Harness 设计模式 文章归纳了三类基础设计模式,强调应当简单、通用、贴近已有软件工程实践(从而受益于预训练知识),并把 harness 类比为操作系统——封装复杂逻辑、对外接口简洁。 1. Workflow Automation:plan–execute–observe/test–improve 的目标导向循环,运行在 agent runtime 上而非静态 prompt。 2. File System as Persistent Memory:长程任务中日志、diff、轨迹远超上下文窗口,应将持久状态写入文件,而非全塞进 context。读写文件(通常经 bash)是 LLM 的基础能力,自然受益于模型进步。 3. Sub-agent & Backend Jobs:显式、可检视的并行——子 agent 输出应落盘为文件/日志/状态记录,使其可中断恢复、可被主 agent 推理回溯。 Coding agent 案例显示,主流 harness 的工具集已经稳定:文件系统、shell、LSP/git、外部 context(MCP/Skills)、web、artifacts、后台进程、子 agent 委派。 # Harness 优化:从 context 到 meta-harness 1. Context Engineering 长程任务中 context 会爆炸。两条进化的脉络: · ACE(Agentic Context Engineering):把 context 视为"演化的 playbook"而非不断加长的 prompt。Generator/Reflector/Curator 三组件维护一组 (identifier, description) 结构化条目,定期去重精炼。仍是手工规则。 · MCE(Meta Context Engineering):双层优化——内层在给定 skill 下优化 task context,外层在验证集上搜索最优 skill(即 context 管理机制本身)。skill 被实例化为文件目录(skill.md + 动态 rollout),由 meta-agent 在 coding 环境中做"交叉进化"。机制与内容解耦是关键。 · Meta-Harness:再深一层——优化对象是"决定如何存取、呈现信息的代码"。Proposer 本身是 coding agent,最终输出 Pareto 前沿上的 harness 候选集。结论是:一旦 harness 设计成为可执行搜索空间,强 coding agent 就能利用人类工程师使用的同一设计空间。 2. Workflow Design · 手工流派:AI Scientist(idea→实验→写作→评审全流水线)、ScientistOne(以可验证性为核心约束,Chain-of-Evidence 审计每条 claim)、Autodata(challenger/weak solver/strong solver/verifier,制造"strong 通、weak 不通"的恰到好处难度数据,但作者指出它更像"间接蒸馏",RSI 味不足)。 · 搜索流派:ADAS 把 agent 设计本身作为优化问题,meta-agent 用代码生成新 workflow 并自 refine;AFlow 把 workflow 表为图,用 MCTS 优化,在 QA/code/math 上超过人工设计与 ADAS。 3. Self-Improving Harness · STOP(Zelikman 2023):递归地"改进改进器" $ I_t = I_{t-1}(\hat u, I_{t-1}; M)$。重要警示——STOP 在 GPT-4 上有效,在 GPT-3.5/Mixtral 上反而退化。递归结构本身不够,基座必须足够强。 · Self-Harness:propose–evaluate–accept 闭环,三阶段——weakness mining(聚类失败模式,区分表面同因异果)、harness proposal(在受约束的可编辑面上提 bounded edits)、proposal validation(held-in 与 held-out 双重回归测试才合并)。实验显示它能学到针对不同基座模型弱点的 model-specific 指令。作者警惕:若允许编辑 OS 系统就会破坏抽象边界,权限与安全层必须在该循环之外。 4. Evolutionary Search 适合"搜索空间大、形状怪、难用梯度但易评估"的场景。从 Promptbreeder/GEPA 的 prompt 进化,到 AlphaEvolve 的 coding agent 进化(# EVOLVE-BLOCK 标记可变区域、meta-prompt 共进化),再到 ShinkaEvolve 的样本效率改进(parent 采样、embedding 新颖性拒采、meta-scratchpad 模式复用)。 5. Darwin Gödel Machine(DGM) 把进化目标明确指向"可编辑的 harness 代码库",agent 被允许修改自己的 harness;Hyperagents 再加一层 meta-agent 控制任务 agent 的生成。DGM 在 SWE-bench Verified 上从 20% 涨到 50%。局限:仅在"自动可评估、fitness 易量化"的领域(矩阵乘、GPU kernel、调度、竞赛)表现好;评估慢/模糊/启发式为主的领域吃力;算力与效率仍是问题。 6. Joint Optimization with Model Weights SIA 是早期尝试:Meta-Agent 提初始 harness、Task-Specific Agent 执行、Feedback-Agent 决定下一轮改 harness 还是改权重。作者明确指出其实验有混杂因素(任务 agent 用 gpt-oss-120b,meta/feedback 用 Sonnet 4.6;baseline 偏弱),方向有趣但证据尚属初步,训练稳定性与 Goodhart 效应仍未解。 # 未来挑战 Trehan & Chopra 2026 的最小 scaffolding 实验归纳出六种反复出现的失败模式:偏向训练数据默认值、执行压力下的实现漂移、长程记忆退化、过度乐观("数字胶带"+ 宣布胜利)、领域直觉不足、科学品味薄弱。在此基础上,作者列出通向完整 RSI 的七大瓶颈: 1. 弱且模糊的评估器:当前自改进 loop 只在指标客观可测时好用,研究品味/新颖性/长期科学价值难以度量。 2. Context 与记忆生命周期:context engineering 应当成为智能的一部分,而非仅停留在软件层。 3. 阴性结果:训练数据成功偏置严重,模型不擅于放弃假设、报告负结果;harness 应让失败易保留——失败是裁剪搜索空间最好的信号。 4. 多样性坍缩:进化与 RL 易剥削已知高奖励模式,需要防种群塌缩为同一解的变体——这在开放式研究中尤为致命。 5. Reward hacking:评估器与权限控制必须坐在进化 loop 之外,配 held-out 测试、trace 审计、关键决策点人工复核。 6. 长期成功:sandbox RLVR 训练几乎捕捉不到可维护性、所有权边界、迁移成本、向后兼容、未来调试负担。 7. 人的角色:人应当沿栈上移而非被移除——在正确的时机、正确的抽象层提供 oversight。

Lilian Weng

@lilianweng

8h

new post on harness engineering for AI self-improvement:

It is hard to forecast how much the future of RSI will rely on harnesses. Likely harness engineering will evolve in the direction of self-improvement and enable auto-research, and, in turn, smarter

Show more

6:49 AM · Jul 7, 2026

2.6K

Views

2

5

1

7

17

0

20

Read 2 replies