Google Developers Blog

Measuring What Matters with Jules

8.5内容质量

TL;DR · AI 摘要

Jules 是一种衡量 AI 编码代理洞察力的新方法,通过分析真实修复的错误来评估其对更高目标的理解。

核心要点

  • Jules 使用真实修复的错误作为评估 AI 编码代理的基准。
  • 通过聚类相关错误,Jules 揭示了开发者实际追求的更高目标。
  • AI 编码代理需要基于洞察力政策进行评估,而非仅依赖任务完成能力。

结构提纲

按章节快速跳转。

  1. AI 编码代理正在从被动助手转变为能够主动发现风险并提供洞察的引擎。

  2. 当前的基准测试主要评估代理完成任务的能力,但缺乏对目标的评估。

  3. Jules 的设计

    Jules 通过分析真实修复的错误,评估代理的洞察力政策。

  4. 使用 705 个内部错误构建初步基准,并测试代理的洞察力。

  5. 使用 LLM 对代理的洞察力进行评分,从 1(不相关)到 5(精确匹配)。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Jules:评估 AI 编码代理的洞察力
    • 目标与任务的区别
      • 当前基准测试侧重任务完成
      • 缺乏对目标的评估
    • Jules 的设计
      • 使用真实修复的错误作为基准
      • 聚类错误揭示更高目标
    • 评估方法
      • 使用 LLM 评分洞察力
      • 评分范围 1-5

金句 / Highlights

值得收藏与分享的关键句。

#AI#编码代理#评估方法#Google
打开原文

通过 Jules 测量真正重要的内容 - Google 开发者博客

Google Tag Manager (noscript)

结束 Google Tag Manager (noscript)

HTML

通过 Jules 测量真正重要的内容

2026 年 6 月 22 日

Nghi Bui

研究科学家

Georgios Evangelopoulos

Zack Elliott

软件工程师

分享

  • Facebook
  • Twitter
  • LinkedIn
  • 邮件

AI 编码代理正在迅速从被动助手(在被提示时完成任务)转变为积极引擎,这些引擎能够持续吸收上下文、发现潜在风险并在开发者提出问题之前提供诊断见解。这一演变的核心是从明确的任务转向目标,这要求代理探索代码库、发现相关的内容,并提供有助于引导开发者实现更高层次目标的诊断观察。

SWE-Bench 这样的公开基准测试代理完成任务(如修复一个明确定义的错误)的能力,但目前还没有针对目标的基准测试。在我们最近的论文《Agentic Coding Needs Proactivity, Not Just Autonomy》中,我们提出,主动代理必须根据其洞察策略进行评分——即决定什么重要、什么证据支持它,以及是否要打断开发者或保持沉默。

上面的图展示了主动代理编码引擎的设计。上下文流进入一个引擎,该引擎维护开发状态和开发者模型,发出见解(通知、提问、草稿、保持沉默),并从响应中学习。

利用真实的错误修复作为“真实情况”

基于我们在 Google Labs 对连续 AI 系统的工作,我们发现,构建能够根据洞察策略对主动代理进行评分的评估,需要建立一个“真实情况”。构建这种“真实情况”的一种方法是根据我们称为时间接近度和语义相似度的两个启发式方法,分析团队真实修复错误的历史。

我们的假设很简单:当工程师在短时间内提交并修复多个相关错误时,这些错误通常是单个底层工程努力的症状。围绕“沙箱超时错误”、“代理配置失败”和“网络隔离不稳定测试”的错误集群都指向一个共同的高层次目标,如“加强沙箱执行可靠性”。单独来看,每个错误都过于任务特定,无法作为目标。但它们一起揭示了更高层次的目标。

构建和测试我们的初步评估集

为了构建我们的初步基准并测试我们的假设,我们使用了来自 Google 内部代码库的 705 个错误(1,178 个 CL)来:

  • 聚类相关的历史错误,以揭示开发者实际追求的更高层次的“目标”。
  • 将每个聚类中的单个错误设为我们的“真实情况”目标,并将代码库恢复到修复前的确切状态,使代理从人类工程师开始的地方开始。
  • 允许代理在生成最终见解之前最多调查代码库三次(其“探索预算”,或 N)。
  • 使用 LLM 将代理预测的见解从 1(不相关)到 5(完全匹配)与我们的“真实情况”目标进行比较。
  • 通过跟踪代理的平均最高得分以及它成功生成高度准确匹配的频率(Hit@K)来衡量成功。

核心诊断逻辑有效:在单轮探索中,智能体始终能够识别出高度相关的洞察(平均得分 4.5/5)。它成功捕捉到了简单工程问题的主要信号。

探索预算至关重要:复杂且多方面的难题本身更具挑战性,但为智能体提供更多资源进行探索会带来显著回报。将探索预算从两轮增加到三轮后,智能体的 Hit@5 准确率(定义为在前 5 条推荐中出现正确诊断洞察的比率)从 33% 显著回升至 57%。这证明额外的探索轮次能够直接帮助智能体发现最初被遗漏的次要信号。

下一步

这些是初步结果,基于初始样本,我们正在多个方面积极扩展覆盖范围。首先,我们将此评估扩展到公共 GitHub 数据(包括问题和解决 Pull Request),以使这一方法广泛适用于更广泛的 AI 社区。我们还在探索如何引入更丰富的上下文流,如问题跟踪器、对话和设计文档,而不仅仅局限于代码库。

如需阅读完整论文,请点击此处。如果您对 Google Labs 在编码未来方面的工作感兴趣,可以关注我们的 labs.google/code 页面。

posted in:

  • Web
  • AI
  • 案例研究
  • 学习
  • 影响力

上一篇

下一篇

相关文章

列表

AI

案例研究

公告

A2A 如何构建协作代理的世界

2026 年 6 月 18 日

Web

教程

最佳实践

A2UI + MCP 应用:结合声明式和自定义代理 UI 的优势

2026 年 6 月 17 日

在 Google TPUs 上加速 LLM 推理:通过扩散风格的推测解码实现 3 倍加速

2026 年 5 月 4 日

移动

增强安全性和信任:Sign in with Google 的新会话元数据

2026 年 6 月 16 日

导航点