New Paper: Towards a science of AI agent reliability

TL;DR · AI 摘要
AI行业缺乏可靠的测量工具和定义来衡量AI代理的可靠性,新研究分解了12个维度并发现近两年能力进步并未显著提升可靠性。
核心要点
- AI行业缺乏可靠测量工具和定义
- 研究分解了12个可靠性维度
- 两年能力进步仅带来适度可靠性提升
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI代理可靠性研究
金句 / Highlights
值得收藏与分享的关键句。
AI行业缺乏可靠的测量工具和定义来衡量AI代理的可靠性。
我们能够将可靠性分解为12个不同的维度。
尽管能力进步迅速,但可靠性提升却很有限。
标题: 新论文:迈向AI代理可靠性的科学
来源 URL: https://www.normaltech.ai/p/new-paper-towards-a-science-of-ai
发布时间: 2026-02-24T13:07:19+00:00
Markdown 内容: _由 Stephan Rabanser、Sayash Kapoor 和 Arvind Narayanan 合著_
假设你听说了一款新的AI代理,它可以通过购物、编写代码、发送电子邮件或代表你处理客户来提高生产力。你应该信任它吗?这个代理能足够可靠地完成工作吗?毕竟,有很多关于代理出错的恐怖故事、新闻报道和案例研究。
令人惊讶的是,尽管AI代理的可靠性不足是众所周知的问题,但目前AI行业并没有好的工具来衡量可靠性,甚至没有一个可靠的定义。
Arvind 和 Sayash 一直在思考这个问题。去年秋天,我们迎来了博士后研究员 Stephan Rabanser,他的博士学位研究了更简单、更传统的AI系统中的可靠性问题。我们招募了几位独立研究人员,并发布了一个我们希望是全面的可靠性测量结果。我们的草稿论文名为《迈向AI代理可靠性的科学》(Towards a Science of AI Agent Reliability)。
我们借鉴了许多其他领域的见解,例如核安全和航空安全。我们能够将可靠性分解为12个不同的维度。在两个互补基准上评估14个模型后,我们发现近两年来的快速能力进步仅带来了适度的可靠性提升。你可以查看我们的交互式仪表板这里。

虽然我们的发现目前还很初步,但我们希望它们可以帮助解释许多业内人士对为什么AI代理的经济影响是渐进的而不仅仅是能力基准的碾压感到困惑。为了帮助社区系统地跟踪可靠性,我们计划推出一个AI代理“可靠性指数”。我们希望这将激励研究人员和行业投入努力以提高可靠性。
- 准确性还不够:可靠性有四个维度 (Accuracy isn't enough: four dimensions of reliability)
- 能力提升迅速,但可靠性改进有限 (Capability gains are rapid, but improvements in reliability are modest)
- 我们可能错在哪里 (Why we could be wrong)
- 部署者应该做些什么不同? (What should deployers do differently?)
- 研究人员和开发者应该做些什么不同? (What should researchers and developers do differently?)
- 我们的发现对AI进展意味着什么? (What do our findings mean for AI progress?)
- 进一步阅读 (Further reading)
当我们认为一位同事是可靠的,我们不仅仅是指他们大多数时候都能做对。我们指的是更丰富的内容:
- 他们始终如一地正确,而不是今天对明天错(一致性)
- 当条件不完美时,他们不会崩溃(鲁棒性)
- 当他们不确定时会告诉你,而不是自信地猜测(校准)
- 当他们确实犯错时,错误更可能是可修复的而非灾难性的(安全性)
不幸的是,AI代理通常根据单一指标进行评估,即任务的成功率平均值。在过去两年中,这一数值在许多任务上迅速上升,这就是为什么部署代理如此令人兴奋的原因。
安全关键工程领域(航空、核能、汽车)早在几十年前就认识到可靠性并不等于平均性能。这些领域独立地得出了上述四个维度:一致性、鲁棒性、可预测性和安全性(故障频率和严重程度)。
例如,核电反应堆保护系统必须在每次条件需要停机时做出相同的响应。汽车安全测试评估传感器故障和恶劣天气下的响应。核风险评估模型成千上万种可能的故障模式,并量化其概率。航空业目标是一亿飞行小时发生一次灾难性错误。
我们对这四个高层次维度进行了细化和分解,形成了十二个指标。然后,我们基于来自 OpenAI、Google 和 Anthropic 的 14 个模型测试了这些代理,涵盖了 18 个月的发布周期。我们使用了两个互补的基准:一个通用助手基准(GAIA)和一个客户服务模拟基准(TauBench)。每个任务运行五次,并且指令进行了改写。我们在工具和环境中注入了故障,以衡量其对这类故障的鲁棒性,并促使代理报告它们是否解决了任务,以衡量校准情况。总的来说,我们执行了 500 次总体基准测试运行。
我们发现,在 18 个月内,可靠性仅略有提高,而准确性有了显著提升。所有三大提供商的模型聚集在一起,因此这似乎是一个全行业的局限性(尽管有些情况下 Anthropic 的模型优于 OpenAI 和 Google 的模型)。
更具体地说,我们测量了以下标准:
- 一致性:能够在一次任务中解决问题的代理在相同条件下重复尝试时经常失败。许多模型难以给出一致的答案,结果的一致性得分从 30% 到 75% 不等。
- 鲁棒性:大多数模型能够优雅地处理真正的技术故障(服务器崩溃、API 超时)。但如果我们将指令重新表述为具有相同的语义意义,性能会大幅下降。
- 可预测性:代理并不擅长知道自己何时出错。这是所有模型中最弱的一个方面。当代理报告置信度时,通常信号很少。在一个基准测试中,大多数模型无法比随机猜测更好地区分正确预测和错误预测。
- 安全性:最近的模型在避免违反约束方面明显更好,尽管财务错误(例如错误收费)仍然是常见的失败模式。我们狭义地将安全性定义为在发生故障时受到有限损害,而不是更广泛的关注点,如对齐问题。我们仍在研究如何衡量安全性,因此将其单独报告,不计入总体可靠性分数。
- 规模的影响:更大的模型并不总是更可靠。扩大规模可以改善某些方面(校准、鲁棒性),但可能会损害一致性。行为更丰富的较大模型有时会显示出更多的运行到运行差异。
我们认为可靠性落后于能力,并且除非研究人员和开发人员将努力集中在提高可靠性作为独立于准确性的维度上,否则可靠性仍将是部署的障碍。我们可能有误的原因有三个。
首先,我们的维度和指标有一些主观性。我们通过扎根于现有的工程领域来尽量减少这种主观性。并且我们在进行实验之前最终确定了指标列表,以防止我们关于可靠性进展缓慢的假设影响我们选择指标。不过,我们欢迎其他研究人员提出衡量可靠性的替代方法,并强调目前我们的发现是初步的。
其次,也许如果准确性足够高,可靠性就不重要了。我们的指标精心设计,使得准确性提升不会自动带来可靠性提升。广义上来说,准确性关乎失败率,而可靠性关乎失败的本质。但如果代理在 99% 的时间里是准确的,也许我们可以容忍 1% 的错误,即使它是完全不可预测的。我们不同意这一点。我们认为,在高风险情境下的自主操作中,我们需要 3-5 个“九”的性能——99.9% 到 99.999% 的准确性——才能使可靠性成为非问题,但我们认为基于大型语言模型的代理尚未达到这一门槛。但时间会证明一切。
第三,可靠性进步慢于准确性并不一定意味着它在绝对意义上进展缓慢。如果我们向前推断当前的线性趋势,代理将在仅仅三年内达到 100% 的可靠性!我们认为线性模型没有意义,部分原因是预计每次减少一个数量级的不可靠性(1-可靠性)都会像前一次一样困难。也就是说,我们预计从 90% 到 99% 的可靠性跃升与从 99% 到 99.9% 的可靠性跃升难度相当,依此类推。但再次强调,我们只需要等待并观察。
假设我们是对的。这对部署者、研究人员和开发者以及那些追踪人工智能进展速度的人来说有着重要的含义。让我们逐一讨论。
明确区分自动化和增强。一个偶尔建议错误变量名的编码助手令人讨厌;一个管理工业工厂并产生高度变化输出的自主代理则是不可接受的。区别在于代理是用于增强人类的创造力还是直接做出决策。增强工具(副驾、搜索助手)由于有人审查输出,因此获得了可靠性“折扣”。在某些增强用例中,可靠性实际上可能是不希望的。例如,一个每次都生成相同故事的创意写作助手将无法胜任其工作。
顺便说一句,代理与人类合作的效果还远远没有得到理论化和量化。有一些早期的工作在评估人类-LM交互,但这些工作都早于自主代理出现,我们不知道有任何类似的研究探讨代理如何在多步骤任务中与人类合作。提升研究提供了一个有用的视角,但需要更广泛的代理关注的努力。
考虑可靠性来做出发布决策。对于自动化工具(无人值守的工作流程、面向客户的机器人),可靠性是不可谈判的。部署者应该在从沙盒环境迁移到生产环境之前考虑设置可靠性阈值,就像航空业在服务前需要认证一样。还有许多其他实践可以借鉴这些领域,例如围绕代理失败构建一个事件-报告文化。
虽然我们已经确定的指标作为理解可靠性的起点是有用的,但部署者应该根据他们特定的上下文和数据集建立自己的内部评估。
基准测试推动了人工智能的进步。大约一年半前,我们的论文《重要的AI代理》显示了代理基准测试所测量的内容与实际应用中的需求之间存在巨大差距。我们的新论文表明这种差距仍然存在。为了解决这种脱节,人工智能评估和开发实践都需要改变方向。
衡量可靠性。目前的方法是一次运行基准测试并报告准确性数字,这是一种浅显的性能度量方法。这相当于在完美天气下对汽车进行一次耐久性测试,并在通过测试后宣布其安全。在评估代理时,我们需要在不同条件下进行多次测试(测试结果的变化性),并在不同的条件下进行测试(评估适应性),以及持续不断地进行测试(当模型和环境发生变化时重新测试)。我们呼吁在报告准确性的同时报告可靠性概况,而不是替代它。
理解和提高可靠性。我们的实验表明,一致性与可预测性是阻碍模型更可靠的最大的缺口。代理开发者应明确改进这些弱点,可能通过有针对性的优化或改进支撑结构。特别是,代理应在可能失败时能够识别这一点并告知用户,并在失败时能够优雅地恢复。更具推测性的想法包括代理在开发过程中探索不同的策略,但在部署时遵循一致的执行计划,而不是每次解决同一任务时采用不同的方法,从而同时提供代理和工作流的最佳效果。
能力与可靠性之间的差距可能是为什么我们没有看到人工智能普遍预测的快速劳动力市场效应的原因之一。这不是唯一的原因。最近英国AISI的一份报告指出了通向通用人工智能的六个障碍。然而,该报告在高层次上讨论了每个障碍。
我们的论文可以看作是在其中一个障碍——可靠性——上增添了具体内容。我们识别出的四个维度中,没有任何一个维度在目前这个阶段被认为是解决了的,只有两个单独的指标(图中绿色部分)可以被认为是(初步)解决了的。

_未来关于通向通用人工智能的其他障碍的研究可能会揭示出在AI代理广泛部署之前必须改进的许多其他性能维度。_
在充实通向通用人工智能的其他障碍方面还有很多工作要做,类似于我们对可靠性的分析。我们猜测这将揭示许多其他维度和指标上的进展缓慢。关键问题是,通过一般方法如推理扩展和强化学习,代理是否会全面改善,或者是否需要费力的工作来改进可靠性、适应性、原创性等各个方面的性能。
- 完整的66页论文可在arXiv上获取,其中包括我们提议的指标定义、实验设置的详细信息以及关于我们建议和未来工作的扩展讨论。作者包括Stephan Rabanser、Sayash Kapoor、Peter Kirgis、Kangheng Liu、Saiteja Utpala和Arvind Narayanan。除了论文,我们还提供了一个交互式仪表板以使从业者能够深入研究各个模型、基准测试和可靠性维度。用于重现我们实验的代码可在GitHub上获取。
- 这篇论文是我们更广泛的努力的一部分,旨在推进人工智能代理评估科学。关键出版物包括《重要的AI代理》和《综合代理排行榜:缺失的人工智能代理评估基础设施》,后者最近被ICLR 2026接受。
- 我们的论文可以看作是基于扩展我们通过基准测试所测量范围的工作。例如,HELM引入了7个指标,包括校准和鲁棒性,并使用这些指标评估了数十种语言模型在著名基准测试中的表现。
当然,这并不是唯一的因素。基准测试仍然在数据污染问题上挣扎,因此它们可能会高估能力的进步。《人工智能作为普通技术》提供了一个有用的框架来理解能力进步与经济影响之间的障碍。可靠性属于产品/应用阶段。人为因素、社会因素和组织因素则位于下游。作为一个严重的案例研究,可以参见我们最近的文章《人工智能不会自动降低法律服务的成本》(AI Won’t Automatically Make Legal Services Cheaper)。