Arize AI Blog

How OpenAI uses human feedback to evaluate and improve LLMs

8.5内容质量

TL;DR · AI 摘要

OpenAI通过整合用户显式/隐式反馈构建了统一数据层,结合LLM管道和聚类分析实现自动化问题追踪,使截图可直接生成修复代码。

核心要点

  • OpenAI的反馈系统使截图能自动定位代码问题并生成pull request
  • LLM衍生管道使可操作信号量提升2-3倍
  • 基于嵌入的KNN聚类可发现分类法未覆盖的失败模式

结构提纲

按章节快速跳转。

  1. 展示OpenAI反馈系统如何将截图转化为自动修复流程

  2. 整合显式/隐式反馈的共享数据层使跨渠道问题可量化

  3. 从对话中提取修正信息使信号量提升2-3倍

  4. 分层分类法与嵌入聚类结合实现已知/未知失败模式检测

  5. MCPskills集成

    使反馈层可被Codex调用生成报告/PR

  6. 语音模式截图通过系统自动定位代码并生成修复

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • OpenAI反馈系统
    • 数据层整合
      • 显式反馈
      • 隐式反馈
    • 处理管道
      • LLM提取修正
      • KNN聚类分析
    • 应用层
      • MCP集成
      • 自动PR生成

金句 / Highlights

值得收藏与分享的关键句。

#LLMs#AI改进循环#OpenAI#反馈系统
打开原文

OpenAI如何利用人类反馈评估和改进大型语言模型 - Arize AI

OpenAI如何利用人类反馈评估和改进大型语言模型

发布于2026年7月21日

关键要点

• OpenAI通过共享数据层聚合显式和隐式反馈,使各团队能够跨渠道衡量相同故障。

• 基于LLM的反馈管道能够从对话中提取用户表达的修正意见,在符合条件的用户主动参与数据中,将可操作信号量提升2到3倍。

• 分层分类体系追踪已知故障模式,而基于嵌入的K近邻聚类则能发现分类体系未命名的模式。

• MCP和技能模块使反馈层能够被Codex和其他代理调用,从而将问题转化为报告、工单、根本原因调查或代码提交。

• 当相关集群失效且产品指标发生变化后,该闭环系统完成一次完整迭代。

OpenAI如何将语音模式错误报告转化为代码提交

在OpenAI构建反馈系统数月后,有人转发了ChatGPT语音模式的一个截图,其中图像渲染出现了异常。由于该截图既没有复现步骤,也没有预估影响范围,通常会引发一场在支持队列、日志和所有权图表中寻找线索的"寻宝游戏"。通过内部技能模块和MCP,Codex搜索了相关反馈,定位到元数据指向正确日志的相关对话,追踪到代码库中的故障点,并生成了报告和代码提交。

OpenAI未来工作组织的技术员工Stuart Sy称这是首次看到"神奇闭环"的雏形。一张偶然的截图之所以能转化为有证据支持的工程任务,是因为系统能够回答图像本身无法提供的问题,包括故障发生的频率、遇到该问题的用户群体、报告之间的生产环境关联,以及代码中问题的具体位置。

这种情况揭示了当代理能够快速实施变更后,工程瓶颈的转移方向。团队仍然需要可靠的方法来判断哪些故障值得关注、收集足够的上下文信息复现问题、将问题路由到正确的负责人,并验证修复是否改变了生产环境行为。这种从人工调试到系统化AI改进闭环的转变,也在其他Arize Observe 2026会议中得到了印证。

代码生成将瓶颈转移至下游

Sy从一个大多数开发团队已经感受到的软件经济变化开始阐述。"生成代码成本低廉,设计也容易且廉价,"他说。一个原型可能在数小时内完成,而周围组织可能仍需要数天时间才能发现用户反复遇到相同问题。

随着实现速度的加快,高带宽学习循环的价值也随之提升。一个能将交付速度提升十倍的团队,如果其对生产环境的理解仍被困在每周支持摘要、分散的电子表格和Slack中传递的截图中,将难以获得实质性的收益。

原始数据来源丰富,尽管这些数据会通过具有不同偏差的工具进行采集。Reddit 和 X 能够快速揭示开发者情绪,而损坏的连接器更可能出现在支持工单或错误报告中。消息评分捕捉了用户点击的意愿,销售电话捕捉了需要直接关注的重要客户,而访谈则捕捉了被邀请进入房间的小群体。每个渠道都描述了产品的真实部分,但没有一个渠道能提供完整的图景。

OpenAI 的解决方案是在共享系统中对这些信号进行标准化处理,同时保留其来源信息。Sy 将目标描述为一条可重复的路径:“从直觉到证据,再到行动”。从工程角度来说,公司正在构建一个用户体验的可观测性和控制层,这与生产环境中 LLMOps 反馈循环模式(将追踪数据转化为更智能代理)密切相关。

反馈转化为事件流

在代理能够对反馈进行推理之前,组织需要决定哪些内容被视为反馈事件。OpenAI 最初通过整合 Google Sheets、Airtable 和团队特定流水线中积累的材料开始了这项工作。统一在概念上是直接的,但在操作上却繁琐,这通常是后来显得显而易见的基础设施的特征。

采用相同模式的小型团队可以通过一致的记录来表示每个信号。一个概念性的事件可能如下所示:

复制代码

已复制

使用不同浏览器

code
feedback_event = {
    "source": "chat_correction",
    "product_surface": "voice_mode",
    "conversation_id": "...",
    "trace_id": "...",
    "raw_feedback": "...",
    "taxonomy_path": ["rendering", "image_output"],
    "embedding": "...",
    "classifier_version": "...",
    "confidence": 0.91,
}

尽管这是基于 Sy 描述的架构,但 OpenAI 的生产实现仍然是专有的。

由于原始文本保留了证据,而标识符将体验与运行时上下文连接起来,团队可以跨模型、提示和分类法变更审计每个派生标签。源元数据还可以防止将 Reddit 的峰值误认为是完整用户群体的代表性样本。

没有来源信息的共享存储库很快会变成轶事仓库。一个有用的事件模型使团队能够跨渠道统计相同的失败情况,检查代表性示例,将投诉与追踪或日志关联,并在分类器变更时重新处理历史数据。

最有价值的投诉可能从未提交

直接反馈具有陡峭的参与曲线,Sy 通过询问观众中有多少人使用过 ChatGPT、对响应进行评分、提交错误报告并联系支持来证明这一点。每一步举手的人数都在减少。

大多数会话处于安静的中间地带,体验令人失望到足以改变行为,但仍然无法激发正式报告。然而,在对话式产品中,下一个用户的回合通常包含缺失的信号。当有人回复:“不,这是错误的,因为 XYZ。请修复”,这个纠正包含了不满、诊断,有时还包含预期的答案。

OpenAI 使用 LLM 从参与模型训练的用户涉及的对话中提取结构化、合成的反馈。据 Sy 介绍,额外的信号使可操作反馈的数量增加了两到三倍。

该提取器的作用相当于一个评估器,因此其设计需要与生产测量一样严格。其模型和提示词需要进行版本控制,其分类需要经过审核的校准数据集,其置信度策略需要允许保留意见。按类别计算精度也很重要,因为当风格投诉和安全失败被错误分类时,它们带来的成本不同——这种严谨性同样体现在必须在生产环境中运行的LLM作为裁判的系统中。没有这些控制措施,分类器的更新可能会伪装成产品趋势。

由于隐私边界应属于同一设计,团队需要为资格、保留、访问、脱敏以及被允许检索原始对话的下游代理制定明确规则。只有当收集政策对系统负责人保持可读性时,聚合信号才有价值。

称为“Goblin Mode”的事件同时体现了机会和局限性。一段时间内,一个模型人格不断在不恰当的地方引入哥布林、 trolls和其他幻想生物。分析器可以将用户随后的更正转化为结构化标签,例如风格失败、无关上下文或相关性不足。

然后分类法遇到了一个非常具体的问题。正如Sy所问:“如果不存在哥布林节点怎么办?”

分类法赋予系统记忆,而聚类带来新颖性

分层分类法在团队和版本之间创建了连续性。当产品、模型和平台团队使用相同定义时,他们可以比较类别数量、受影响的界面、用户群体以及部署后的变化,而无需重新构建每个标签的含义。

这种层次结构还编码了组织已知的信息。一个“Goblin Mode”投诉可能属于响应质量、相关性和风格的子类别,这使其在趋势线中即使在有人专门为幻想生物入侵创建专用类别之前也能被识别。

由于新兴故障需要第二个传感器,OpenAI使用嵌入、K近邻方法和LLM辅助,在最近的反馈窗口中搜索符合有用大小和质量阈值的聚类。新聚类可以生成报告,而调查人员可以从单条推文或截图开始,询问是否在其他地方出现过类似报告。

分类法揭示了已知故障是否激增,而聚类则询问哪些新行为开始汇聚。最强的系统允许这些聚类升级为维护资产。一旦审核人员确认模式,代表性示例可以用于生成评估器,聚类可以获得稳定的名称,问题可以同时进入分类法和回归语料库。

因此,聚类成为对产品测量系统的一项拟议更改。它识别出需要命名、测试、负责人和部署后查询的故障——这是AI工程中“循环”概念的操作核心。

MCP将反馈层转化为工作内存

OpenAI的第一个输出是一个内部应用,团队可以在其中浏览分类法趋势、检查类别,并向基于聊天的数据代理提问,例如用户对某个模型版本的看法。

虽然该应用使数据变得可搜索,但组织行动仍取决于答案的落点。ChatGPT iOS应用的产品经理可能希望在特定Slack频道中获得每周痛点报告,而调查错误的工程师则需要对话内容、日志引用、受影响版本和代码上下文。

通过MCP和可重用技能暴露共享层,OpenAI使反馈系统可以从Codex和其他代理调用——将数据层转变为更接近代理工具包的结构,不仅能展示数据,还能启动工作。现在相同的数据可以支持定时报告、类别激增警报、Linear工单、根本原因调查和拉取请求。产品经理可以在本地迭代工作流,然后将提示、工具、输出格式和计划提交给平台服务,在云端运行。

数据层已获得工具接口,并因此具备启动工作的能力。这种转变至关重要,因为仪表板会将解释的负担施加给查看者,而代理工作流可以将有限的决策产物直接传递到团队已有的操作场所。

每个自动化操作都需要证据协议

由代理生成的工单或拉取请求应附带足够上下文,使人工审核者能够判断问题本身和提出的解决方案。至少,该证据包应包含:

  • 分类路径或聚类标识符
  • 估计普及率
  • 带有来源信息的代表性示例
  • 受影响的产品版本
  • 对话或追踪引用
  • 分类器置信度
  • 可能的责任人
  • 决定问题是否解决的指标

缺少该证据包时,自动化仅会将模糊性从支持队列转移到工程队列。拥有该证据包后,Codex可以从观察到的故障开始,并获得调查所需的上下文。

当反馈事件携带对话或追踪标识符时,反馈基础设施与可观测性相结合,使调查者能够从语义聚类直接进入产生体验的具体代理运行。对于使用AX或Phoenix的团队,该链接可以将用户报告连接到塑造结果的底层模型调用、工具活动、检索、延迟和错误——参见AX追踪和Phoenix中的追踪工作原理。当团队在合并前验证AI生成的代码时,同样的以证据优先的模式也会出现。

语音模式渲染案例之所以成功,是因为系统用邻近报告、相关对话和日志引用丰富了截图,使Codex能够带着关于范围和原因的可信假设进入代码库。

聚类成为生产回归测试

报告打开次数、生成的工单、被接受的拉取请求以及受系统影响的决策都提供了有用的采用信号。Sy认为,持久的衡量标准出现在修复发布后,当相关类别或聚类开始下降且关联产品指标改善时。

对开发者而言,这一要求将聚类转化为生产衍生的回归测试集。团队可以保存代表性示例,定义检测行为的评估器,用旧版和新版的追踪进行运行,并在部署后继续监控受影响部分。

衡量标准需要与任何其他评估一样严谨。集群数量应根据合格流量进行归一化处理,分类器版本应保持固定或对历史数据重新评分,团队应关注相邻类别以防出现位移现象。一个渲染错误从一个标签消失后又在另一个标签下重新出现,这改变了仪表盘但未改变用户体验。

最清晰的闭环标准结合了三种证据形式:候选修复通过了审核的回归测试集,生产集群率在使用修复版本的用户中下降,相关产品指标向预期方向移动。这种组合为系统提供了一种区分已发布代码与已解决问题的方法。

小型团队的实用落地路径

大多数团队无需复现OpenAI的规模即可构建相同的架构形态。Sy的建议是避免试图一次性解决所有问题,这表明应刻意选择一个狭窄的初始循环。

  • 选择一个产品界面和一个可衡量的失败点。工具调用错误、无关检索、入职停滞或重复出现的风格问题,为团队提供明确的目标和清晰的闭环指标。
  • 创建标准反馈事件。整合现有渠道,保留原始文本和来源信息,尽可能附加对话或追踪标识符。模式应支持重新处理,因为分类体系和分类器会持续演进。
  • 引导构建分类体系,然后评估分类器。LLM或编码代理可从反馈样本中提出初始层级,领域专家则完善定义、审核标注测试集,并对每次分类体系和分类器变更进行版本控制。
  • 在滚动窗口上添加聚类分析。使用嵌入向量提取密集且近期的群体,这些群体需满足大小和连贯性的最低阈值。在将其升级为警报、评估案例或永久分类节点前,需先审查这些群体。
  • 通过团队现有工具暴露该层。每周Slack摘要可能是合适的初始输出,而成熟的工作流可能创建包含证据包的Linear或Jira工单。当代理需要直接查询该层时,MCP和技能变得有用——这与代理操作手册中"掌控循环"的理念一致。
  • 将部署与验证连接。保存修复前的示例,对候选变更运行评估器,并安排生产查询以检查发布后的集群状态。每个问题都应有自己明确的完成定义。

首个版本可以较小,因为复合价值来源于重复。每个审核的集群都会完善分类体系,每次修正都会提升评估器,每个闭环问题都会教会路由系统未来调查所需的证据类型。

生产环境的学习速度取决于反馈循环

OpenAI的反馈引擎通过组合获得杠杆效应:共享数据模型、隐式反馈评估器、稳定分类体系、新兴模式发现、代理工具接口,以及部署后检查以验证问题是否缓解。

语音模式截图变得有价值,是因为系统能够找到其邻居,将其连接到生产环境上下文,将证据交给Codex处理,并在代码部署后监控结果。看似微小的渲染错误实际上暴露了自优化产品循环的架构。

随着实施成本降低,从生产环境中学习的能力成为可持续竞争优势的来源。每个投诉都可以扩展评估数据集、提升技能、明确分类,并缩短下一次调查的时间。Sy将这个过程称为“量化直觉”。这一表述背后是一项严肃的工程学科:产品会记住失误,编码教训,并监视其再次出现。

在此观看Stuart Sy完整的Arize Observe 2026演讲视频。如需了解构建智能体改进系统的相关内容,可从《AI智能体手册》开始阅读。

<div class="container pt-12"> <div class="max-w-[1200px] mx-auto"> <div class="flex items-center justify-between"> <h4 class="font-sans text-24/[120%] md:text-36/[120%] font-light text-content-primary-light dark:text-content-primary-dark">相关文章</h4> </div> <div class="flex gap-6 mt-6 md:flex-row flex-col"> <div class="flex-1"> <a href="https://arize.com/blog/what-is-ml-observability/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="224" src="https://arize.com/wp-content/uploads/2021/06/ML-Observability-1-300x224.png" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" fetchpriority="high" srcset="https://arize.com/wp-content/uploads/2021/06/ML-Observability-1-300x224.png 300w, https://arize.com/wp-content/uploads/2021/06/ML-Observability-1-1024x763.png 1024w, https://arize.com/wp-content/uploads/2021/06/ML-Observability-1-768x572.png 768w, https://arize.com/wp-content/uploads/2021/06/ML-Observability-1.png 1225w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">什么是机器学习可观测性?</h4> </a> </div> <div class="flex-1"> <a href="https://arize.com/blog/the-ai-ecosystem-is-a-mess/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="300" src="https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-300x300.jpeg" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" srcset="https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-300x300.jpeg 300w, https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-1024x1024.jpeg 1024w, https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-150x150.jpeg 150w, https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-768x768.jpeg 768w, https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-1536x1536.jpeg 1536w, https://arize.com/wp-content/uploads/2021/04/AdobeStock_100337594-2048x2048.jpeg 2048w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">AI生态系统是一团糟</h4> </a> </div> <div class="flex-1"> <a href="https://arize.com/blog/vectara-agentic/" class="group"> <div class="rounded-[4px] aspect-video bg-container-light border border-outlines-light dark:border-outlines-dark group-hover:shadow-platform-glow flex items-center justify-center"> <img width="300" height="200" src="https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-300x200.png" class="w-full h-full object-cover wp-post-image" alt="" decoding="async" srcset="https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-300x200.png 300w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-260x173.png 260w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-520x347.png 520w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-60x40.png 60w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-120x80.png 120w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM-150x100.png 150w, https://arize.com/wp-content/uploads/2024/10/Screenshot-2024-10-02-at-12.38.05 PM.png 684w" sizes="(max-width: 300px) 100vw, 300px" loading="lazy" /> </div> <h4 class="mt-3 font-normal mb-0 font-sans text-20/[140%] text-content-primary-light dark:text-content-primary-dark text-pretty">使用Vectara-agentic和Arize构建AI助手</h4> </a> </div> </div> </div> </div>