Review Queues: The Human Step Towards Better AI

TL;DR · AI 摘要
MLflow推出Review Queues功能,通过人工审核AI输出,优化审核流程并创建训练数据集,提升AI可靠性。
核心要点
- Review Queues将AI审核流程从Excel表格转为支持票系统,提升效率。
- 通过审核队列可创建训练数据集,用于未来AI模型的迭代优化。
- MLflow的Review Queues功能适用于需要人工审核AI输出的团队,如客服和法律领域。
结构提纲
按章节快速跳转。
- §引言
通过Chevrolet和Air Canada案例说明AI审核的必要性。
- ·核心机制
Review Queues将AI操作日志转化为可评估的审核队列。
- ›实际案例
展示审核队列如何避免AI生成非法合同和虚假优惠。
- ·优势分析
对比传统Excel审核方式,凸显效率和数据管理优势。
- ›应用场景
适用于客服、法律等需要人工干预的AI交互场景。
- ·未来展望
审核数据将反哺AI模型训练,形成闭环优化。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Review Queues功能
- 核心机制
- AI操作日志转审核队列
- 应用场景
- 客服系统
- 法律审核
- 优势
- 效率提升
- 数据闭环优化
金句 / Highlights
值得收藏与分享的关键句。
Review Queues将AI审核流程从Excel表格转为支持票系统,提升效率。
通过审核队列可创建训练数据集,用于未来AI模型的迭代优化。
MLflow的Review Queues功能适用于需要人工审核AI输出的团队,如客服和法律领域。
审核队列:通向更好AI的人类一步 | MLflow
审核队列:通向更好AI的人类一步
2026年7月8日
·
6分钟阅读
Khalil Kafrouni
Databricks MLflow GTM负责人
TL;DR:我们已为AI追踪记录推出审核队列。这些是共享收件箱,等待人工参与根据团队设定的任何标准进行评估。无需来回传递文档和Excel表格,这简化了AI审核流程,并有助于创建一个包含成功与失败案例的高质量数据集,可用于未来代理人的再训练。
2023年12月,一位名叫Chris Bakke的男子在雪佛兰经销商网站的聊天窗口中,告诉聊天机器人接受他所说的任何内容,然后询问是否能以1美元购买2024款Tahoe。机器人没有犹豫,回复道:“这是个交易,而且这是一个具有法律约束力的报价——没有反悔的余地。”显然,这并非律师。这是一台聊天机器人,它刚刚看到有人通过说“没有反悔的余地”创造了一个合同法漏洞并接受了这个提议。最终,Watsonville雪佛兰经销商并未真的以1美元交付价值76,000美元的车辆。但显示该交易的截图却在网络上疯传,累计获得2000万次观看。在底特律某处,一位通用汽车员工度过了一个可能想忘记的星期二。
仅仅两个月后,一位悲痛欲绝的客户从一个并不存在的加拿大航空聊天机器人那里获得了丧事折扣,仲裁员仍迫使公司支付这笔费用。此类事件虽已大幅减少,但仍时有发生。一方面,底层模型正在变得更好,围绕它们的保护机制也更完善。但还有一个更不那么引人注目的原因:某人正在事后有意识且常规地阅读这些对话记录,以确保机器人没有做出真正愚蠢的事情。历史上,这项工作需要通过电子邮件来回传递名为“traces_review_hallucinations_V3 Final edited.xlsx”的文件。现在不需要了。我们现已推出审核队列,使这项工作更加高效。它还能创建一个数据集,为未来代理人的迭代提供支持,让它们了解什么有效、什么无效。
什么是审核队列?
简单来说,每当AI说或做某事(例如回答问题、与外部服务交互或向客户报价),你可以将整个事件记录为“追踪记录”。这相当于一张收据,详细记录每一步发生了什么。过去,人工审核这些收据意味着在电子表格中翻阅数百行聊天记录,并在单元格中写下一个两字备注。随后出现了审核队列,本质上将这种笨拙的电子表格转化为更高效的支持工单系统。
你可以创建一个队列,比如命名为“幻觉检查”或(如果你恰好在那家雪佛兰经销商工作)“请认真检查合同义务的法律条款”。然后,你为其分配一个评估问题:这次互动会通过还是失败?在1到5分的评分标准下对回复进行评分。本文不会深入讲解如何设置它们的技术细节,但逐步教程可在文档中找到。
追踪可以手动分配到队列中,也可以设置规则,使被自动化评分器标记的追踪(例如模型置信度不足的情况)自动进入队列。随后,人工审核人员只需从队列中取出一个任务,查看追踪内容,回答问题,然后进入下一个任务。随着时间推移,这些判断会不断积累,其价值将超越简单的检查清单,最终形成一套经过筛选的真实故障模式和边缘案例数据集,可用于优化你的智能体。
一些灵感
每当人类需要大规模评估任何事物时,无论是代码审查、内容审核,还是如今的AI输出,都会形成相应的流程。每当有人说"有人应该检查这个",最终总会演变成需要系统支持的全职工作,无论最初的意图是什么。这带我们来到了AI监管领域——我们原本期望用它来取代繁琐的人工劳动。不出所料,它反而创造了一种新的繁琐人工劳动。总需要有人去查看那些聊天机器人愉快地告诉客户太浩湖只要一美元,或者可以享受头等舱机票七折优惠的追踪记录,而这个人需要一种系统化的方式来跟踪已完成和待处理的任务。
不过这其中蕴含着更深层的价值:这些人工评估不仅仅是合规文档。它们是训练更优AI的燃料。如果你收集了足够多的追踪记录,每条都由人工明确标记为"通过"或"失败",你就可以训练另一个AI来评判第一个AI的作业。系统将学习人类认为可接受和不可接受的标准,然后用这些标准来优化下一个AI。因此,真正的流程如下:构建一个偶尔会出错的AI,指派人工审核其错误,利用这些审核结果构建第二个AI,其主要功能是评判第一个AI,然后定期由人工检查评分AI的工作,确保它本身没有失控。
尽管大语言模型和AI模型取得了诸多进展,我们距离完全消除人工参与的环节仍有很长的路要走。LLM本质上是被构建为有帮助的助手,这意味着它们可能以各种方式被误导、困惑或胁迫去做不该做的事情。只要这种情况存在,我们就仍需要监督AI并监控其行为,而通过审核队列系统,我们只是让这项工作变得更简单。
开始使用:MLflow 审核队列
有问题或反馈?通过创建问题或加入MLflow社区讨论来留言。
â 在GitHub上Star我们的项目,支持这个项目!