Build Trust in Agentic AI: From POC to Production
TL;DR · AI 摘要
构建可信的自主AI系统需要可靠性、可预测性、问责制和优化,MongoDB提出四步框架。
核心要点
- 自主AI系统需要通过RAG和业务数据减少幻觉,提升可靠性。
- 通过短期和长期记忆机制,增强AI系统的适应性和学习能力。
- 可观测性是确保AI系统透明和可审计的关键,需详细记录每一步推理和操作。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 构建可信的自主AI系统
- 四步框架
- 可靠性
- 可预测性
- 问责制
- 优化
- 客户退款示例
- 风险因素
- 自主AI的挑战
- 基础层
- RAG和业务数据
- 短期和长期记忆
- 可观测性
金句 / Highlights
值得收藏与分享的关键句。
自主AI系统需要通过RAG和业务数据减少幻觉,提升可靠性。
通过短期和长期记忆机制,增强AI系统的适应性和学习能力。
可观测性是确保AI系统透明和可审计的关键,需详细记录每一步推理和操作。
构建代理式 AI 的信任:从概念验证到生产环境 | MongoDB
企业对人工智能的采用已经达到了一个转折点。组织正在迅速进入代理式 AI 的时代,这是一种能够执行复杂推理并独立做出运营决策的自主系统。然而,当高管们试图将代理从沙盒环境转移到关键任务的生产渠道时,他们不可避免地会遇到 AI 信任鸿沟。
与传统应用程序不同,代理式解决方案会解读意图,并代表您的业务采取自主行动。传统的 IT 工具并未设计用于管理动态解决方案。为了安全地扩展,组织必须部署一个主动的控制平面,该控制平面会评估代理的逻辑并实施严格的治理。
在本文中,我们概述了一种四步方法,用于在代理式解决方案中构建安全性和优化。这种方法概述了一个广泛框架,可以根据组织的具体需求进行调整。
构建代理式信任的四步框架
为了弥合 AI 信任鸿沟,企业需要考虑可靠性、可预测性、责任性和优化。为了实现这一点,我们概述了四个步骤及其关键能力。
图 1. 代理式信任框架:从可靠性到优化结果的四个步骤。
客户退款示例
为了锚定这个框架,让我们跟随一个常见的高风险工作流程,即客户退款。表面上看,解决客户退款是一个简单的业务流程:
- 理解请求
- 验证资格
- 决策并执行
当人类处理这个流程时,可以无缝进行,但自主代理引入了风险的复合因素。具体来说,存在与解释和逻辑相关的风险,以及财务风险:
- 我们如何确保代理不会对政策产生幻觉?
- 我们如何验证代理在复杂、嵌套的资格标准上不会猜测?
- 什么控制措施可以防止代理执行不可逆的 5000 美元退款?
第一步:基础层
框架的第一步将代理扎根于商业现实之中。代理的可靠性取决于其消费的事实数据。通过使用检索增强生成(RAG)和运营数据,我们可以为模型提供实时、事实性的数据,如退款条款。用商业数据扎根代理可以显著减少幻觉。
数据基础和代理记忆将代理转变为动态适应的系统。短期记忆在即时操作之间保持上下文。同时,长期记忆利用过去交互的事件回忆和程序记忆,永久嵌入专家(SME)的更正。这种反馈循环确保系统检索到更新的保护措施,以避免重复错误。
基础的第二个关键方面是可观测性。现代可观测性需要详细的追踪,以记录每一步推理、工具调用和令牌支出,为代理采取的每项行动及其相关成本提供清晰的审计轨迹。对于领导者来说,这种深度日志记录就像“黑匣子记录器”,为严格的法规遵从性、执行失败的即时根本原因分析以及精确的服务成本指标提供必要的审计轨迹。
随着人工智能领域的快速变化,团队需要专注于构建稳健的智能代理解决方案,而不是拼凑基础设施,这种“同步税”会带来额外的负担。通过将向量、操作和时间序列数据统一到一个解决方案中,MongoDB 消除了这种负担。JSON 是人工智能的默认语言,也是 MongoDB 的原生语言。团队在同一个平台上拥有代理记忆、执行轨迹、向量和操作数据时,显著提升了性能。
图 2。AI 应用数据层,在整合前和整合后。
第二步:验证层
第二步从核心数据转向对代理的主动检查,通过两个操作指标:
图 3。验证指标:代理置信度评分和业务风险评分
指标 1:代理置信度评分(ACS)
ACS 衡量代理正确性的技术概率。通过将该指标归一化为 0.0 到 1.0 之间的值,架构可以无缝地将各种技术检查合并为一个标准化的数学公式用于治理。
通常被称为“评估工程”,计算这种置信度经常使用一种称为“LLM 作为裁判”的方法。虽然传统的大型模型在大规模运行时成本较高,但小型语言模型(SLMs),如 Galileo 的 Luna 模型,正因其速度、准确性和成本效益而成为黄金标准。SLMs 可以在毫秒内评估语义的准确性和忠实度。然而,在极高风险的情况下,如果可以接受最大延迟和令牌成本,大型前沿模型仍然是最佳解决方案。
指标 2:业务风险评分(BRS)
BRS 衡量代理行为对业务(财务、合规和安全)的后果。与 ACS 类似,该指标也被归一化为 0.0 到 1.0 之间的值,以便插入最终的治理公式中。
虽然标准的 AI 保护措施仅关注简单的约束,但 BRS 评估任务本身更广泛的组织责任。BRS 应该使用确定性方法,如常规代码或风险登记表,来确定风险评分。风险应被视为业务问题,而不是技术问题,除非发生系统故障,如 API 调用失败。
第三步:治理层
治理层是验证转化为行动的地方,通过代理决策评分(ADS)实现。ADS 是一个简单的数学公式,提供可审计且可预测的指标:
ADS = ACS × (1 - BRS)
通过将技术确定性(ACS)与现实世界责任(BRS)的反向相乘,系统建立了一个决定代理操作自主性的指标。为了说明这一点,我们将使用交通灯协议:
代理决策评分(ADS)
干预级别
定义
ADS ≥ 0.70
🟢 绿灯(完全自主)
推理高度确定,业务风险极低——代理在没有干预的情况下执行。
ADS 0.40 - 0.69
🟡 黄灯(人机协作)
代理相当自信,但业务风险较高——代理提出一个行动,但需要人类批准。
ADS < 0.40
🔴 红灯(强制停止)
系统触发全面安全停止——控制权完全转移给人类。
让我们直接将这种逻辑应用于我们的客户退款案例:
- 理解原因:代理分析客户的聊天。置信度高(0.90),风险低(0.2)。ADS = 0.72(绿色)。代理自主进行操作。
- 验证资格:代理根据复杂的订单历史检查退货政策,但不确定具体的折扣代码。置信度下降至 0.70,而风险仍保持较低(0.4)。ADS = 0.42(黄色)。代理暂停操作,并将摘要发送到团队的消息平台,等待人工专家的审核(点赞/点踩)。
- 执行交易:退款金额为 500 美元。由于这超过了预定义的政策阈值,业务风险被设定为高(0.85)。即使置信度很高(0.95),ADS 也下降至 0.14(红色)。该任务会自动路由到主管的管理待办事项队列中进行正式接管。
SME 反馈:
当治理触发黄色或红色信号时,工作流程会暂停。系统会立即将整个执行历史打包成一份全面的审计追踪。系统随后将此包路由到标准的 IT 服务队列,供主题专家(SME)进行审核。
当 SME 修正代理提出的路径时,该解决方案具有两个关键作用。首先,它安全地解决当前的客户问题。其次,系统会将此确切的修正写入其长期的程序记忆中。这种持续的反馈循环确保每次 SME 审核都会永久更新运营的防护措施,防止代理在未来重复相同的逻辑错误。
简化追踪:
未格式化
代码片段
{ "trace_id": "trc_8829-x4", "trace_start_date": "2026-05-20", "process": "Customer Order Refund Request", "steps": [ { "step_index": 1, "action": "Validate Order Refund Request", "tool_used": "PDF Interpreter", "agent_confidence_score": 0.90, "business_risk_score": 0.20, "agent_decision_score": 0.72, "reasoning": "PDF Validation successful with marginal text translation issues", "policy": "Auto" }, { "step_index": 2, "action": "Verify Refund Request Eligibility", "tool_used": "Vector_Search_Order_History", "agent_confidence_score": 0.70, "business_risk_score": 0.40, "agent_decision_score": 0.42, "reasoning": "Only 2 items returned from order history; matched risk tier medium", "policy": "HTIL - requires approval", "HITL_representative": "Account Rep 3", "HITL_response": "approve", "HITL_reasoning": "Manually verified customer order history" }, { "step_index": 3, "action": "Refund Decision", "tool_used": "API_Refund_Allowed", "agent_confidence_score": 0.95, "business_risk_score": 0.85, "agent_decision_score": 0.14, "reasoning": "Refund request above $250 maximum allowed.", "policy": "AI Halt", "halt_action": "Delivered to Refund escalation queue" } ], "status": "Refund Escalation", "trace_end_date": "2026-05-20" }
第 4 步:结果层
为了使企业数字劳动力可持续,成千上万的单个运行时追踪必须持续聚合到宏观级别的业务可观测性仪表板中。不同组织的需求会有所不同,但高管的可见性必须优先考虑战略价值和系统性风险。
专为 CFO 和业务部门总监设计的这个视角追踪清晰的企业回报。它监控总收入指标,如总投资回报率(ROI)和累计节省。最重要的是,它通过跟踪人工智能单元经济学来验证架构是否高效扩展。通过显示平均每任务成本已优化至 1.85 美元,相比传统的人工执行基准值 3.05 美元,仪表板证明了每次执行有 1.20 美元的单位经济节省。
然而,真正的智能体可观测性并不仅仅局限于被动的图表。专门的分析智能体会持续解读这些聚合的遥测数据,以提供主动的建议。例如,如果数据显示护栏违规率飙升至38%,或退款工作流程陷入高风险红色区域,分析智能体会主动标记这一风险。然后,它可以向管理层发出警报,并推荐针对性的措施,例如通过调整治理阈值来缓解升级问题,或更新RAG知识库以提高订单处理过程中自主决策的信心。这种持续的分析将原始的操作指标转化为自主的商业智能。
图4。智能体AI价值和风险仪表板。
超越沙盒
信任是一门工程学科,而不是抽象的理想。随着企业部署自主智能体,成功的组织将把AI视为一个正式治理的IT服务。
这需要将你的智能体锚定在像MongoDB这样的统一AI数据平台上,以管理记忆、操作数据和智能体追踪。当你将这种强大的数据基础与严格的验证、治理和智能体优化相结合时,你可以自信地弥合信任鸿沟。这种方法在真正的企业规模上解锁了安全、可预测且盈利的AI自主性。
图5。智能体信任信息图。
###### 下一步
准备好从实验走向生产环境了吗?下载我们的白皮书,了解如何构建、治理和优化可信赖的智能体系统。