From RAG to Agentic AI: Building the Next Generation of Intelligent Enterprise Systems
TL;DR · AI 摘要
下一代智能企业系统需结合混合检索、多代理系统与自适应学习,以解决RAG在复杂场景下的局限性。
核心要点
- 混合检索结合向量搜索和BM25,解决企业场景下的术语差异和精确匹配问题。
- 多代理系统通过协作解决复杂问题,减少幻觉。
- 自适应学习动态调整模型参数,提升长期性能。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 下一代智能企业系统
- 混合检索
- 向量搜索
- BM25算法
- 多代理系统
- 协作机制
- 幻觉抑制
- 自适应学习
- 动态参数调整
- 长期性能优化
金句 / Highlights
值得收藏与分享的关键句。
混合检索结合向量搜索和BM25,解决企业场景下的术语差异和精确匹配问题。
多代理系统通过协作解决复杂问题,减少幻觉。
自适应学习动态调整模型参数,提升长期性能。
从 RAG 到智能代理 AI:构建下一代智能企业系统 - KDnuggets
publ: 2026年9月8日
- 博客热门文章
- 主题 AI 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps NLP 编程 Python SQL
- 数据集
- 活动
- 资源 快速参考指南 推荐 技术简报
- 广告
订阅电子报
#header end
/ad_wrapper
从 RAG 到智能代理 AI:构建下一代智能企业系统
过去几年间,我经历了三代智能检索系统的演进,每一代都解决了前一代无法解决的问题。以下是我的经验总结。
By
,戴尔科技人工智能科学家,2026年9月8日发布于
人工智能
<div class="addthis_native_toolbox"></div>
仅依赖 RAG 的局限性
检索增强生成(RAG)改变了企业级 AI 的游戏规则。与其寄希望于大语言模型在预训练阶段记住正确答案,RAG 通过企业自有文档为响应提供依据——将用户问题嵌入向量数据库,找到相似片段后作为上下文传递给大语言模型。这种方法优雅高效,在面对结构清晰且文档库精心整理的问题时往往足够。
但如果你在企业级规模构建过 RAG 系统,就会知道"足够"的局限性会迅速显现。
设想当员工询问两个内部流程的差异时会发生什么。标准 RAG 流程会将查询嵌入,检索语义最相似的文档片段,然后期望大语言模型能生成连贯的回答。实际上通常会出现三个问题:首先,查询可能包含具有多重含义的领域缩写,系统没有澄清意图的机制;其次,仅依赖向量相似性可能遗漏使用不同术语描述相同概念的关键文档;第三,系统无法可靠传达置信度——幻觉生成的回答与基于事实的回答看起来完全相同。
这些不是边缘案例,而是企业级 AI 的日常现实。过去几年间,我经历了三代智能检索系统的演进,每一代都解决了前一代无法解决的问题。以下是我的经验总结。
第一代:混合检索——为何单一搜索方法从不够用
超越基础 RAG 的首次重大改进在于认识到:没有哪种单一检索方法能胜任企业环境。
向量搜索能完美捕捉语义关联。关于"缺货"的查询可以匹配讨论"零库存"或"供应缺口"的文档,即使用词不同。但向量搜索可能埋没精确关键词匹配,在充斥着缩写、产品代码和专业术语的企业环境中,错过精确匹配可能造成关键性失败。
这是信息检索领域早已认知的问题。解决方案是混合检索:并行运行密集向量搜索和稀疏关键词搜索(通常是 BM25),然后智能合并结果。这一模式已成共识,但让其在生产环境中实际运作的工程决策,正是大多数教程的薄弱环节。
去重的重要性可能超出你的预期。当两种检索方法返回重叠结果时,简单地拼接会导致候选集被冗余内容膨胀。采用多层级去重策略——首先通过唯一标识符,然后通过来源位置,最后通过内容指纹进行去重——可以确保在进入重排序器之前,合并后的集合真正包含不同的信息。
排名融合需要谨慎处理。倒数排名融合(RRF),由 Cormack、Clarke 和 Buettcher(2009)提出,是无需评分归一化即可合并异构评分系统排名的标准方法。它会奖励在任何检索源中排名靠前的文档,这正是合并语义信号和词汇信号时你想要的效果。
延迟是系统的一个特性。通过异步执行同时运行两次搜索,而不是顺序执行,可以显著降低检索延迟——在我的实践中,延迟可减少 40% 或更多,且不会牺牲质量。无论答案多好,用户都会放弃响应过慢的系统。
交叉编码器重排序器提供最终的精度过滤,它以比任何单一检索方法更高的保真度,将合并后的候选集与原始查询进行重新评分。
但如果系统无法理解你领域结构,即使检索完美也无济于事。
第二阶段:知识图谱与 RAG 的结合
标准 RAG 将每个文档片段视为孤立的文本岛屿。它没有实体、关系或本体的概念。它不知道产品名称属于特定的层级结构,不知道在不同文档集中存在同义词,也不了解看似无关的两个概念可能共享父级分类。
在检索流程中增加知识图谱层——一种日益被称为 "GraphRAG" 的方法——解决了这一缺陷。核心思想很简单:如果你有领域实体和关系的结构化表示,就可以利用它来增强检索和生成。根据我的经验,有两个设计决策对生产环境的可行性影响巨大。
#### 确定性实体提取 vs. 基于大语言模型的命名实体识别
大多数 GraphRAG 教程建议使用大语言模型从文本中提取实体。但在生产环境中,这会带来三个问题:延迟(每次调用数百毫秒)、成本(在文档片段摄入时产生 API 费用)以及非确定性(相同输入在不同运行中可能产生不同输出,使监管环境中调试几乎不可能)。
基于规则的多轮实体提取——这是经典自然语言处理(NLP)中成熟的技术——提供了有吸引力的替代方案。首先使用最长优先短语匹配对实体索引进行匹配,然后通过归一化匹配处理格式差异,最后进行词级匹配,可以在零边际成本下以微秒级速度生成一致结果。这不是新技术,它正是早期信息提取系统所采用的方法。但在 GraphRAG 的语境中,这种设计选择却被大多数从业者忽视,他们更倾向于选择看似"现代"的基于大语言模型的方法,这往往带来显著的生产成本。
带有实体标签的文档片段可以通过其包含的查询相关实体数量进行评分,这种图信号可以通过与混合检索相同的RRF机制,直接与向量和关键词评分进行竞争。这意味着即使文档使用了不同的表层语言,只要提到了正确的实体,仍然能够被检索到——这是纯向量搜索经常遗漏的情况。
对于必须处理持续文档摄入的生产系统,零停机时间重新索引是必不可少的。标准数据库模式——用于增量更新的增量处理、用于全量同步的原子交换——是经过验证的方法,能够确保系统在实体重新映射操作期间保持可用性。
第三代:智能代理AI——具备推理能力的系统
混合检索和GraphRAG解决了检索问题。但企业级问题很少是单跳式的。比较类问题需要系统独立理解两个概念,然后进行综合;规划类问题需要分解为子任务;故障排除类问题可能需要在单一工作流中咨询文档、结构化数据库和外部API。
智能代理架构用动态推理系统取代了固定的“检索-生成”流水线。系统不再遵循预设路径,而是在每一步根据中间结果决定下一步操作。这是智能代理系统与传统流水线的根本区别。
近期行业分析指出,有效的智能代理AI必须掌握核心学科:工具使用、内存管理、规划、协调和评估。在构建了生产级智能代理系统后,我认为企业部署中不可妥协的第六要素是:将安全作为架构边界。
#### 安全第一——始终优先
在企业环境中,查询可能无意中包含客户数据、员工信息或机密引用。安全评估必须是流水线中的第一步——这是一个硬性架构边界,而非下游过滤器。如果检测到敏感信息,应在查询到达检索或生成组件之前立即拒绝。这是一种设计哲学,而非功能特性,根据我的经验,这是企业级AI系统最重要的架构决策。
#### 检索前的消歧处理
企业语言本质上存在歧义。一个常见缩写可能在同一家公司内有多个有效含义。传统方法——要求大语言模型猜测——速度慢且不可确定。使用词频启发式方法识别领域特定术语,结合精心整理的查找表进行消歧的轻量级、基于数据库的方案,可在极低延迟下实现与传统方法相当甚至更优的准确性。这与设备端NLP设计的原理一致:优化延迟预算,而非最大灵活性。
#### 规划与分解
对于复杂、多部分的问题,大语言模型可以将查询分解为子问题,每个子问题分配给特定的检索工具。在执行前向用户展示该计划(也称为“人机协作检查点”)可以建立信任并及早发现误解。这与新兴标准如模型上下文协议(MCP)相一致,该标准强调人工监督是构建可靠智能代理系统的前提条件。
#### 并行多源检索
不同的子问题可能需要不同的数据源。对每个子问题所需工具进行分类并同时执行,与顺序执行相比,能显著降低复杂查询的延迟。
#### 保守的置信度评分
这正是大多数生产环境中的RAG系统存在的不足之处。在流水线各阶段对置信度信号进行平均会掩盖组件层面的弱点。乘法评分——决策理论中的标准技术——刻意保持保守:如果任何单个组件存在不确定性,就会大幅拉低整体置信度。考虑两种场景:如果规划置信度为0.9且检索置信度为0.9,乘积为0.81——合理。但如果规划为0.9而检索降至0.1,乘积为0.09——这是一个明确的信号表明存在问题,而平均值会错误地报告0.5。这使系统能够表达"我不知道",我认为这是生产级AI系统最重要的能力。
#### 通过反思实现自我修正
当置信度低于阈值时,系统不应返回低质量答案,而是评估哪里出了问题,生成批评意见,并带着额外上下文返回规划阶段。对重试循环进行限制是一个实用约束,教程很少提及但生产系统绝对需要。
普遍适用的原则
在经历了这三代系统的实践,并看到我倡导的模式被多个业务部门采用后,一些原则逐渐清晰,我相信这些原则适用于任何企业AI项目。
确定性比灵活性更有价值。在生产环境中,操作人员需要重现和调试故障。仅将LLM调用保留给确实需要生成性推理的任务。其他所有内容都应使用确定性逻辑——实体提取、消歧、路由和置信度计算。
延迟是功能而非指标。为每个组件设计明确的延迟预算。你节省的每一毫秒都会增加用户实际采用系统的可能性。
置信度评分是不可妥协的。无法区分"我找到了好答案"和"我是在猜测"的系统不具备生产就绪性。应从第一天起就将此功能构建到架构中,而不是作为事后补充。
隐私是架构约束而非功能。安全防护必须是执行图中的硬性边界。包含敏感信息的查询绝不能传递给下游组件,无论这些组件可能如何处理它们。
展望未来
趋势清晰可见:企业AI正从静态检索流水线转向能够分解问题、咨询多个知识源、评估自身置信度并自我修正的动态推理系统。构建模块——知识图谱、混合检索、智能体编排、人机协作设计——今天已全部可用。挑战在于架构层面:将它们组合成可靠、可审计且足够快速以满足真实用户需求的系统。
下一个前沿是多智能体编排——系统中专门智能体能动态发现彼此能力并协作处理跨越组织边界的查询。MCP和智能体间发现协议等新兴标准正在使这成为可能。今天投资这些架构基础的组织将在技术成熟时获得显著优势。
RAG 是起点。Agentic AI 才是企业知识系统的发展方向。
Mona Sachdev 是戴尔科技的 AI 科学家,专注于企业 AI、生成式 AI、知识图谱和智能检索系统。她的研究涵盖自然语言处理、语义搜索以及企业级 AI 系统。她拥有德克萨斯大学奥斯汀分校的硕士学位,并在美国多项 AI 和搜索技术专利中担任发明人。
更多相关内容
- 数据与 AI 领导力问题:定义下一阶段的关键议题
- Agentic AI 在企业自动化中的 5 个实际应用场景
- Warp:智能 AI 驱动的终端
- 检索增强生成:信息检索与...的交汇点
- 使用 Haystack 构建 RAG 系统入门
- 使用微软 Agent 框架构建 Agentic AI 系统
<hr class="grey-line"><br> <div><h3>我们推荐的 5 门免费课程</h3><br> </div>
Mailchimp for WordPress v4.14.0 - https://wordpress.org/plugins/mailchimp-for-wp/
/ Mailchimp for WordPress 插件
您可以从此处开始编辑。
如果评论已关闭。
<= 上一篇
下一篇 =>
#content end
<script type="text/javascript">kda_sid_write(kda_sid_n);</script>
最新文章
- 构建一个像高级分析师一样思考的 AI 数据分析师
- 在有限硬件上高效训练 LLM 的 7 种方法
- 从 RAG 到 Agentic AI:构建下一代智能企业系统
- ArrowJS 真的是 Agentic 时代的 UI 吗?我的发现
- 我免费访问编码模型的 5 种方式
- Switchyard:NVIDIA 的开源路由库
热门文章
- 5 门免费课程:从 LLM 入门到实践
- 2026 年可使用的 5 个免费 LLM API 提供商
- ArrowJS 真的是 Agentic 时代的 UI 吗?我的发现
- 我免费访问编码模型的 5 种方式
- 2026 年可本地运行的 7 个顶级编码模型
- 从 RAG 到 Agentic AI:构建下一代智能企业系统
- 我让 ChatGPT 分析 3 个数据集,它每次都犯同样的错误
- 停止使用 If-Else 链:改用 Python 的注册模式
- 从 AI 编码代理获取更好结果的 10 条规则
#content_wrapper end
© 2026
Guiding Tech Media
|
关于
联系我们
广告合作
隐私政策
服务条款
发布于 2026 年 9 月 8 日
blank
不,谢谢!
/.main_wrapper
<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>
noptimize
/noptimize