RAG正在烧钱——我构建了一层成本控制机制来修复它
RAG系统在生产中常因上下文过取、无缓存、无模型路由导致成本激增;作者构建成本控制层,通过语义缓存(98.5%命中率)、查询路由(81%请求转向低成本模型)与令牌预算熔断机制,在10,000请求/日下实现85.8%成本削减且质量不变。
入选理由:上下文过取使每查询平均多消耗350 tokens,10k请求/日造成$52.5/日浪费(按$0.015/1K tokens计)
概念
别名:检索增强生成
基于检索的生成模型,通过向量数据库增强大语言模型回答能力。
已跟踪 30 条高相关材料
最近变化
2026-09-08 · 混合检索结合向量搜索和BM25,解决企业场景下的术语差异和精确匹配问题。
为什么值得关注
RAG 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
RAG Is Burning Money — I Built a Cost Control Layer to Fix It
Towards Data Science · 9.2 分
RAG系统在生产中常因上下文过取、无缓存、无模型路由导致成本激增;作者构建成本控制层,通过语义缓存(98.5%命中率)、查询路由(81%请求转向低成本模型)与令牌预算熔断机制,在10,000请求/日下实现85.8%成本削减且质量不变。
Enterprise Document Intelligence: A Series on Building RAG Brick by Brick, from Minimal to Corpus scale
Towards Data Science · 9.2 分
企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。
Most people use vector databases for chatbots and RAG pipelines. 𝗦𝗲𝗻𝗾𝗶 𝗔𝗜 𝘂𝘀𝗲𝘀 ...
Milvus(@milvusio) · 9.2 分
Senqi AI 使用 Milvus 向物理机器人注入长期语义记忆能力,解决真实世界任务中环境动态、任务无界、指令模糊和错误高成本等核心挑战。
已收录 30 条与 RAG 相关的内容,按评分排序。
RAG系统在生产中常因上下文过取、无缓存、无模型路由导致成本激增;作者构建成本控制层,通过语义缓存(98.5%命中率)、查询路由(81%请求转向低成本模型)与令牌预算熔断机制,在10,000请求/日下实现85.8%成本削减且质量不变。
入选理由:上下文过取使每查询平均多消耗350 tokens,10k请求/日造成$52.5/日浪费(按$0.015/1K tokens计)
企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。
入选理由:多数企业RAG部署效果不佳,因基础解析和检索质量差。
Senqi AI 使用 Milvus 向物理机器人注入长期语义记忆能力,解决真实世界任务中环境动态、任务无界、指令模糊和错误高成本等核心挑战。
入选理由:物理机器人Agent需实时重规划,因环境持续变化且任务无明确终点
RAG 技术并非万能,应根据文档结构和问题控制程度选择合适方法:模板化文档用正则表达式,客服对话需 LLM 判断语调,工程图纸必须使用视觉模型。
入选理由:模板化文档(如保险单、银行流水)适合用正则表达式提取字段,避免使用高成本的 RAG 流程。
RAG 不是机器学习,使用 ML 工具包解决的是错误问题。文章指出,尽管 RAG 看似类似 ML,但其核心是构建搜索系统而非训练模型,因此超参数调优、嵌入模型微调等 ML 方法无法解决 RAG 的真实故障,反而导致资源浪费和信任下降。
入选理由:RAG 解决的是确定性答案查找问题,而非预测未知结果,因此不能用 ML 方法优化。
Proxy-Pointer RAG 通过保留文档结构上下文,将知识图谱实体与关系匹配的计算成本降低 90% 以上,实现高效、低延迟的图谱入管,解决了大规模知识图谱的语义蔓延问题。
入选理由:Proxy-Pointer RAG 使用 Skeleton Tree 和 Breadcrumb Injection 技术,使向量检索能精准定位文档完整结构段,而非碎片化块。
研究发现,RAG系统中检索质量差是导致高流畅性幻觉(更自信但更错误)的主因,模型升级无法弥补检索缺陷。
入选理由:检索质量差是RAG输出退化的最主要预测指标,模型能力增强反而加剧幻觉可信度。
下一代智能企业系统需结合混合检索、多代理系统与自适应学习,以解决RAG在复杂场景下的局限性。
入选理由:混合检索结合向量搜索和BM25,解决企业场景下的术语差异和精确匹配问题。
Gallup利用Amazon Bedrock构建AI助手,实现实时个性化职场指导,整合Claude模型与RAG技术,7天完成生产级部署。
入选理由:Amazon Bedrock Knowledge Bases实现RAG,确保回答基于验证研究
RAG系统的性能高度依赖嵌入模型质量,选择合适的嵌入模型是构建有效RAG系统的关键。
入选理由:嵌入模型决定RAG系统搜索准确性,错误嵌入会导致错误答案
AWS通过生成式AI重构支持运营,实现SOP自动化与SLA风险预测,提升效率30%以上。
入选理由:RAG技术使票务处理效率提升40%,缩短问题解决时间50%
企业级AI部署需权衡托管API与自托管模型,Red Hat提供集成解决方案。
入选理由:托管API降低运维成本但可能增加长期费用
Weaviate提出Late Interaction RAG方法,通过多向量模型直接解析PDF图表,解决传统RAG无法提取图表信息的缺陷。
入选理由:传统RAG处理PDF图表时,30%的查询会因图表信息缺失导致错误
MLPerf推出首个端到端RAG推理基准,覆盖向量数据库构建与多跳问答流程,揭示多模型协作优化空间。
入选理由:RAG系统需多模型协作,单模型基准无法衡量其迭代推理行为
编写有效代理指令的8个技巧,涵盖流程图设计、明确目标、工具整合等关键点。
入选理由:使用流程图工具(如Mermaid.js)可视化业务流程可提升团队协作效率
RAG架构的复杂性应在检索失败模式被验证后逐步引入,而非默认采用。传统检索方法在特定场景下表现优异,过度复杂化可能掩盖基础问题。
入选理由:优先评估基础检索子系统,再引入复杂技术如重排序或代理系统。
将FAQ作为RAG知识库可显著优化生成成本并提升检索效率,通过结构化设计实现解析简化与缓存复用。
入选理由:FAQ结构使RAG解析步骤复杂度降低70%
通过结合ColBERT重排序、二进制量化和句子级检索,Qdrant将RAG的token成本降低了67.1%。
入选理由:Qdrant的ColBERT重排序可减少67.1%的输入token
可靠代理式RAG需控制信息到达模型的方式,而非单纯优化提示词。Weaviate提出上下文工程的五大系统框架。
入选理由:查询增强需重构用户输入以提升检索精度
RAG技术因文本转换瓶颈限制多模态能力,Weaviate联合Gemini Embedding 2实现原生多模态向量嵌入。
入选理由:多模态RAG跳过文本转换步骤可保留原始媒体语义
Andrew Ng发布AI工程技能地图,明确构建AI应用、软件工程基础等四项核心技能,基于10,000个职位分析和专家访谈得出。
入选理由:构建AI应用需掌握LLMs、RAG等技术及统计评估方法
构建和部署AI应用的关键技能包括LLM基础、数据对齐、代理系统等,由Andrew Ng基于职位和调研总结。
入选理由:掌握LLM基础可优化模型使用场景,理解token化机制和采样参数
GraphRAG通过知识图谱增强检索,解决跨文档复杂问题,优于传统RAG在全局模式识别上的表现。
入选理由:GraphRAG利用知识图谱处理跨文档的全局模式识别,适用于复杂查询
Pi项目作者认为代码本身即真相,无需依赖记忆系统或RAG,Bash工具足够应对多数开发需求。
入选理由:代码本身是真相,无需RAG或记忆系统
RAG架构无法积累知识,本文提出持久知识层设计,结合GraphRAG与Azure服务实现,解决重复推理问题。
入选理由:RAG系统每次推理均独立,无法积累领域理解
潜在空间在机器学习中扮演描述、生成和预测三重角色,通过PCA等技术压缩数据并提取关键特征。
入选理由:PCA可将3D数据压缩至2D潜在空间,保留90%以上方差
AI上下文架构通过定义AI代理的约束和数据范围,提升系统可预测性和效率,但需权衡自建与购买的利弊。
入选理由:AI上下文架构通过限制数据范围和预定义操作,减少AI决策的模糊性。
EngramLab通过合成数据集解决法律领域RAG技术瓶颈,Harvey开源的100M+令牌合成律所数据可评估代理搜索能力。
入选理由:RAG技术无法处理非结构化法律文件中的隐性信息,需人工逐文件核查
Elastic 9.5 引入 Columnar 模式、VectorDB 自动校准和 AI 驱动的警报分类,显著提升存储效率与 AI 应用能力。
入选理由:Columnar 模式减少 60% 存储空间,同时保持全文搜索性能。
RAG系统构建依赖Prompt、Context、Loop三层工程架构,分别对应指令设计、上下文管理与循环控制,明确区分可解决90%工程混淆。
入选理由:Prompt工程定义LLM调用规则,决定输出格式与约束条件