企业文档智能:从最小到语料库规模逐砖构建RAG系列
企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。
入选理由:多数企业RAG部署效果不佳,因基础解析和检索质量差。
概念
别名:大语言模型
具有复杂推理能力的生成式模型
已跟踪 30 条高相关材料
最近变化
2026-09-01 · Arize AX的Cost Agent可自动识别并优化LLM调用中的高成本步骤
为什么值得关注
LLM 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Enterprise Document Intelligence: A Series on Building RAG Brick by Brick, from Minimal to Corpus scale
Towards Data Science · 9.2 分
企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。
Coding agents are accelerating different types of software work to different degrees. When we archit...
Andrew Ng(@AndrewYNg) · 9.2 分
Andrew Ng 提出编码智能体对四类软件工作加速程度差异显著:前端 > 后端 > 基础设施 > 研究,并强调团队架构需据此设定合理预期。
From Regex to Vision Models: Which RAG Technique Fits Which Problem
Towards Data Science · 9 分
RAG 技术并非万能,应根据文档结构和问题控制程度选择合适方法:模板化文档用正则表达式,客服对话需 LLM 判断语调,工程图纸必须使用视觉模型。
已收录 30 条与 LLM 相关的内容,按评分排序。
企业级RAG系统应聚焦文档理解与业务逻辑,而非堆叠模型和框架。简单的Python脚本往往比复杂生产系统更有效。
入选理由:多数企业RAG部署效果不佳,因基础解析和检索质量差。
Andrew Ng 提出编码智能体对四类软件工作加速程度差异显著:前端 > 后端 > 基础设施 > 研究,并强调团队架构需据此设定合理预期。
入选理由:前端开发因框架熟稔与浏览器闭环迭代能力,获最大加速;视觉设计短板不影响功能实现速度。
RAG 技术并非万能,应根据文档结构和问题控制程度选择合适方法:模板化文档用正则表达式,客服对话需 LLM 判断语调,工程图纸必须使用视觉模型。
入选理由:模板化文档(如保险单、银行流水)适合用正则表达式提取字段,避免使用高成本的 RAG 流程。
企业数据治理不应依赖聊天机器人,关系型与时间序列数据正迎来专用基础模型的突破,KumoRFM-2在少标注下超越监督与通用基模,但高风险金融与医疗场景需谨慎验证与治理。
入选理由:KumoRFM-2仅用少量标注即可在多表关系数据上预测,超越监督基线与通用基模,显著降低数据科学管线复杂度。
企业部署AI智能体遇阻主因在数据整合质量而非模型能力升级,解决数据问题与组织流程重塑是成功关键。
入选理由:AI智能体部署失败中25%以上可归因于关键知识未实现系统化捕获与整理。
Proxy-Pointer RAG 通过保留文档结构上下文,将知识图谱实体与关系匹配的计算成本降低 90% 以上,实现高效、低延迟的图谱入管,解决了大规模知识图谱的语义蔓延问题。
入选理由:Proxy-Pointer RAG 使用 Skeleton Tree 和 Breadcrumb Injection 技术,使向量检索能精准定位文档完整结构段,而非碎片化块。
AutoTTS框架实现LLM自主搜索测试时扩展策略,仅用$39.9和160分钟即发现优于人工设计的控制器,在数学推理任务中达成更高精度-成本帕累托前沿。
入选理由:AutoTTS将测试时扩展策略搜索成本降至39.9美元和160分钟,显著低于传统人工调参。
MCP(模型上下文协议)由Anthropic于2024年12月提出,是统一AI与外部系统连接的标准化协议,显著降低集成复杂度。
入选理由:MCP由Anthropic在2024年12月提出,是用于标准化LLM与外部数据源连接的协议。
AI推理依赖模型权重、推理服务器和GPU协同工作,KV缓存优化可降低延迟和成本。
入选理由:推理服务器(如vLLM)是实现生产级GPU利用率的关键组件
企业级AI系统需构建包含计算、存储、服务和集成的四层架构,自托管与托管模式各有权衡。
入选理由:企业AI系统依赖四层基础设施:计算、模型存储、服务层和系统集成
通过追踪数据和验证优化,可在不牺牲质量的前提下降低LLM成本,关键策略包括连接支出与请求、验证优化效果、分析模型选择影响。
入选理由:使用追踪数据将成本与具体请求/模型调用关联,定位浪费环节
Arize AI推出成本控制代理,通过自动化分析和优化LLM调用,显著降低代理应用的运营成本。
入选理由:Arize AX的Cost Agent可自动识别并优化LLM调用中的高成本步骤
使用Ising模型进行依赖感知的标签聚合,可提升多评委LLM评估的准确性,减少因评委输出相关性导致的误差。
入选理由:Ising模型方法在三个任务中提升9-14%准确率,优于加权多数投票基线。
AgentHands通过LLM生成同步手势,提升XR中AI代理的空间对话体验,填补虚拟与现实交互的感知鸿沟。
入选理由:AgentHands利用LLM实现手势与语音的同步,增强XR场景下物理任务指导的自然性
编写有效代理指令的8个技巧,涵盖流程图设计、明确目标、工具整合等关键点。
入选理由:使用流程图工具(如Mermaid.js)可视化业务流程可提升团队协作效率
量化和剪枝技术能显著减小LLM体积,降低部署成本,避免因模型过大导致的资源浪费和延迟。
入选理由:量化将16位浮点数转为4位整数,减少存储空间且加速计算
LLMs在特定任务上超越嵌入模型但成本更高,选择需权衡性能与成本。
入选理由:LLMs在复杂任务表现优于嵌入模型(arXiv:2608.12875)
开发者需掌握LLM基础、数据 grounding、代理系统构建等技能以应对AI应用的不确定性。Andrew Ng提出AI工程需六大核心能力。
入选理由:AI工程需掌握LLM基础、数据 grounding、代理系统构建三大核心能力
构建可靠AI需要持续迭代和严格评估循环,DeepLearning.AI提出五大工程支柱。
入选理由:AI工程需通过评估驱动开发实现系统性进步,定制评估循环可提升30%迭代效率
构建和部署AI应用的关键技能包括LLM基础、数据对齐、代理系统等,由Andrew Ng基于职位和调研总结。
入选理由:掌握LLM基础可优化模型使用场景,理解token化机制和采样参数
正确实现Prompt Caching可避免AI代理重复计费,节省高达90%的上下文处理成本。
入选理由:缓存LLM输出无效,应缓存输入prompt以避免重复处理
Agent Memory系统通过Mem0架构实现跨会话记忆,结合向量数据库与关系型数据库构建长期记忆,支持检索、删除等操作。
入选理由:Mem0使用向量数据库+关系型数据库实现长期记忆存储
Grok模型存在安全漏洞,攻击者通过加密恶意指令绕过防护,导致用户数据泄露。该方法利用LLM无法区分加密内容与正常指令的弱点,对AI安全防护提出新挑战。
入选理由:加密恶意指令可绕过Grok安全防护,导致数据泄露。
Together AI平台提供端点级A/B测试方案,通过动态流量分配验证LLM模型效果,避免传统方法的基础设施耦合问题。
入选理由:Together AI平台在端点层实现A/B测试,无需修改客户端代码
AI在非虚构写作和复杂科学问题上仍需人类引导,当前模型在组织知识和解决开放性问题上存在局限。
入选理由:当前LLM在非虚构写作中难以有效组织知识,影响科学问题解决。
Fish Audio推出Expressive模式,通过LLM内联生成情感标签并由S2.1 Pro渲染,使语音代理能自然表达情绪,LiveKit Agents一键启用该功能。
入选理由:TTS系统普遍支持但未有效利用情感标签,用户偏好自然情绪表达
AI显著改变了数据科学家的日常工作,提示工程成为核心技能,LLM成本控制成为关键挑战。
入选理由:精确设计提示词可使LLM输出质量提升数倍,需包含具体指标和约束条件。
限制输出空间可使小型语言模型在窄自动化任务中效率提升8倍,成本降低千倍,适合工业级高并发场景。
入选理由:分类任务固定输出空间可使推理速度提升8倍
提示缓存和微调是优化代理AI系统成本与延迟的两种策略,文章提供决策框架帮助选择合适方案。
入选理由:提示缓存可使重复请求计算成本降至零,但需额外存储开销
llm-gemini 0.33版本新增对Gemini 3.7 Flash等模型的支持,并兼容LLM 0.32的推理轨迹功能。
入选理由:33版本新增gemini-3.7-flash等4个模型支持