I talked to Google’s former AI head about messy data

TL;DR · AI 摘要
I talked to Google's former AI head about messy data - Gradient Flow I talked to Google’s former AI head about messy dat...
核心要点
- 主题聚焦:I talked to Google’s former AI head about messy
- 来源:Gradient Flow,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
我与Google前AI负责人谈杂乱数据 - Gradient Flow
我与Google前AI负责人谈杂乱数据
发布者
Ben Lorica
2026年6月30日
2026年6月26日
发布于
未分类
标签:
newsletter
.meta-info
.post-thumbnail
订阅 • 前期期刊
代理需要地图,而非更大的上下文窗口
和所有人一样,我也在享受编码代理及其相关工具的持续改进,从框架和工具套件到评估套件。但随着我与实际在企业中部署代理的团队交流越多,我越回到基础设施层面。代理需要为其构建的数据集成和基础设施,这个主题我在一篇关于重新思考代理数据库的文章中探讨过。我也写过关于使用知识图谱(GraphRAG)来提高准确性和减少幻觉的内容,这在高风险应用中尤为重要。持续存在的问题是,大多数团队没有知识图谱,而少数拥有的团队也难以保持其更新。我最近发现的一个新系统正是针对这一空白而设计的。
如果你经常阅读,请考虑成为付费支持者 🙏
##### 自动化构建和维护图谱
我最近与Lovelace的CEO Andrew Moore进行了交流,他是Google Cloud AI的前负责人,也是卡内基梅隆大学计算机学院的前院长。Lovelace的Elemental平台将企业数据转化为结构化的上下文引擎,AI代理可以在此基础上进行导航和探究。我认为“知识图谱”在这里仍然是一个合理的术语,尽管“上下文图”可能更贴近要点。这不是主要为人分析师在屏幕上浏览节点而构建的图,而是为需要回答超出普通搜索、基础RAG或简单地将更多原始文档塞入上下文窗口的复杂、混乱或时间敏感问题的代理而设计的。
Elemental可以处理你拥有的任何数据:关系表、PDF文件、新闻源、JSON片段,甚至卫星图像和其他多模态来源。所有内容都会被转换为一种通用的中间形式,最终成为图中的节点和关系。该平台自动化了这些图的大部分构建和维护工作。一个包含千个节点的图可以容忍人工参与,但一旦达到数百万个事实的规模,任何需要人工检查两个记录是否指向同一家公司的步骤都会崩溃。太多的企业AI项目在真正开始AI工作前的六个月数据整理阶段就夭折了,而消除这种繁琐工作正是关键所在。
对于代理来说,上下文图为其提供了企业的地图和周围世界的信息。一家银行在调查对受制裁航运公司的风险敞口时,可能需要连接所有权记录、贸易数据、船舶移动、子公司、法律文件、客户关系和近期新闻。向量搜索可以找到相关文档,但这些问题通常需要跨越多个实体和事件的关系追踪。这就是图状上下文层发挥作用的地方。
##### 无需图数据库的代理用图
Elemental的设计围绕四个步骤:数据摄入、实体解析、图构建和面向代理的工具访问。我上面已经讨论了数据摄入,但还有一个约束条件需要补充:系统必须在不假设清洁模式、一致命名或单一事实来源的情况下运行。
实体解析是判断不同记录是否指向同一现实事物的问题。"IBM"、"International Business Machines"、内部供应商ID、申报文件中的法律实体、PDF中的名称可能指向同一家公司,也可能不指向。同样的问题也出现在人员、船舶、飞机、账户、子公司、地址、产品、资产和事件中。任何人都可以在周末原型化一个实体解析系统。但要构建一个能扩展、处理多语言、适应全新实体类型,并能随着新信息到来而更新的系统,难度极高。Lovelace构建了自己的引擎,并超越了单纯的文本匹配。我半开玩笑地告诉Andrew,仅实体解析引擎本身就可以作为一个独立产品,因为如此多的应用成败都取决于这一点。
企业代理不仅需要更多上下文,更需要能够追溯、排序和信任的上下文。
可审计性同样重要。在受监管或高风险场景中,系统需要展示事实的来源、如何与其他事实关联,以及代理生成答案时图的版本。用通俗的话说,这意味着血缘关系、出处追踪和版本控制:事实在系统中如何流转、哪些证据支持它,以及某一时间点图的信念状态。这在监管机构、客户或内部审查人员询问为何代理标记某笔交易、推荐调查或忽略警报时尤为重要。"模型这么说了"将不足以解释。
检索功能使图超越了单纯的数据目录。在真正的图系统中,单个节点可能拥有数十万条链接,因此简单的"显示两跳范围内所有内容"查询会爆炸成数十亿条路径并陷入停滞。Elemental采取了不同的方法。它将"谁最受到该事件影响?"这类问题重新表述为概率问题,然后使用随机算法和其他图论技巧,无需遍历所有路径即可找出最强关联。结果虽非数学精确,但能在不到一秒的时间内从数百万节点中返回置信度高且排序的答案。这种权衡非常值得,因为另一种选择是让大语言模型在脑海中协调矛盾的概率证据,而语言模型在这方面确实表现不佳。
另一个有趣的架构选择是Elemental不依赖图数据库作为核心存储层。数据以图的形式暴露给代理,但底层的持久化层是定制的。原因很简单。传统图数据库非常有用,但它们并非为此类特定任务而设计:在数千万节点上进行广泛、高速的推理。
##### 为何私有图需要公开上下文
Lovelace还带来了另一项资产:YottaGraph。将其视为一个持续更新的大型公共世界图谱,涵盖公司、人员、地点、事件、申报文件、制裁记录以及船舶和飞机的动态。这很有用,因为内部企业数据很少能讲完整的故事。YottaGraph难以复制,因为它需要从多个来源持续摄入数据、进行大规模实体解析,以及大量的运营纪律。重要的是,数据增强是向内流动的。公开上下文可以增强公司的私有图,但Lovelace不会将一个客户的数据共享给其他组织。
Lovelace 并不是唯一一个使用图结构来为智能体提供更佳上下文的系统,我预计这一领域将出现更多活跃的探索。还有一个有趣的转折点:尽管图数据库厂商大力推广 GraphRAG,但一些在智能体 AI 领域更具潜力的图系统可能根本不会使用图数据库。无论我们最终如何称呼这些技术——知识图谱、上下文图或上下文引擎——为智能体提供结构化、可审计上下文的核心理念正变得难以忽视。
OckBench:获得正确答案的成本
源自《OckBench:衡量大语言模型推理效率》