Enhancing Agent Retrieval with Structured Chart Extraction
TL;DR · AI 摘要
结构化图表提取技术使Databricks Genie在图表问答准确率上超越大模型,正确识别出18个局部极大值而其他模型仅答17个。
核心要点
- Databricks Genie通过结构化图表提取正确识别18个局部极大值,而前沿模型错误回答17个
- 结构化提取方法在ViDoRe V3和Chart-RAG数据集上优于大模型
- Databricks构建的AI函数流水线实现图表感知检索
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 结构化图表提取技术
- 方法优势
- 超越大模型准确率
- 提升金融领域检索
- 技术实现
- ai_parse_document工具
- AI函数流水线
- 实验数据
- ViDoRe V3数据集
- Chart-RAG数据集
金句 / Highlights
值得收藏与分享的关键句。
Genie使用结构化提取正确回答18个局部极大值,而前沿模型仅答17个
文本检索系统在图表问题上准确率低于非图表问题32%
结构化提取方法在Chart-RAG数据集上达到92.7%准确率
通过结构化图表提取增强代理检索 | Databricks 博客
跳至主要内容
AI 研究
2026年8月27日
通过结构化图表提取增强代理检索
在 ai_parse_document 中实现的结构化图表提取,结合轻量级文本检索,能够提升图表检索和代理回答的准确性,并且在性能上超越大型多模态嵌入模型。
由 Databricks AI 研究团队撰写
动机
越来越多的企业现在要求代理系统处理其专有文档并回答相关内容的问题。然而,许多关键信息都包含在图表和图像中。许多客户发现,代理系统在需要读取和计算图表数值的问题上表现不佳。为了使代理系统在各种企业环境中可靠运行,我们需要提升图表的可解释性。
如何让图表更容易被代理理解?我们进行了一项简单快速的测试:向不同代理系统提出问题,“这张图表上有多少个局部极大值?”
以下是前沿代理系统与 Databricks Genie 在回答该问题时的对比。前沿代理系统仅接收图像输入,经过 50 秒推理后仍给出错误答案 17。而 Databricks Genie 通过 ai_parse_document 进行结构化图表提取,正确得出答案 18。
仅接收图像的前沿代理系统回答(错误):
通过结构化图表提取的 Genie 代理系统回答(正确):
我们在 OfficeQA Pro 基准测试中注意到类似问题,模型在基于图表和多模态问题上的表现明显弱于无需图表理解的问题。客户的信息检索系统中也存在相同问题,尤其是在金融服务领域。基于文本的检索系统只能搜索文本空间。常见的解决方案是生成图表描述性标题,但这种方法可能遗漏图表中需要精细数值分析的问题所需的数据。结果可能导致系统检索到错误页面,或虽然检索到正确页面却缺乏足够信息来回答问题。
在本文中,我们证明了通过结构化图表提取可以显著提升图表相关问题的检索和回答质量。我们在两个数据集上评估了我们的方法:ViDoRe V3 的图表密集型子集(用于视觉丰富文档的检索和问答基准测试),以及我们构建的合成图表专注数据集 Chart-RAG。我们的方法在性能上可与大型单向量和多向量多模态嵌入模型竞争。
图 1:仅描述解析、通过 ai_parse_document 提取的前三个检索图像和使用前五检索页面的最强多模态嵌入基线的问答准确率对比。结果为三次运行的平均值。
我们通过 Databricks 的 AI 函数构建了完整的图表感知检索流水线(见图 2),该函数集由基于最先进研究技术优化的可组合函数组成。我们使用 ai_parse_document 提取文档内容(包括以结构化 JSON 表示的图表),并使用 ai_prep_search 将内容转换为可检索的片段,通过轻量级 300M 参数文本嵌入模型进行索引。我们使用 ai_search 从片段创建索引,并将索引连接到 Genie 以实现检索和回答。
图2:使用Databricks AI函数实现的图表提取和检索流程。
评估方法
我们比较了两种索引,它们均基于3亿参数的BGE文本嵌入模型构建,使用相同的源PDF文档,唯一区别在于图表表示方式:
- 仅描述(基线):仅通过图注表示图表
- JSON增强:通过图注和结构化图表JSON表示图表,JSON内联嵌入在图表块中
一个图表提取示例:
比较2026年和2027年GDP增长与核心通胀的五种经济预测情景的分组条形图。
$
/$
我们评估了ViDoRe V3基准测试中310个图表和信息图密集型问题。该基准测试在七个领域评估检索和回答能力:就业、能源、制药、物理、金融、计算机科学和工业文档。在每个实验中,我们解析并切分完整的16,000页英文语料库,并为每个查询生成答案,在完整索引中进行搜索。
尽管选择了图表相关问题,但许多问题仍可通过周围文本回答。为隔离图表内容的影响,我们创建了第二个基准测试,仅聚焦于从三份复杂且图表密集的报告(BIS季度评论、IMF世界经济展望、摩根大通长期资本市场假设)中生成的图表相关问题。我们从这三份总计378页的文档中编写了114个视觉基础问题,构建了合成的Chart-RAG数据集。
评分:我们使用LLM评委(gemini-3-flash)将每个答案与参考答案对比,按正确/部分正确/错误进行评分。
检索:我们报告Hit Rate@10和nDCG@10。Hit Rate@10检查前10个检索结果中是否包含至少一个参考页面。ViDoRe基准测试的问题可能包含多个参考页面,每个页面的相关性评分为1或2。对于Hit Rate@10,我们将分级相关性转换为二元相关性,允许评分1或2的页面均计入命中。对于nDCG@10,我们保留原始分级相关性。在Chart-RAG数据集中,每个查询只有一个参考页面。
为实现稳定测量,我们对每种配置运行三次实验,并报告带有置信区间的实验结果。
结构化图表数据提升检索与回答效果
图3:在ViDoRe V3子集和合成Chart-RAG数据集中,仅描述检索与Chart-JSON增强检索的问答正确率、Hit@10和nDCG@10对比。结果为三次运行的平均值。
结构化图表JSON在两个数据集中均提升了回答质量与检索效果。以下问题级分析展示了修正答案与检索效果提升的关联性。
图4:添加图表JSON修正了之前错误的答案。在这些修正答案中,图表展示了JSON如何提升检索(Hit@10)或排序(nDCG@10)效果。结果为三次运行的平均值。
以下Chart-RAG数据集示例展示了JSON表示如何提升检索与回答质量:
问题
修正前答案
使用图表-JSON增强的ai_parse_document答案
2026年第一季度石油VIX达到的峰值水平(%点)大约是多少?
参考以下图表:
"在提供的搜索结果中,我找不到关于2026年第一季度石油VIX确切峰值水平的具体信息...."
"根据图表数据,石油VIX在2026年第一季度达到约80个百分点。"
这种检索收益可能不仅限于图表相关问题。提取的图表数值和标签可以使页面本身更容易被检索到,即使答案并未直接出现在图表中。
图像进一步提升答案质量
某些问题取决于图表的视觉呈现方式,而不仅仅是其数值。为了衡量恢复视觉上下文的收益,我们在回答时为代理提供了与检索到的前三段文本片段对应的图像。
图5:仅使用图表JSON和在回答时添加前三张检索图像的正确率。结果为三次运行的平均值。
在此情况下,检索过程保持不变。图像在Chart-RAG数据集上增加了4个百分点,在ViDoRe V3子集上增加了2.6个百分点。
JSON表示与多模态嵌入具有竞争力
一个关键问题是,我们采用的轻量级3亿参数文本嵌入模型,与多模态嵌入模型相比表现如何。我们对四种替代方案进行了基准测试:ColQwen2.5-3B(一种使用晚期交互评分的大型多向量多模态嵌入模型)、Qwen3-VL-Embedding-2B(一种大型单向量多模态嵌入模型),以及更轻量的单向量模型Jina CLIP v2(0.9B参数)和CLIP ViT-L/14(428M参数)。每个多模态模型对每一页进行嵌入。在查询时,我们使用MaxSim对ColQwen2.5-3B进行排序,对单向量模型使用余弦相似度,对整个语料库进行搜索,并将得分最高的五页传递给回答VLM。我们基于两个原因报告使用五页检索的答案正确率。首先,这在ViDoRe子集和Chart-RAG数据集的最佳表现深度之间提供了平衡的中点。其次,五页数量接近我们方法中使用的平均输入上下文,实现了公平比较。我们仍然报告nDCG@10作为标准检索指标。
ViDoRe V3:
Chart-RAG:
对于最强的模型,由于Chart-RAG数据集仅有378页,检索效果已接近饱和。因此,更有意义的比较是答案质量。
在ViDoRe V3上,结合前三张图像的图表JSON达到75.9%的正确率。在Chart-RAG上,相同设置达到75.1%。这两种情况均超过了四种多模态嵌入基线,且仅传递了三张图像给模型。这种性能来自于一种比ColQwen2.5-3B多向量晚期交互架构小约10倍且更简单的替代方案。因此,结构化图表预处理可以在更小的图像预算和更低的索引检索开销下,提供具有竞争力的答案质量。
结论
图表是企业文档中信息的主要形式。使图表信息易于查找且清晰可解释,对检索代理的准确性至关重要。结构化图表JSON通过向检索索引和代理推理过程添加精确数值,弥补了经典RAG系统的不足。我们证明了结构化图表JSON能同时提升检索质量和代理回答准确性。未来的工作可以进一步探索不同结构化提取表示格式对检索和回答准确性的影响。
ai_parse_document 的 chart-JSON 富化功能即将上线,未来解析任何文档时将自动包含其图表值的结构化文本,且无需对函数接口进行任何修改。为了实现检索,我们建议将其与 ai_prep_search 搭配使用。该功能还将增强 Genie One 的能力,帮助 Databricks 客户在 PDF 文档中更精准地回答与图表相关的问题。
作者:Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia
立即在 ai_parse_document 中结合 ai_prep_search 尝试,构建具备图表理解能力的检索与问答流水线
订阅博客获取最新文章
订阅我们的博客,最新文章将直接发送到您的邮箱。
立即注册
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"