LlamaIndex 🦙(@llama_index)
Introducing 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵: the most comprehensive benchmark for information extraction fr...
8.5内容质量
TL;DR · AI 摘要
LlamaIndex推出ExtractBench基准测试,发现商业VLMs在处理超过50页文档时召回率骤降至35%以下。
核心要点
- ExtractBench测试了14个系统在370个企业文档、4869页、67种文档类型上的表现
- 商业VLMs处理超过50页文档时召回率低于35%但精确度保持较高
- 表格行遗漏是当前信息提取系统的重大缺陷
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- ExtractBench基准测试
- 测试范围
- 370文档/4869页/67类型
- 核心发现
- 50页后召回率<35%
- 表格行遗漏严重
- 技术影响
- 影响企业文档处理效果
金句 / Highlights
值得收藏与分享的关键句。
过去50页,商业VLMs召回率崩溃至35%以下,但精确度保持稳定
测试覆盖67种文档类型和4869页企业文档,零LLM裁判,完全确定性
表格行遗漏问题导致关键信息丢失,影响实际应用效果
#信息提取#基准测试#LlamaIndex#企业文档
打开原文LlamaIndex 🦙 on X: "推出 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵:首个面向复杂企业文档信息提取的综合性基准测试。我们的应用研究团队进行了测试:在370份企业文档、4,869页内容、67种文档类型上,对14个系统(前沿视觉语言模型、代码代理、提取API)进行了评估。https://t.co/sqddzo1hdL" / X
@llama_index
推出 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵:首个面向复杂企业文档信息提取的综合性基准测试。我们的应用研究团队进行了测试:在370份企业文档、4,869页内容、67种文档类型上,对14个系统(前沿视觉语言模型、代码代理、提取API)进行了评估。零LLM裁判,完全确定性评估。最重要的发现:超过50页后,商业视觉语言模型的召回率下降至35%以下。精确度保持较高水平,但它们会静默丢弃大部分表格行。你的提取代理遗漏了什么?立即运行ExtractBench查看结果。博客:
llamaindex.ai/blog/introduci…
GitHub:
github.com/run-llama/Extr…
HuggingFace:
huggingface.co/datasets/llama…
$
00:00
/$
下午1:00 · 2026年8月11日
29.6K
浏览量
17
10
79
39