In text retrieval, multi-vector's advantage is conditional. On short documents and simple queries, a...

TL;DR · AI 摘要
多向量检索在视觉文档任务中显著优于密集向量,但在文本任务中优势不明显。
核心要点
- 在视觉文档任务中,多向量模型ColQwen3比密集模型Qwen3-VL-Embedding高出17.7个nDCG@10点。
- 使用LEMUR近似搜索时,ColQwen3比密集模型高出18.3个nDCG@10点,且近似成本几乎为零。
- 多向量模型在视觉文档中保持优势,因为其保留了页面的空间结构,而密集模型无法做到这一点。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 多向量检索的优势与限制
- 实验场景
- 视觉文档任务(DocVQA)
- 文本任务(MS MARCO、SciFact)
- 模型对比
- ColQwen(多向量)
- Qwen3-VL-Embedding(密集)
- 性能表现
- 视觉文档中多向量模型显著优于密集模型
- 文本任务中近似搜索削弱多向量优势
金句 / Highlights
值得收藏与分享的关键句。
在DocVQA任务中,多向量模型ColQwen3比密集模型Qwen3-VL-Embedding高出17.7个nDCG@10点。
使用LEMUR近似搜索时,ColQwen3比密集模型高出18.3个nDCG@10点,且近似成本几乎为零。
多向量模型通过保留页面的空间结构,提升了视觉文档检索的准确性。
Milvus on X: "在文本检索中,多向量的优势是有条件的。在短文档和简单查询中,近似方法通常会抹去其相对于密集向量的优势。但在视觉文档中,这一情况被反转:多向量比密集基线高出 𝗻𝗲𝗮𝗿𝗹𝘆 𝟭𝟴 𝗽𝗼𝗶𝗻𝘁𝘀,且这一优势在近似方法下几乎保持不变 https://t.co/36ghRafIXM" / X
@milvusio
在文本检索中,多向量的优势是有条件的。在短文档和简单查询中,近似方法通常会抹去其相对于密集向量的优势。但在视觉文档中,这一情况被反转:多向量比密集基线高出 𝗻𝗲𝗮𝗿𝗹𝘆 𝟭𝟴 𝗽𝗼𝗶𝗻𝘁𝘀,且这一优势在近似方法下几乎保持不变。我们在 DocVQA 上运行了 ColQwen(多向量)与 Qwen3-VL-Embedding(密集)的对比。 𝗧𝗵𝗶𝘀 𝘁𝗮𝘀𝗸 𝗶𝘀 𝗺𝘂𝗹𝘁𝗶𝗺𝗼𝗱𝗮𝗹: 𝘁𝗵𝗲 𝗾𝘂𝗲𝗿𝘆 𝗶𝘀 𝘁𝗲𝘅𝘁, 𝘄𝗵𝗶𝗹𝗲 𝘁𝗵𝗲 𝗱𝗼𝗰𝘂𝗺𝗲𝗻𝘁 𝗶𝘀 𝗮𝗻 𝗶𝗺𝗮𝗴𝗲, 𝗮𝗻𝗱 𝘁𝗵𝗲 𝗺𝗼𝗱𝗲𝗹 𝗲𝗻𝗰𝗼𝗱𝘀 𝘁𝗵𝗲 𝗶𝗺𝗮𝗴𝗲 𝗶𝗻𝘁𝗼 𝘃𝗲𝗰𝘁𝗼𝗿𝘀. 对于 ColBERT 风格的模型,如 ColQwen,图像在 patch 级别被编码为多个向量。对于密集模型,如 Qwen3-VL-Embedding,图像被编码为一个向量。 𝗘𝘅𝗮𝗰𝘁 𝘀𝗲𝗮𝗿𝗰𝗵 (BruteForce, the quality ceiling): • Dense: 𝟬.𝟱𝟮𝟭 nDCG@10 • ColQwen2: 𝟬.𝟲𝟭𝟬 (+8.9 pt) • ColQwen3: 𝟬.𝟲𝟵𝟴 (+17.7 pt) 𝗔𝗽𝗽𝗿𝗼𝘅𝗶𝗺𝗮𝘁𝗲 𝘀𝗲𝗮𝗿𝗰𝗵 (LEMUR, ratio=5.0): • ColQwen2: 𝟬.𝟱𝟵𝟲 (+7.5 pt over dense) • ColQwen3: 𝟬.𝟳𝟬𝟰 (+18.3 pt over dense) 𝗔𝗽𝗽𝗿𝗼𝘅𝗶𝗺𝗮𝘁𝗶𝗼𝗻 𝗰𝗼𝘀𝘁 𝘄𝗮𝘀 𝗲𝗳𝗳𝗲𝗰𝘁𝗶𝘃𝗲𝗹𝘆 𝘇𝗲𝗿𝗼. ColQwen3 的近似得分比其精确得分高出 0.006,这在 100 次查询中属于噪声。在像 MS MARCO 和 SciFact 这样的文本基准测试中,近似方法通常会抹去多向量的优势。在这里,优势没有变化。 𝗧𝗵𝗲 𝗴𝗮𝗽 𝗰𝗼𝗺𝗲𝘀 𝗳𝗿𝗼𝗺 𝘁𝗵𝗲 𝗽𝗮𝗴𝗲 𝗶𝘁𝘀𝗲𝗹𝗳: 𝘁𝗮𝗯𝗹𝗲𝘀, 𝗰𝗵𝗮𝗿𝘁𝘀, 𝗺𝘂𝗹𝘁𝗶-𝗰𝗼𝗹𝘂𝗺𝗻 𝗹𝗮𝘆𝗼𝘂𝘁𝘀, 𝗳𝗼𝗻𝘁 𝗵𝗶𝗲𝗿𝗮𝗿𝗰𝗵𝘆. 密集模型将所有这些信息折叠到一个向量中,从而丢失了空间结构。 patch 级别的多向量将每个区域作为自己的向量,因此 MaxSim 可以将查询匹配到页面中相关部分。单个向量无法承载整页的结构。 𝗢𝗻𝗲 𝗰𝗮𝘃𝗲𝗮𝘁: 𝗧𝗼𝗸𝗲𝗻𝗔𝗡𝗡 𝗱𝗼𝗲𝘀𝗻'𝘁 𝘄𝗼𝗿𝗸 𝗵𝗲𝗿𝗲 𝗮𝘁 𝗮𝗹𝗹. 两个模型的得分都低于 0.05。视觉模型每页会生成数千个 patch(ColQwen2: 5,143; ColQwen3: 1,250),每个 patch 覆盖图像的面积很小,因此每个 patch 的 ANN 无法定位正确的页面。可用的策略是压缩策略,MUVERA 和 LEMUR。 𝗜𝗳 𝘆𝗼𝘂'𝗿𝗲 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗶𝗻𝗴 𝗶𝗻𝘃𝗼𝗶𝗰𝗲𝘀, 𝗿𝗲𝗽𝗼𝗿𝘁𝘀, 𝘀𝗰𝗮𝗻𝘀, 𝗼𝗿 𝗣𝗗𝗙 𝗽𝗮𝗴𝗲𝘀 𝗯𝘆 𝘁𝗵𝗲𝗶𝗿 𝘃𝗶𝘀𝘂𝗮𝗹 𝗰𝗼𝗻𝘁𝗲𝗻𝘁, 𝗺𝘂𝗹𝘁𝗶-𝘃𝗲𝗰𝘁𝗼𝗿 𝘄𝗶𝘁𝗵 𝗟𝗘𝗠𝗨𝗥 𝗼𝗿 𝗠𝗨𝗩𝗘𝗥𝗔 𝗶𝘀 𝗮 𝗺𝗲𝗮𝘀𝘂𝗿𝗮𝗯𝗹𝗲 𝘀𝘁𝗲𝗽 𝘂𝗽 𝗳𝗿𝗼𝗺 𝗮 𝗱𝗲𝗻𝘀𝗲 𝗯𝗮𝘀𝗲𝗹𝗶𝗻𝗲, 𝗮𝗻𝗱 𝘁𝗵𝗲 𝗹𝗲𝗮𝗱 𝘀𝘂𝗿𝘃𝗶𝘃𝗲𝘀 𝗼𝗻𝗰𝗲 𝘆𝗼𝘂 𝗺𝗼𝘃𝗲 𝗼𝗳𝗳 𝗲𝘅𝗮𝗰𝘁 𝘀𝗲𝗮𝗿𝗰𝗵.
3:20 PM · Jun 17, 2026
278
Views
3