Milvus(@milvusio)

In text retrieval, multi-vector's advantage is conditional. On short documents and simple queries, a...

8.5内容质量
In text retrieval, multi-vector's advantage is conditional. On short documents and simple queries, a...

TL;DR · AI 摘要

多向量检索在视觉文档任务中显著优于密集向量,但在文本任务中优势不明显。

核心要点

  • 在视觉文档任务中,多向量模型ColQwen3比密集模型Qwen3-VL-Embedding高出17.7个nDCG@10点。
  • 使用LEMUR近似搜索时,ColQwen3比密集模型高出18.3个nDCG@10点,且近似成本几乎为零。
  • 多向量模型在视觉文档中保持优势,因为其保留了页面的空间结构,而密集模型无法做到这一点。

结构提纲

按章节快速跳转。

  1. 多向量检索在不同任务中的表现取决于文档类型和查询复杂度。

  2. 在DocVQA任务中,多向量模型在视觉文档中显著优于密集模型。

  3. 多向量模型通过保留页面的空间结构,提升了视觉文档检索的准确性。

  4. 使用LEMUR近似搜索时,多向量模型的性能优势依然显著,且近似成本几乎为零。

  5. 在文本任务中,多向量模型的优势通常被近似搜索削弱。

  6. 多向量模型适用于发票、报告、扫描件等视觉内容的检索任务。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 多向量检索的优势与限制
    • 实验场景
      • 视觉文档任务(DocVQA)
      • 文本任务(MS MARCO、SciFact)
    • 模型对比
      • ColQwen(多向量)
      • Qwen3-VL-Embedding(密集)
    • 性能表现
      • 视觉文档中多向量模型显著优于密集模型
      • 文本任务中近似搜索削弱多向量优势

金句 / Highlights

值得收藏与分享的关键句。

  • 在DocVQA任务中,多向量模型ColQwen3比密集模型Qwen3-VL-Embedding高出17.7个nDCG@10点。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 使用LEMUR近似搜索时,ColQwen3比密集模型高出18.3个nDCG@10点,且近似成本几乎为零。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 多向量模型通过保留页面的空间结构,提升了视觉文档检索的准确性。

    正文

    ⬇︎ 下载 PNG𝕏 分享到 X
#Milvus#多向量检索#视觉文档#信息检索
打开原文

Milvus on X: "在文本检索中,多向量的优势是有条件的。在短文档和简单查询中,近似方法通常会抹去其相对于密集向量的优势。但在视觉文档中,这一情况被反转:多向量比密集基线高出 𝗻𝗲𝗮𝗿𝗹𝘆 𝟭𝟴 𝗽𝗼𝗶𝗻𝘁𝘀,且这一优势在近似方法下几乎保持不变 https://t.co/36ghRafIXM" / X

Milvus

@milvusio

在文本检索中,多向量的优势是有条件的。在短文档和简单查询中,近似方法通常会抹去其相对于密集向量的优势。但在视觉文档中,这一情况被反转:多向量比密集基线高出 𝗻𝗲𝗮𝗿𝗹𝘆 𝟭𝟴 𝗽𝗼𝗶𝗻𝘁𝘀,且这一优势在近似方法下几乎保持不变。我们在 DocVQA 上运行了 ColQwen(多向量)与 Qwen3-VL-Embedding(密集)的对比。 𝗧𝗵𝗶𝘀 𝘁𝗮𝘀𝗸 𝗶𝘀 𝗺𝘂𝗹𝘁𝗶𝗺𝗼𝗱𝗮𝗹: 𝘁𝗵𝗲 𝗾𝘂𝗲𝗿𝘆 𝗶𝘀 𝘁𝗲𝘅𝘁, 𝘄𝗵𝗶𝗹𝗲 𝘁𝗵𝗲 𝗱𝗼𝗰𝘂𝗺𝗲𝗻𝘁 𝗶𝘀 𝗮𝗻 𝗶𝗺𝗮𝗴𝗲, 𝗮𝗻𝗱 𝘁𝗵𝗲 𝗺𝗼𝗱𝗲𝗹 𝗲𝗻𝗰𝗼𝗱𝘀 𝘁𝗵𝗲 𝗶𝗺𝗮𝗴𝗲 𝗶𝗻𝘁𝗼 𝘃𝗲𝗰𝘁𝗼𝗿𝘀. 对于 ColBERT 风格的模型,如 ColQwen,图像在 patch 级别被编码为多个向量。对于密集模型,如 Qwen3-VL-Embedding,图像被编码为一个向量。 𝗘𝘅𝗮𝗰𝘁 𝘀𝗲𝗮𝗿𝗰𝗵 (BruteForce, the quality ceiling): • Dense: 𝟬.𝟱𝟮𝟭 nDCG@10 • ColQwen2: 𝟬.𝟲𝟭𝟬 (+8.9 pt) • ColQwen3: 𝟬.𝟲𝟵𝟴 (+17.7 pt) 𝗔𝗽𝗽𝗿𝗼𝘅𝗶𝗺𝗮𝘁𝗲 𝘀𝗲𝗮𝗿𝗰𝗵 (LEMUR, ratio=5.0): • ColQwen2: 𝟬.𝟱𝟵𝟲 (+7.5 pt over dense) • ColQwen3: 𝟬.𝟳𝟬𝟰 (+18.3 pt over dense) 𝗔𝗽𝗽𝗿𝗼𝘅𝗶𝗺𝗮𝘁𝗶𝗼𝗻 𝗰𝗼𝘀𝘁 𝘄𝗮𝘀 𝗲𝗳𝗳𝗲𝗰𝘁𝗶𝘃𝗲𝗹𝘆 𝘇𝗲𝗿𝗼. ColQwen3 的近似得分比其精确得分高出 0.006,这在 100 次查询中属于噪声。在像 MS MARCO 和 SciFact 这样的文本基准测试中,近似方法通常会抹去多向量的优势。在这里,优势没有变化。 𝗧𝗵𝗲 𝗴𝗮𝗽 𝗰𝗼𝗺𝗲𝘀 𝗳𝗿𝗼𝗺 𝘁𝗵𝗲 𝗽𝗮𝗴𝗲 𝗶𝘁𝘀𝗲𝗹𝗳: 𝘁𝗮𝗯𝗹𝗲𝘀, 𝗰𝗵𝗮𝗿𝘁𝘀, 𝗺𝘂𝗹𝘁𝗶-𝗰𝗼𝗹𝘂𝗺𝗻 𝗹𝗮𝘆𝗼𝘂𝘁𝘀, 𝗳𝗼𝗻𝘁 𝗵𝗶𝗲𝗿𝗮𝗿𝗰𝗵𝘆. 密集模型将所有这些信息折叠到一个向量中,从而丢失了空间结构。 patch 级别的多向量将每个区域作为自己的向量,因此 MaxSim 可以将查询匹配到页面中相关部分。单个向量无法承载整页的结构。 𝗢𝗻𝗲 𝗰𝗮𝘃𝗲𝗮𝘁: 𝗧𝗼𝗸𝗲𝗻𝗔𝗡𝗡 𝗱𝗼𝗲𝘀𝗻'𝘁 𝘄𝗼𝗿𝗸 𝗵𝗲𝗿𝗲 𝗮𝘁 𝗮𝗹𝗹. 两个模型的得分都低于 0.05。视觉模型每页会生成数千个 patch(ColQwen2: 5,143; ColQwen3: 1,250),每个 patch 覆盖图像的面积很小,因此每个 patch 的 ANN 无法定位正确的页面。可用的策略是压缩策略,MUVERA 和 LEMUR。 𝗜𝗳 𝘆𝗼𝘂'𝗿𝗲 𝗿𝗲𝘁𝗿𝗶𝗲𝘃𝗶𝗻𝗴 𝗶𝗻𝘃𝗼𝗶𝗰𝗲𝘀, 𝗿𝗲𝗽𝗼𝗿𝘁𝘀, 𝘀𝗰𝗮𝗻𝘀, 𝗼𝗿 𝗣𝗗𝗙 𝗽𝗮𝗴𝗲𝘀 𝗯𝘆 𝘁𝗵𝗲𝗶𝗿 𝘃𝗶𝘀𝘂𝗮𝗹 𝗰𝗼𝗻𝘁𝗲𝗻𝘁, 𝗺𝘂𝗹𝘁𝗶-𝘃𝗲𝗰𝘁𝗼𝗿 𝘄𝗶𝘁𝗵 𝗟𝗘𝗠𝗨𝗥 𝗼𝗿 𝗠𝗨𝗩𝗘𝗥𝗔 𝗶𝘀 𝗮 𝗺𝗲𝗮𝘀𝘂𝗿𝗮𝗯𝗹𝗲 𝘀𝘁𝗲𝗽 𝘂𝗽 𝗳𝗿𝗼𝗺 𝗮 𝗱𝗲𝗻𝘀𝗲 𝗯𝗮𝘀𝗲𝗹𝗶𝗻𝗲, 𝗮𝗻𝗱 𝘁𝗵𝗲 𝗹𝗲𝗮𝗱 𝘀𝘂𝗿𝘃𝗶𝘃𝗲𝘀 𝗼𝗻𝗰𝗲 𝘆𝗼𝘂 𝗺𝗼𝘃𝗲 𝗼𝗳𝗳 𝗲𝘅𝗮𝗰𝘁 𝘀𝗲𝗮𝗿𝗰𝗵.

3:20 PM · Jun 17, 2026

278

Views

3