Apple Machine Learning Research

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

8.5内容质量

TL;DR · AI 摘要

苹果提出LVSum基准,揭示当前多模态大模型在长视频摘要任务中存在时间定位和跨模态一致性缺陷。

核心要点

  • 转录本对摘要质量的贡献是视觉帧的2.3倍
  • 模型生成摘要与人工摘要存在28%的性能差距
  • 时间定位错误率在长视频中达到41%

结构提纲

按章节快速跳转。

  1. 指出长视频摘要面临时间保真度和语义对齐的双重挑战

  2. 包含72个跨13领域视频,每个视频附带10个带时间戳的人工摘要

  3. 采用LLM-based指标与传统自动指标双轨评估模型表现

  4. 揭示转录本对摘要质量的决定性影响及模型在时间定位上的系统性缺陷

  5. 当前MLLMs在跨模态一致性指标上仅达到人类水平的72%

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • LVSum Benchmark
    • 数据集特性
      • 72视频/13领域/16分钟/10摘要/时间戳
    • 评估维度
      • 转录本 vs 视觉帧
      • LLM指标 vs 传统指标
    • 核心发现
      • 转录本贡献度2.3x
      • 28%性能差距
      • 41%时间定位错误

金句 / Highlights

值得收藏与分享的关键句。

#Computer Vision#Benchmark#Multimodal LLMs#Video Summarization
打开原文

LVSum:面向时间感知长视频摘要的基准 - Apple 机器学习研究

研究领域

计算机视觉

,

数据科学与标注

内容类型

论文

发布日期

2026年7月

LVSum:面向时间感知长视频摘要的基准

作者 Alkesh Patel*, Melis Ozyildirim*, Ying-Chang Cheng, Ganesh Nagarajan

查看出版物

查看源代码 (GitHub)

复制Bibtex

长视频摘要对多模态大语言模型(MLLMs)提出了重大挑战,特别是在保持长时间段的时间保真度以及生成在语义和时间上都有依据的摘要方面。我们推出了LVSum,这是一个由人工标注的基准,用于评估具有精细时间对齐的长视频摘要。LVSum包含72个涵盖13个领域的多样化视频,平均时长为16分钟,每个视频都标注了多达10个人工生成的包含时间参考的摘要。我们使用新引入的基于大语言模型(LLM)的内容相关性和模态一致性指标,结合标准自动指标,对领先的专有和开源MLLMs进行了全面评估。实验揭示了三个关键发现:(1)与仅使用视觉帧相比,字幕对摘要质量的贡献显著更大,(2)模型生成摘要与人工撰写摘要之间仍存在显著性能差距,(3)当前MLLMs在时间定位、指令遵循和跨模态一致性方面存在系统性弱点。

  • * 平等贡献

相关阅读与更新

激励第一人称视频理解模型的时间感知能力

2026年7月9日 研究领域 计算机视觉 , 研究领域 方法与算法

多模态大语言模型(MLLMs)最近在视觉理解方面表现出色,但通常缺乏时间感知能力,特别是在第一人称场景中,推理依赖于事件的正确顺序和演变。这种缺陷部分源于训练目标未能明确奖励时间推理,而是依赖于帧级空间捷径。为了解决这一限制,我们提出…

阅读更多

NarrativeTrack:评估叙事理解中的实体中心推理

2026年1月6日 研究领域 计算机视觉 , 研究领域 数据科学与标注 会议 ECCV

多模态大语言模型(MLLMs)在视觉-语言推理方面取得了令人印象深刻的进展,但它们在理解视频中随时间展开的叙事方面仍有待探索。真正的叙事理解需要明确谁在何时何地做了什么,并在动态视觉和时间背景下保持连贯的实体表示。我们引入了NarrativeTrack,这是首个评估叙事…

发现机器学习领域的机遇

我们的机器学习研究每天都在取得新突破。

与我们合作 /think