LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
Apple Machine Learning Research392 字 (约 2 分钟)
85
苹果提出LVSum基准,揭示当前多模态大模型在长视频摘要任务中存在时间定位和跨模态一致性缺陷。
入选理由:转录本对摘要质量的贡献是视觉帧的2.3倍
FeaturedArticle#Computer Vision#Benchmark#Multimodal LLMs#Video Summarization英文