AI HOT 精选

教视觉-语言模型说“电影语言”

8.5内容质量
教视觉-语言模型说“电影语言”

TL;DR · AI 摘要

文章讨论了视觉-语言模型在处理影视语言方面存在的问题及其解决方案。

核心要点

  • 模型缺乏精确的影视词汇描述技巧
  • 结合人类审阅和模型反馈提高质量
  • 改进训练数据提升视频生成质量

结构提纲

按章节快速跳转。

  1. 文章讨论了视觉-语言模型在处理影视语言方面存在的问题及其解决方案。

  2. 现有视觉-语言模型在处理影视语言时存在词汇不精确、信息缺失和主观描述的问题。

  3. 提出通过人类审阅和模型反馈来提高模型性能,并改进训练数据的质量。

  4. 通过实验发现,改进训练数据并不能显著改善问题,而是需要改进标注政策。

  5. 提出使用批评性人类-模型循环来解决词汇不精确和信息缺失的问题。

  6. 展望未来研究如何更好地利用人类审阅和模型反馈来提升视觉-语言模型的影视语言能力。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 视觉-语言模型与影视语言
    • 模型困境
    • 改进策略

金句 / Highlights

值得收藏与分享的关键句。

  • 现有视觉-语言模型在处理影视语言时存在词汇不精确、信息缺失和主观描述的问题。

    第 2 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#视觉-语言模型#影视语言#视频生成
打开原文

在过去一年中,我们与100多名专业创作者合作构建了一个视频字幕管道,并从监督方式的扩展而非模型规模的扩展中学到了很多。

By 林致秋昌查里克·米特拉。基于我们的CVPR 2026工作,构建一个精确的视频语言模型(亮点,前三名)。

今天的视频生成器离好莱坞摄影师有多近?

好莱坞导演会使用特定的镜头来让场景“落地”。他们通过传达特定的感觉来触动观众,而平拍镜头无法做到这一点。打开你最喜欢的视频生成器(Vevo 3.1、Seedance 2或其他最新的开源模型),并要求它拍摄一名站在熙熙攘攘街道中间的人的推拉镜头,就像希区柯克用这个镜头让世界感觉像是向内坍缩一样。或者拍摄从咖啡杯到背后的女人推拉焦点,这种推拉聚焦方式默默地告诉观众该看向何处。或者拍摄一个紧张的人凝视虚空时的斜角度镜头,一个倾斜的构图把观众置于不安之中。

大多数生成器会返回接近标准推拉镜头的画面,或带有错误焦点主体的慢动作片段。输出通常视觉上令人满意,但并没有真正实现目标。模型显然已经见过包含这些技巧的视频,但它不知道如何根据指令行动。

我们认为这反映了更广泛的问题。电影制作人使用一种共享且精确的词汇来交流:镜头大小、画面位置、聚焦类型、镜头畸变、摄像机高度、视频速度。今天的视觉语言模型(VLM)和它们所依赖的字幕数据集大多没有。

在这篇文章中,我们将描述CHAI,一个我们过去一年与100多名专业视频创作者共同构建的字幕管道(在我们的使用中,字幕是一段长而结构化的段落,描述视频的内容、运动和摄像机工作——而不是字幕轨道)。该缩写词代表基于批评的人工智能监督。现有的视频字幕数据集通常是通过众包工人编写而成的,这些人缺乏精确描述镜头所需的电影词汇;或者由大型视觉语言模型编写而成,其字幕读起来流畅(无语法或风格错误),但经常描述视频中不存在的对象(幻觉)。CHAI的核心理念在于结合两者:字幕生成模型(例如,大型视频语言模型,如Gemini-2.5-Pro)撰写草稿,经过训练的人类对其进行审查,然后模型根据这些审查进行修订。

这篇文章将探讨四个问题:

1. 视觉语言模型为何难以应对电影提示?

2. 人类和模型应该如何分配字幕工作?

3. 人类审查的质量是否会影响模型的学习成果?

4. 训练数据中的更好字幕是否能提升视频生成器的表现?

图像1
图像1

图1. 当前视频字幕管道的三种失败模式(顶部,红色),以及我们做出的响应选择(底部,蓝色):精确的规格、人类-模型监督循环,以及在显式偏好和反馈基础上进行后训练,而不是仅基于输出比较。

第一个问题:为什么视觉语言模型难以应对电影提示?

一个自然的假设是,这是能力问题——当前的视觉语言模型太小了,缺乏足够的上下文,或者没有被预训练足够多的视频来处理电影提示,下一个版本会解决这个问题。但我们审计了2016年至2025年八个流行的视频文本数据集(ActivityNet Captions、MSR-VTT、DREAM-1K、ShareGPT4Video、PerceptionLM等),我们认为瓶颈出在其他地方。这些模型训练的数据中包含视觉内容,现代视觉语言模型能够很好地感知它。缺少的是语言:与这些视频配对的字幕中没有包含描述电影技巧所需的精确词汇。在我们的实验中,即使训练更大规模的模型并使用相同的数据,这些问题也只是略有改善。它们似乎更多是由于标注政策问题,而不是能力问题。

出现过三种反复出现的模式:

• 不精确的术语。字幕将推拉镜头(相机物理向前移动)与缩放镜头(焦距变化)混淆,或将鱼眼畸变描述为“圆形建筑”。

• 缺乏信息。字幕描述画面内的内容,跳过所有其他信息:运动、相机抖动、聚焦变化、镜头大小。任何时间相关的、关于相机的信息都被忽略。

• 主观描述。“充满紧张感的氛围镜头”对模型没有任何可以锚定像素的东西。

自然的下一步思考:雇佣众包工人来编写更详细的字幕。我们尝试过这种方法。众包工人仍然将推拉镜头与缩放镜头混淆,称广角镜头为“近距离镜头”,并将鱼眼畸变描述为“圆形建筑”。看到并不等于知道如何描述。

图像2.
图像2.

图2. 同一片段的众包工人与专家描述对比。众包工人看到了空中视角镜头、鱼眼镜头和推拉镜头。他们只是使用日常词汇(“鸟瞰视角”、“圆形建筑”、“变形效果”)而不是模型需要使用的技术词汇。

最终有效的方法是引入那些工作需要这种词汇的人:电影摄影师、摄影指导、运动图形设计师、视觉特效艺术家、游戏设计师、摄像师。在过去的一年中,我们与100多名这样的合作者一起构建了一个结构化的字幕规范。规范包括五个方面:

• 主体(类型、属性、关系)

• 场景(构图、动态、叠加、视角)

• 动态(主体动作、互动、群体活动)

• 空间(镜头大小、画面位置、深度、空间移动)

• 镜头(聚焦类型、景深、稳定度、运动、视频速度、镜头畸变、高度、角度)

所有五个方面的组合涉及大约200个低级视觉原语,每个都有定义和应用条件的决策规则。这防止了标注员随意使用术语,因为他们只需根据规范进行标注。

Image 2
Image 2

图3. 以往注释工作的典型问题(左,红色)和我们达成的一致意见(右,蓝色)。结构化的分类法与摄像师、摄影师、视觉效果艺术家、运动图形设计师和游戏设计师共同构建,配以标注政策和培训教程,确保词汇在标注员之间保持一致。

Image 3
Image 3

图4. 全部分类法。五个方面,每个分解成子方面,每个都基于一组视觉或运动原语。

问题2:人类和模型应该如何分配注释工作?

一旦制定了规范,我们还需要决定由谁来撰写长注释。两个明显的选项是人类或模型,每种选择都有众所周知的局限性。

单独由人类完成会导致注释包含拼写错误、语法错误以及事件顺序不一致。此外,人类也会感到疲惫:每段视频需要仔细撰写200到400字的注释,同时查阅规范,这既耗时又昂贵。

单独由模型完成则会产生优美的注释,但这些注释在许多情况下会自信地描述视频中不存在的对象和运动。此外,它们经常混淆左右方向。

我们在试点研究中注意到的是,失败模式在某种有用的意义上是不对称的。今天的大型语言模型(LLM)的文笔比大多数人类更好。然而,尤其是经过训练的人类,比LLM更擅长发现草稿中的视觉或运动错误,即注释说“向左移动”,但实际上主体在向右移动的那种错误。因此,我们围绕这种不对称性构建了管道。模型草稿、人类批评、模型修订。这与 Saunders等人(2022年)提出的用于摘要的自我批评模型类似,但在长篇视频注释中应用,其中人类仍然承担了最难的部分:通过实际视频捕捉到的错误。

具体来说,循环如下:

1. 原语。 训练过的标注员标记视频中出现的视觉和运动原语。

2. 预注释。 模型根据这些原语生成一个长注释,遵循规范。

3. 批评。 标注员阅读预注释并与视频进行比较,写下批评指出哪里有错以及应该怎样改变。批评必须准确(指出的问题确实有问题),完整(不会遗漏错误),并且建设性(告诉模型该做什么,而不是仅仅指出某事不好)。

4. 后注释。 模型使用批评对草稿进行修订。

5. 精炼。 如果后注释仍然不准确,人类将改进批评而不是重新编写注释。

我们让评审员(表现最佳的标注员晋升为质量控制角色)检查每一条批评和后注释是否与视频相符。这样,标注员根据准确性得分,而评审员则通过发现并纠正错误获得奖励。在任何建模发生之前,数据层面的精确性和召回率都被激励。

将人类的工作从“写作”转变为“校对”带来了一个我们低估的好处:每一段视频所需的认知努力大大减少,最终产生的200到400字的注释比人类或模型单独完成时更准确。

问题3:人类批评的质量会影响模型学到的内容吗?

管道为每段视频产生一个三元组:(预注释,批评,后注释)。这个三元组不仅仅是带有注释的注释。它是一次性的监督,用于三个不同的后训练任务:

• 注释。 训练模型生成长而忠实的注释。

• 奖励建模。 将(预注释,后注释)视为一对(拒绝,首选)。

• 批评生成。 训练模型根据视频和草稿自己写批评。

我们联合使用标准监督微调(SFT)对三种格式进行后训练。我们也尝试了像Direct Preference Optimization(DPO)这样的强化学习方法,但发现简单地对完整的三元组数据进行SFT是最强的。详细数字见论文;要点是增加显式的偏好和批评信号可以改善我们测试的所有方法。

我们好奇人类批评的质量是否会影响下游性能,还是任何“这是错的”信号都会起作用。因此,我们进行了消融实验:取一个干净的CHAI批评,故意降低一个属性(准确性、召回率、建设性),看看后训练的注释器在每个任务上的表现如何。

Image 4
Image 4

图 6. 一个有用的批评必须准确(它指出的问题实际上是错误的),全面(它捕捉到了存在的错误),并且建设性(它指出应该改变什么,而不是仅仅说某物不好)。所有三个都必不可少;降低任何一个都会伤害下游模型。

表 1 中展示了 8B Qwen3-VL 在每个变体上预训练的结果。标题批评是对隔离参考标题和批评的 BLEU-4 分数(一种衡量文本生成的标准指标,范围在 0 到 100 之间;分数越高表示越接近人类参考文本)。对于奖励任务,我们报告的是基于是否标题生成器认为后文标题比前文标题评分更高的二元准确率(概率为 50%)。所有三个任务中,分数越高越好。

批评变体准确度召回率建设性标题奖励批评 盲 Gemini-2.5———10.9 44.5 21.1 Gemini-2.5———12.7 62.0 26.2 不准确的批评✗✓✓12.1 47.1 21.9 不完整的批评✓✗✓12.5 56.6 28.7 非建设性的批评✓✓✗13.4 67.2 32.9 CHAI (含 QC)✓✓✓18.2 89.8 41.7

表 1. 当单独降级一个属性时,批评在预训练后的结果。分数越高越好。作为额外参考点,我们还尝试让现成的模型在我们的人类-人工智能管道之外生成批评:(1) 盲 Gemini-2.5 使用 Gemini-2.5 对仅使用标题文本且无视频访问的批评进行评价(语言先验基线);(2) Gemini-2.5 使用相同的模型并提供完整视频输入。CHAI (含 QC) 是我们的完整管道,包括问题 2 中的同行评审质量控制步骤——即批评是准确的、完整的且建设性的。

三件事尤为突出:

1. 质量不是可选的。 降低任何一个属性都会对每一个下游任务造成实质性损害。非建设性的批评(收集起来最便宜,因为你不需要指出哪里出错)造成的损害最小但仍然留下很大的差距。

2. 存在的数据大多是非建设性的。 我们检查了像 Saunders 等人的 GDC 发布版和 MM-RLHF 这样的公开发布数据集中的批评。超过一半的批评在我们的意义上是非建设性的(“这是错误的”但没有提出修复建议)。这有助于解释为什么在那些数据集上训练会导致性能停滞不前。

3. 当数据正确时,一个 8B 模型可以在与更大封闭模型竞争。 在相同的标题化、偏好和批评基准上,预训练后的 8B Qwen3-VL 的表现或超过了我们在报告的指标中提到的 GPT-5 和 Gemini-3.1-Pro。模型大小没有改变;监督信号也没有改变。

一个小亮点:同样的奖励模型也在推理时发挥作用。使用训练好的奖励模型进行最佳 N 个解码继续提高性能,而无需额外的人类标签。

_结论:_ 批评的形式不是一种风格细节。当用于训练的批评准确、完整且建设性时,联合训练在标题、偏好和批评上的模型在所有三个任务上表现更好;当任何一个属性缺失时,表现则会更差。

问题 4:更好的训练数据中的标题能给我们带来更好的视频生成器吗?

一位持怀疑态度的读者可能会说:这一切都很不错,但标题化是大多数人真正想要的东西上游,即生成。因此,我们测试了改进的标题生成器是否能在下游视频生成器上产生影响。我们从一个大型专业视频(电影、广告、音乐视频、游戏实况)语料库中抽取标题,并使用这些新标题对Wan2.2 进行微调。

微调后的模型可以处理详细的提示(最多大约 400 个词),这些提示是现有生成器通常无法正确实现的技术:

图 7. 来自我们的预训练标题生成器在类似隔离剪辑上生成的标题(在推理时喂给视频生成器的文本)所衍生的两个长生成提示。右:零样本 Wan2.2 以宽松的方式遵循提示,一个推拉镜头变成了普通的推拉镜头,一个等距(2.5D)游戏场景变成了一个通用的 3D 弧形。左:在我们的模型重新标题化的训练视频上微调后,Wan2.2 遵循相同的提示忠实执行。

我们没有改变生成器架构或训练目标。唯一发生变化的是训练集中描述视频的语言。这足以教会现有的生成器之前无法表达的一类技术。

_结论:_ 上游更精确的标题词汇表转化为下游更可控的生成,而使用的模型架构和训练配方相同。电影控制的瓶颈在于监督,而非模型。

讨论

我们最初假设我们将训练一个标题生成器模型。最终,我们大部分时间都在围绕它的管道上花费:关于写什么标题、谁来写、谁来检查以及检查应该是什么样子的选择。模型贡献似乎几乎下游于这些选择。

我们希望早些时候能更好地理解的三件事:

• 先规格再规模。 在嘈杂的数据上训练更大的模型只带来了边际收益。一旦规格到位,较小的模型就开始看起来非常有竞争力。

• “众包”不是基准;而是另一个问题。 正确标注电影技术需要的是领域已经使用的同一种词汇。让未受过训练的工人在飞快地发明这种词汇并不是让受过训练的工人应用它的廉价版本。

• 批评是训练数据。我们今天收集的批评形式决定了模型明天可以被有效训练的程度。只记录点赞/踩脚的评价数据,留下了大量未被利用的训练后信号。

CHAI 是一项更广泛努力的一部分,该努力专注于“精确视频语言”。最接近的伙伴是 CameraBench (NeurIPS'25 Spotlight),这是我们之前的一项相机运动基准测试,它为规格中的相机侧基础模块奠定了基础。

资源

我们发布了规格、训练教程、标注平台、质量控制流程、数据、代码和模型。如果您正在从事视频理解或生成工作,并且想要使用这些资源,请务必联系我们。

项目页面:https://linzhiqiu.github.io/papers/chai/

论文:https://arxiv.org/abs/2604.21718

代码:https://github.com/chancharikmitra/CHAI

参考文献

Krishna et al., 2017. Dense-Captioning Events in Videos (ActivityNet Captions). ICCV. arXiv:1705.00754.

Xu et al., 2016. MSR-VTT: A Large Video Description Dataset for Bridging Video and Language. CVPR.

Wang et al., 2024. Tarsier: Recipes for Training and Evaluating Large Video Description Models (DREAM-1K). arXiv:2407.00634.

Chen et al., 2024. ShareGPT4Video: Improving Video Understanding and Generation with Better Captions. NeurIPS. arXiv:2406.04325.

Cho et al., 2025. PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding. arXiv:2504.13180.

Saunders et al., 2022. Self-critiquing Models for Assisting Human Evaluators. arXiv:2206.05802.

Zhang et al., 2025. MM-RLHF: The Next Step Forward in Multimodal LLM Alignment. arXiv:2502.10391.

Lin et al., 2025. Towards Understanding Camera Motions in Any Video (CameraBench). NeurIPS Spotlight. arXiv:2504.15376.

Wan Team, 2025. Wan: Open and Advanced Large-Scale Video Generative Models (Wan2.2). arXiv:2503.20314.

Bai et al., 2025. Qwen3-VL 技术报告。arXiv:2511.21631.

所有作者在本文中表达的观点仅代表他们的意见,不代表卡内基梅隆大学的观点。