北京大学联手快手Kling团队打造“视频字幕图像定位器“ 📅 2026/8/11 2:22:50 这项由北京大学、快手Kling团队、新加坡国立大学、南京大学、香港科技大学广州、香港中文大学、复旦大学、清华大学、上海人工智能实验室、中科院自动化所等多家机构联合开展的研究以预印本形式于2026年7月30日发布论文编号为arXiv:2607.28509有兴趣深入了解的读者可通过该编号查阅完整原文。你有没有遇到过这样的场景你手边有一批照片——一个穿红裙子的女孩、一只棕色小狗、一座石桥、一把黄色雨伞——然后有一段视频里面恰好出现了这些东西。现在有人让你写一段视频描述要求你在提到女孩的时候注明这是第一张照片提到小狗时注明是第五张照片提到石桥时注明是第三张照片以此类推——而且有几张照片根本没在视频里出现你还得把它们挑出来忽略掉。听起来既繁琐又需要极度细心对吧但对于做视频内容理解和生成的人工智能来说这恰恰是一个关键难题。现有的AI可以把视频内容描述得有声有色却没办法准确地把描述中的每个词语和对应的参考图片挂钩。于是这支来自多所顶尖高校和工业界实验室的研究团队提出了一个全新的任务框架和对应的模型——**RefCaptioner**专门来解决这件看似简单、实则相当棘手的事情。---一、这件事为什么很难做先用一个更贴近生活的比喻来理解这个挑战。假设你是一名博物馆的语音导览员手边有一叠展品照片但这些照片没有编号而且混入了几张根本不在展厅里的图片。现在你需要边带观众参观边随口说出您现在看到的这幅画对应我手里的第X号照片而您左手边的雕塑对应第Y号照片——还要在恰当的时机忽略那些不属于展厅的照片绝不能瞎指一通。这件事大致有三类困难。第一类困难是哪张照片有用、哪张没用。视频里可能只出现了10件东西但给你准备了22张参考图片其中一些是干扰项论文里叫distractor也就是迷惑性无关图片。AI必须准确区分哪些照片在视频里确实能找到对应物哪些根本没出现过。如果一概全用会凭空捏造不存在的对应关系如果过于保守不敢用又会丢失有用的信息。第二类困难是这张照片对应描述里的哪个词。就算AI正确选出了所有有用照片还得把每张照片贴到描述文字里正确的位置。比如一位穿红裙子的女孩对应第一张照片而她手里的黄色雨伞对应第七张照片——这两个词虽然都和女孩有关但所指的东西完全不同不能互换。在多人物、多物体的复杂视频里AI稍不留神就会张冠李戴。第三类困难是多张照片说的是同一个东西。有时候同一个人或同一件物品被从不同角度拍了多张照片它们应该一起附在描述里同一个词语的后面而不是被当成不同的东西分散到句子各处。这要求AI能识别出这三张照片其实说的都是同一个主体并把它们归在一起。这三个难题叠在一起就是为什么以往的AI在这件事上总是出岔子的根本原因。---二、RefCaptioner的解题思路先打基础再精雕细琢研究团队把训练RefCaptioner的过程比喻成培养一个新员工先教他做事的基本规范再通过反馈机制让他越做越精。整个训练分两个阶段。第一阶段叫做混合数据监督微调。团队准备了两类训练材料一类是专门制作的带图片标注的视频描述也就是在描述文字里正确标注了哪个词对应哪张图片的样本这些样本都经过人工审核确保内容准确另一类是普通的详细视频描述没有图片标注主要用来让模型保持描述视频内容的基本能力。两类材料以相同比例混合训练。这样做的好处在于专门的标注样本教会模型怎么正确贴图片标签而普通描述样本则防止模型在这个过程中忘了怎么好好描述视频。这个阶段就像是给新员工发了一本操作手册告诉他基本规则是什么、格式应该怎么写、大概什么情况下引用哪张图片——但光靠手册还远远不够因为真实场景远比手册复杂。第二阶段叫做层次化覆盖折扣式强化学习英文缩写是HCD-GRPO。这是整个方法的精华所在需要多解释一些。强化学习本质上是一种奖惩机制让模型生成多个候选描述然后根据描述的质量打分得分高的方向就多往那里走。HCD-GRPO把评分体系设计成了两个相互配合的模块。第一个模块关注描述视频内容的质量。评分时系统会先把描述里所有的图片标签去掉得到一段纯文字描述然后从六个维度来检查它描述得是否准确完整主体视频里有什么人或物、外观他们穿什么戴什么、动作在做什么、背景场景是哪里、镜头运动摄像机是怎么运动的以及视觉风格画面的整体感觉。每个维度下有具体的考核点系统会给每个点打0分、0.5分或1分。与此同时系统还会用一批预先准备好的问答题来检验描述有没有包含错误信息——如果描述里出现了视频里根本没有的内容就会被扣分。这种覆盖越多得分越高但包含错误信息就要折扣的设计让模型在追求完整性的同时不敢随意捏造。第二个模块关注图片标签使用的质量包含三个子机制。其一是正确绑定覆盖率——只有当一张照片被选用且被贴到了描述里正确的词语后面它才算作一个有效引用那些选了却贴错位置的照片不仅不加分还相当于白选了这防止了模型通过乱贴标签来刷高覆盖率。其二是干扰项感知抑制机制DAES——如果模型引用了一张在视频里根本找不到对应物的干扰图片就会受到明确惩罚。其三是跨图片语义一致性机制CRSC——如果有多张照片拍的是同一个主体模型必须把它们一起贴在同一个词语后面才能得到满分一旦把它们分散贴到不同词语上就会被扣分。把这两个模块合并起来打分就是HCD-GRPO的最终奖励信号。如果模型输出了格式错误的图片标签或者引用了根本不在参考池里的图片整个得分会被强制压低到一个很小的上限值防止模型走技术漏洞。---三、为了测试这套系统团队专门造了一个考卷——MRVBench在机器学习领域一个新任务想要被大家认可除了有解决方案还需要有一套公认的测试标准。为此研究团队构建了一个专门的评测基准叫做MRVBench。MRVBench包含462段测试视频其中185段是AI生成的动画或合成视频277段是真实拍摄的视频。配套的参考图片池共有3831张平均每段视频对应大约8张候选图片最多的情况下单个视频对应多达22张。此外评测集还包含2172个问答题用于检验模型是否准确理解了视频内容。大约60%的测试样本包含多张图片对应同一个主体的复杂映射情况约40%的样本大约185个混入了干扰项。所有462个测试样本完全独立于训练数据确保评测的公正性。评测维度也相当全面。KP-Cov衡量描述文字覆盖了多少人工标注的视频关键信息点VQA和VQA-Cov分别衡量描述是否支持正确回答视频相关问题以及覆盖了多少问题Ref-Tag-P和Ref-Tag-R衡量模型选用图片的精准率和召回率Ref-Bind衡量图片标签是否被贴到了正确的词语后面Eff-Bind是一个综合指标同时考察选对图片和贴对位置这两件事Dist-Rej衡量干扰图片被正确排除的比例FalseRef-Any衡量有多少测试样本里模型错误引用了至少一张干扰图片Subj-R和Subj-F1评估多张描述同一主体的图片是否被正确归组。所有模型的评测都由Gemini-3.1-Pro担任AI裁判对结构化输出进行评分确保评价标准的一致性。---四、实验结果RefCaptioner在同类开源模型中拔得头筹研究团队将RefCaptioner与一批代表性模型进行了横向比较既有闭源的商业系统包括Gemini-3.1-Pro和GPT-5.4也有大量开源模型包括InternVL3.5系列、Qwen3-VL系列、Qwen3.6系列、MiMo-VL、Keye-VL、ARC-Hunyuan-Video等。在MRVBench的综合得分MRVScore上RefCaptioner以0.888分位居所有开源模型之首与Gemini-3.1-Pro的0.897分仅差0.009分并明显超过GPT-5.4的0.870分。值得一提的是RefCaptioner是在8B参数规模的基础模型上训练而来的而它超越了那些参数规模大得多的模型比如38B的InternVL3.5、27B的Qwen3.6和32B的Qwen3-VL。具体到各个子指标情况更能说明问题。在参考图片的选取准确率Ref-Tag-P上RefCaptioner达到0.994接近满分在召回率Ref-Tag-R上达到0.943在所有模型中排名第一连Gemini-3.1-Pro0.938都略低于它。在图片与词语的绑定准确率Ref-Bind上达到0.967仅次于GPT-5.4的0.986但超过了Gemini-3.1-Pro的0.976。在干扰图片排除率Dist-Rej上达到0.985超过了Gemini-3.1-Pro的0.978和GPT-5.4的0.993中的前者。在多图对应同一主体的一致性指标上Subj-R和Subj-F1RefCaptioner分别以0.817和0.869超过了Gemini-3.1-Pro0.799和0.844和GPT-5.40.609和0.718表现最为突出。这些数字背后的故事是RefCaptioner在选准图片、贴对位置、排除干扰、归组一致这四件事上达到了一个相当均衡的高水平而不是某一方面特别突出、另一方面明显短板。---五、事后打补丁为什么不如从头学好研究团队还做了一个很有说服力的对比实验专门回答一个直觉上合理的问题既然现有的大模型已经能很好地描述视频何不直接让它先生成普通描述然后再过一遍把图片标签插进去这种两步走的方案省去了专门训练的麻烦听起来也挺有道理。为了检验这种方案是否可行团队让Qwen3-VL-8B、Qwen3-VL-32B、InternVL3.5-8B、InternVL3.5-38B各自先生成一段普通视频描述再基于原始视频和参考图片对描述进行修订、插入图片标签最后把修订后的描述拿来评测。结果表明两步走方案确实能在第一步积累一定的视频内容覆盖优势——比如Qwen3-VL-32B在这条路上得到了最高的KP-Cov分数0.911甚至超过了RefCaptioner的0.882。但一旦看图片标签的使用质量差距就非常明显了RefCaptioner在Ref-Tag-R0.943对0.869、Ref-Bind0.967对0.840、Subj-R0.817对0.638和Subj-F10.869对0.707上全面领先于表现最好的两步走方案。这个结果说明事后往描述里插图片标签能把标签塞进去却很难让标签落在正确的位置上更难让多张描述同一主体的图片被一致地归在同一个词语后面。图片选取和词语绑定需要在生成描述的过程中同步进行而不是作为后期修订来完成。---六、不忘本行普通视频描述能力没有退步专门为一项特定任务训练模型往往会有一个让人担心的代价模型可能在新任务上表现得好但在原本就擅长的事情上退步了。就像一个原本全科优秀的学生为了冲击某一科的满分而荒废了其他科目。研究团队特别在VDC和VCapsBench这两个专门评测普通视频描述质量的基准上做了测试结果令人放心。在VDC的五个维度摄像机动作、短片描述、背景、主要物体、详细描述上RefCaptioner在所有开源模型中均排名第一最显著的提升出现在背景73.23、主要物体73.50和详细描述70.11三个维度相比基础模型Qwen3-VL-8B-Instruct提升了5到6个百分点。在VCapsBench上RefCaptioner的回答率AR达到66.13覆盖率CR达到76.39均为同类8B规模开源模型中最高。这表明多参考图像的训练不仅没有削弱模型描述视频内容的能力反而通过更精细的局部绑定训练让模型对主体、外观、背景等细节的感知更加敏锐。---七、参考图片越多越难——RefCaptioner的鲁棒性测试参考图片的数量越多任务难度就越高——不仅因为要处理的信息量更大还因为干扰项更多、主体关系更复杂。研究团队把测试样本按照参考图片数量分为四组2到4张、5到8张、9到12张、13张以上分别计算正确召回率×绑定准确率×干扰排除率三项相乘得到的综合鲁棒性分数。在最简单的2到4张组RefCaptioner得到0.963而GPT-5.4得0.922Qwen3.6-35B-A3B得0.879。随着图片数量增加所有模型的分数都有所下降但RefCaptioner下降得最慢。在最难的13张以上组RefCaptioner仍有0.769GPT-5.4降到0.703而Qwen3.6-35B-A3B则大幅滑落到0.398——几乎只有RefCaptioner的一半。这说明RefCaptioner面对复杂多参考场景时能够保持相当稳定的性能而其他模型在参考图片数量上升后会出现较为明显的质量下降。---八、当AI生成的描述被用来重建视频效果如何研究的最后一个维度评估了一个很实际的应用场景把AI生成的带图片引用的描述直接拿去驱动视频生成模型看生成的视频和原始视频有多像。这相当于用语言图片来重建视频考察的是描述的实际可用性。研究团队分别使用了Wan 2.1 VACE和Seedance 2.0两款视频生成工具进行重建实验控制生成参数完全相同唯一的变量是每个模型自己生成的描述文字和它所引用的参考图片子集。三位受过训练的评价者对重建结果进行盲测用好/相当/差三档来评价RefCaptioner的重建效果相比其他模型是否更接近原始视频。结果是与Qwen3.6-35B-A3B相比76%的评价者认为RefCaptioner的重建更好仅14%认为更差与InternVL3.5-38B相比64%认为RefCaptioner更好与Qwen3.6-27B相比60%认为RefCaptioner更好。即便与商业闭源系统相比RefCaptioner在对抗Gemini-3.1-Pro时有26%的评价者认为它更好在对抗GPT-5.4时有30%认为它更好——考虑到这两个都是商业顶尖系统而RefCaptioner是在8B参数的开源基础上训练的这个结果相当有分量。---九、消融实验每个设计决策都有其不可替代的作用为了验证每一个训练组件是否真的必要研究团队做了系统性的消融实验——也就是每次去掉一个模块看性能有什么变化。从基础模型直接做第一阶段的监督微调相比不做微调的原始模型主体一致性召回率Subj-R从0.471大幅提升到0.702但视频问答准确率VQA从0.670略降到0.642。这说明第一阶段训练确实大幅改善了图片引用能力但略微削弱了普通视频理解能力。加入第二阶段的HCD-GRPO后全部三个核心指标都到达最优VQA恢复并超越到0.686干扰排除率Dist-Rej升到0.985主体召回率Subj-R升到0.817。然后逐一去掉三个奖励子模块去掉事实描述奖励VQA降幅最大降到0.642去掉干扰抑制机制DAESDist-Rej下降最明显降到0.914去掉跨图片一致性机制CRSCSubj-R有所下降降到0.778。三个子模块各有侧重缺少任何一个都会在对应维度出现明显缺口证明它们各司其职、缺一不可。---十、人类评价专业标注者用排名投票给出了答案除了自动化指标研究团队还邀请了三位具有相关专业背景的研究生作为人类评价者从MRVBench中随机抽取40段视频20段AI生成20段真实拍摄让评价者在看完视频和参考图片后对来自GPT-5.4、Gemini-3.1-Pro、Qwen3.6-35B-A3B、Qwen3-VL-8B-Instruct和RefCaptioner这五个模型的描述进行盲测排名同时评判每个模型的图片绑定是否正确。在偏好排名上1分最好5分最差RefCaptioner获得了1.75的平均排名是所有五个模型中最低即最受偏好的明显优于Qwen3.6-35B-A3B2.48和Qwen3-VL-8B-Instruct4.10也超过了Gemini-3.1-Pro2.02和GPT-5.44.65。在图片绑定正确率上RefCaptioner达到0.99与Gemini-3.1-Pro和GPT-5.4的1.00接近但明显高于Qwen3.6-35B-A3B0.96和Qwen3-VL-8B-Instruct0.93。一个有趣的现象是五个模型的绑定准确率都相当高都在0.93以上但偏好排名却差异悬殊。这说明仅仅图片标签插得准确还不够描述本身的表达结构和内容组织方式同样深刻影响着人们的阅读体验。研究团队解释说他们刻意将训练描述组织成六个维度主体、外观、动作、背景、视觉风格、镜头运动引导模型以符合人类阅读习惯的方式展开描述这让RefCaptioner的输出更接近人类在描述视频时自然使用的表达逻辑。---归根结底这项研究解决的是一个听起来很具体、但实际上非常基础的问题AI在描述一段视频时能不能同时指出我说的这个东西对应你手里的哪张图片。现有的模型虽然能把视频讲得头头是道却很难精准地把话语和图片对上号尤其是在图片数量多、存在干扰项、同一主体有多个参考图的情况下。RefCaptioner通过两阶段训练的组合拳——先用混合数据打好基础格式再用设计精巧的多维奖励机制精雕细琢——在同等规模的开源模型中达到了目前最好的水平甚至在部分关键指标上超过了那些体量大得多的商业模型。更重要的是这种能力的获得没有以牺牲普通视频描述质量为代价模型在原本就擅长的事情上反而做得更好了。对于关心视频内容理解、视频编辑、视频生成的研究者和从业者来说这项工作提供了一个可以直接参考和复用的技术路径。评测基准MRVBench也已经公开为这个新兴方向的后续研究提供了一把公认的量尺。---QAQ1RefCaptioner和普通视频描述模型的主要区别是什么A普通视频描述模型只能生成文字描述不会明确指出描述里的某个词对应哪张参考图片。RefCaptioner的核心能力在于它能在生成描述时同时在每个词语后面贴上对应的图片标签还能识别哪些图片是干扰项而不予引用以及把描述同一主体的多张图片归并到同一个位置标注是一种带图片定位功能的视频描述模型。Q2MRVBench评测基准会对外公开吗A根据论文说明研究团队计划公开MRVBench的测试集及其评测标注供学术研究使用但数据的发布范围取决于各数据来源的许可协议。训练语料库因涉及多来源版权问题不会公开但测试集会在符合数据授权的前提下对外发布供其他研究者用来评测自己的模型。Q3HCD-GRPO中的三个奖励模块分别起什么作用A三个模块各管一个方向事实描述奖励负责保证描述文字本身的准确性和完整性防止模型捏造视频里没有的内容干扰项感知抑制机制DAES专门惩罚引用了视频里根本不存在对应物的图片这一行为跨图片语义一致性机制CRSC则专门针对多张照片描述同一个主体的情况要求模型把它们统一贴在同一个词语后面。三者分工明确缺少任何一个都会在对应维度出现显著的性能下滑。