韩国世宗大学与NAVER Cloud揭开高分背后的惊天秘密

📅 2026/7/21 23:48:51
韩国世宗大学与NAVER Cloud揭开高分背后的惊天秘密
这项由韩国世宗大学与NAVER Cloud联合开展的研究以预印本论文形式发布于2026年7月论文编号为arXiv:2603.29616有兴趣深入了解的读者可通过该编号查询完整原文。假设你正在评估一个声称能读懂视频的AI系统它在各种测试中连连拿高分表现得像是真正理解了视频里发生的事情。但如果告诉你那些高分题目里有一大半根本不需要看视频就能答对——只需要靠猜测、靠听声音、或者靠看一张静止图片——你还会相信这个AI真的看懂视频了吗这正是这项研究的出发点。研究团队没有选择再做一个新的测试集这条路而是做了一件更有意思的事他们像一个侦探一样把现有的14套视频AI测试卷逐一翻出来仔细审查结果发现了令人惊讶的规律——超过一半的题目存在捷径AI完全可以绕过真正的视频理解来答题。研究团队将这套审查工具命名为Video-Oasis并用它对当前视频AI领域的评估体系做了一次彻底的体检。一、视频测试卷里藏着哪些作弊通道要理解这个问题先用一个考试的比喻来打底。假设你出了一道历史题1971年IBM推出了哪款打字机本来想考学生的历史知识但如果考卷旁边恰好放了一段介绍IBM打字机的视频视频里的旁白直接说出了答案那这道题考的根本不是历史理解而是有没有开着音量。视频AI的测试卷里类似的问题比比皆是。研究团队归纳出了四条主要的捷径通道。第一条是语言猜测。有些题目问的是键盘旁边哪个物体最近选项是碗、灯、砧板、鼠标——即便不看视频靠常识也很容易猜到答案是鼠标因为鼠标是最常和键盘放在一起的东西。AI不需要真正理解任何视频画面只需要调动语言模型里存储的常识就能答对。第二条是音频替代。有些视频里的旁白或对话直接包含了答案。比如问某款打字机首次发布是哪年视频音轨里恰好有人说这款机器于1971年首次亮相AI只需要把音频转成文字再找答案压根不需要理解任何画面。第三条是单帧够用。有些题目只要截取视频中间的一帧静止图片就足以回答。比如画面里天气怎么样——晴天、雨天一眼就能从一张图里看出来根本不需要看整段视频的动态变化。第四条是静态场景。有些视频内容本身就是一个静止的场景几乎没有任何时间上的变化比如对着一个固定的房间场景问壁炉在楼梯的哪个方向——这道题在任何一帧都能答完全不需要时间维度的理解。研究团队把能通过以上任何一条捷径答对的题目统称为捷径题。接下来的问题是现有的测试卷里到底有多少这样的捷径题二、一次横跨14套测试卷的大审查为了系统地找出捷径题研究团队设计了一套名为Video-Oasis的诊断工具它包含三类检查方式就像医院体检时会分别检查血液、影像和体能一样每类检查负责揭示不同类型的问题。第一类是视觉依赖检测。研究团队让AI在三种刻意削弱视觉信息的条件下作答完全不给任何视频或提示只给问题和选项也就是盲猜模式把视频的音轨转成文字再交给AI把视频按固定间隔截成若干帧为每帧生成文字说明然后把这些说明拼在一起代替视频。如果AI在任意一种条件下仍然能答对就说明这道题不需要真正的视觉感知。第二类是时间依赖检测。视频和图片最大的区别在于时间维度——视频是动态的、有先后顺序的。研究团队用三种方式破坏视频的时间结构只给视频正中间的那一帧把所有帧的顺序随机打乱用一个完全不理解时间顺序的图像匹配系统基于CLIP模型去找和问题最相关的几帧来作答。如果AI在任意一种时间被破坏的条件下仍然能答对就说明这道题不需要理解时间顺序。第三类是注释质量核查。因为视频数据量大、内容复杂很多测试卷在标注答案时本身就可能出错或者不够清晰。研究团队设计了三个检查一致性检查让五个不同的AI模型来回答如果五个模型给出五个不同的答案说明这道题本身就有歧义冗余检查把视频分成八段如果每一段都能答对说明这道题不依赖特定时间段的内容标注可能有问题敏感性人工核查对那些打乱帧顺序后仍答对的题目再由人工判断是否真的不需要时间顺序。为了确保诊断结论的可靠性整个审查流程融入了多模型共识机制——只有当多个AI模型都能在削弱条件下答对时这道题才被认定为捷径题并额外配有人工复核环节防止误判。审查的最终结果令人震惊。在横跨14套视频理解测试卷、总计24416道题的大规模审查中研究团队发现平均55%的题目是捷径题也就是说一多半的题不需要真正理解视频就能答对。在放宽认定标准只要有一个AI模型能绕路答对就算捷径时这个比例更是高达92.7%。更有意思的是研究团队还发现了一个规律一套测试卷里捷径题越多那套测试卷上的得分就越高。换句话说AI得高分很可能只是因为捷径题多而不是因为它真的看懂了视频。这就像考试成绩好并不一定是学生真的掌握了知识而可能是出题人不小心出了太多送分题。三、去掉捷径之后AI的真实水平如何去掉了那55%的捷径题之后剩下的11033道题组成了Video-Oasis筛选出的真正挑战集。这些题涵盖了4938段独特视频从几秒钟的短片到超过十分钟的长视频都有而且都经过了严格的多重验证确实需要对视频画面和时间顺序有深入理解才能作答。研究团队把这些真正的挑战分成了五个类别每个类别代表一种视频理解的核心能力。第一类是细粒度感知考察AI能否在时间和空间维度上识别细微的视觉变化比如跟踪一个物体在多个角度下的外观或者辨认视觉上相似但有细微差别的场景。第二类是空间世界理解考察AI能否从多个视角合成出对三维空间的认知比如推断物体之间的相对位置和几何关系。第三类是时间动态与追踪考察AI能否追踪物体随时间的运动、识别动作序列、理解状态转变这正是视频理解区别于图片理解的核心所在。第四类是因果与逻辑推理考察AI能否推断出不直接出现在画面里的隐含原因和意图比如从一系列事件中推断为什么某件事会发生。第五类是全局叙事理解考察AI能否把散布在整段视频各处的片段信息整合起来理解跨越较长时间跨度的故事走向。接下来研究团队用这套真正的挑战集对目前市面上最顶尖的AI系统展开了全面测评。结果又一次令人大开眼界。在标准4选1的题目里随机猜测的正确率约为25.6%。测试结果显示大部分开源视频AI模型的得分只比随机猜测略高一点点比如Qwen2.5-VL拿到29.2分Video-R1拿到26.3分LongViLA-R1拿到28.6分——和蒙着眼睛乱猜几乎没有本质区别。就连来自谷歌、普遍被认为是当前最强大的多模态AI系统Gemini-2.5-Pro总分也只有46.7分距离满分还差得很远。在全局叙事理解这个最难的类别上几乎所有模型都跌到了20%出头某些模型甚至不如随机猜测。这个结果非常直白地说明了一件事当前的视频AI系统在面对真正需要理解时间和空间的视频问题时基本上还处于懵逼状态。那些在原有测试集上看起来很漂亮的高分有相当大的水分。四、什么样的设计能让AI看得更准既然找到了问题研究团队也顺势做了一系列实验探索哪些技术设计能让AI在这些真正的挑战上表现得更好结论颇为实用。第一个实验探讨的是精准定位的价值。在回答视频问题时如果AI能精准地找到视频中与问题最相关的片段而不是机械地扫描整段视频是否会有帮助研究团队引入了一种叫做AKS自适应关键帧采样的方法让AI先根据问题挑选出最相关的16帧再作答。结果显示加入这个精准定位步骤后AI的总体表现确实有所提升Eagle2.5从31.5%升至32.9%Qwen3-VL从27.8%升至30.1%。但提升的幅度并不大。为了搞清楚这点提升是不是已经到了天花板研究团队进行了一个上限实验给AI直接提供视频中包含答案的确切时间段也就是人工打了时间标记的那部分看看在完美定位的情况下AI能达到多高的分数。结果非常明显——在真正挑战集上完美定位让Eagle2.5的得分从35%大幅跳升到50.8%而在捷径题上同样的完美定位带来的提升却很小从78%只升到80.8%。这证明了一个重要结论精准的时间定位对于真正需要视频理解的问题来说至关重要但对于捷径题意义不大因为那些题本来就不需要找特定的时间段。换句话说捷径题随便定位也能对但真正的挑战题差一秒都可能答错。第二个实验探讨的是思考深度的灵活性。当前一些顶尖AI模型具有两种工作模式一种是快速回答模式直接给出答案另一种是深度思考模式会先在内部进行大量的推理再给出答案。研究团队对比了Qwen3-VL在快速模式33.8分、深度思考模式34.6分以及一种自适应切换模式VideoAuto-R136.8分下的表现。自适应切换模式的意思是AI会根据问题的难度自己决定要不要深入思考而不是对所有问题都用同一深度的思考。结果显示这种灵活切换的方式比固定用深度思考的方式表现更好说明并不是越深入思考就越好而是要用对地方。更有趣的是研究团队做了一个理想化实验如果AI每道题都能在快速模式和深度思考模式之中选择更好的那个答案得分会是多少答案是46.2分几乎和当前最强的Gemini-2.5-Pro46.7分持平。这意味着仅仅通过更聪明地决定什么时候该认真想想什么时候直接回答一个8B参数的小模型就能比肩目前最顶级的商业闭源大模型——这一发现揭示了一个巨大的优化空间而且这个优化不需要更大的模型只需要更聪明的思考策略。第三个实验比较了两种主流训练方式的优劣。一种是监督微调也就是给AI喂大量标准答案让它学习这就像传统的填鸭式教育另一种是强化学习让AI通过不断尝试和获得反馈来自我改进更像是通过实战练习来提高。以Qwen2.5-VL为基础模型监督微调训练出的Eagle2.5拿到了34.5分而只用基本问答奖励训练的Video-R1只拿到26.3分甚至比未经训练的基础模型29.2分还要差。这说明强化学习的效果好不好关键取决于奖励机制怎么设计。而加入了时间定位专项奖励的VideoAuto-R1达到了32.7分介于两者之间同时在全局叙事理解这个最难的维度上表现特别突出从21.2%大幅提升到28.6%。这组对比揭示了一个微妙但重要的结论监督微调和强化学习并不是非此即彼的竞争关系而是各有擅长的互补关系。精心设计的长上下文监督微调能显著提升整体的时空推理能力而带有定位奖励的强化学习则对提升需要整合长段视频信息的全局叙事理解特别有效。五、这套工具本身是否可靠面对一套新的诊断工具自然会有一个合理的疑问Video-Oasis判定的捷径题真的是AI能绕过视频理解来答的题吗还是说它错误地把一些恰好比较简单但仍需视觉理解的题归入了捷径研究团队对此进行了专门的验证。他们用和诊断时不同的AI模型InternVL-3.5、LongViLA-R1、STAR对被判定为捷径的题目进行标准模式下的重新测试发现这些题目的平均正确率高达76%远高于随机猜测的25.6%。这说明捷径题确实是AI用正常方式也很容易答对的题Video-Oasis的判断是有效的。此外研究团队还验证了Video-Oasis筛出的真正挑战集是否仅仅是难题集。他们找出了让三个顶尖模型全部答错的题目共6609道和Video-Oasis筛出的挑战集做对比发现两者只有44.6%的重叠。这意味着Video-Oasis并不只是在挑难题而是在用视觉依赖性和时间依赖性这两个专属于视频理解的维度来筛选这和单纯的难度筛选是不同的标准也更有针对性。为了保证诊断结果不依赖于特定模型的偏好研究团队还用多种不同的模型组合重复了整个诊断过程发现不同模型组合得出的捷径集重叠度均超过87%说明Video-Oasis的判断结论具有较强的稳健性不因选用哪几个模型而发生根本性变化。六、审查过程中还发现了什么意外收获在整个审查过程中研究团队的人工核查环节发现了一些有趣的边界案例值得单独说一说。有一类案例是被错误筛出的时间题。某些题目在打乱帧顺序后AI仍然答对按照自动化的诊断逻辑这应该算捷径题但人工审查后发现这些题其实需要时间顺序比如棒球裁判投出第二球之后做了什么——第二球之后这个时序关系显然要求视频是按顺序播放的AI答对可能只是碰巧并不代表这题不需要时间理解。这类题被人工从捷径集中移回了挑战集。另一类案例是真正的标注错误。比如有道题问视频中person fixes their hair这个动作发生在什么时候标注的答案是贯穿整段视频但实际上这个动作只出现在视频中段。还有些题目里用到了棕色头发的男人这个指代但画面里实际上有多个棕色头发的男人根本无法确定是哪一个——这类歧义导致这道题从任何角度都无法可靠地给出正确答案属于标注质量问题。这些案例被彻底从测试集中剔除避免污染评估结果。这些发现说明视频数据的复杂性使得标注工作本身就比图片或文本标注难得多当前许多测试集在标注质量上存在不可忽视的隐患而Video-Oasis的人工核查环节正是专门用来捕捉这类问题的。说到底这项研究的核心贡献并不是提出了一个更难的视频测试题库而是提供了一面照妖镜专门用来照出视频AI是否真的理解视频这个问题的真实答案。过去我们以为AI在视频测试上拿到高分意味着它真的学会了看视频但这面镜子告诉我们高分背后很可能藏着大量可以绕路走的捷径真正需要理解时间和空间的问题当前最好的AI系统也只比瞎猜强一点点。这对普通用户意味着什么如果你正在考虑使用某个视频理解AI工具光看它在基准测试上的得分是不够的因为那些分数可能被虚高了。Video-Oasis这套工具是完全开源的任何人都可以拿来检验自己感兴趣的AI系统在去掉捷径之后的真实水平。对整个AI研究领域而言这项研究指出了一个清晰的努力方向下一代视频AI需要真正掌握时间信息能精准定位视频中与问题相关的关键片段还要学会根据问题难度灵活调整自己的思考深度。强化学习的奖励机制设计和长上下文监督训练的结合则是目前最有潜力的技术路径。如果这些问题让你对视频AI的现状和未来产生了兴趣不妨思考这样一个问题在你日常生活中使用过的视频相关AI功能里哪些可能只是看起来很懂视频哪些才是真正在理解视频内容这个问题的答案可能比你预想的更复杂。感兴趣的读者可以通过arXiv:2603.29616查阅完整原文深入了解研究团队的所有实验细节和数据。---QAQ1Video-Oasis是用来做什么的AVideo-Oasis是由韩国世宗大学与NAVER Cloud开发的一套视频AI评估诊断工具专门用来检测现有视频理解测试集里是否存在捷径题也就是那些不需要真正理解视频就能答对的题目。通过三类检查视觉依赖、时间依赖、注释质量它能把测试集里的注水题过滤掉只保留真正需要视频理解能力才能作答的题目。Q2为什么视频AI在基准测试上得高分但实际能力却很有限A因为现有的视频测试集里大约有55%的题目存在捷径AI可以靠常识猜测、音频内容或静止图片来答对这些题根本不需要理解视频的时间动态。这导致测试分数虚高掩盖了AI在真正时空理解上的短板。Video-Oasis去掉这些捷径题后连最强的Gemini-2.5-Pro总分也只有46.7分大多数开源模型只比随机猜测略高。Q3什么样的训练方式能提升视频AI的真正理解能力A研究发现监督微调和强化学习各有优势结合使用效果更好。加入时间定位专项奖励的强化学习对提升全局叙事理解特别有效而精心设计的长上下文监督微调能提升整体时空推理表现。此外让AI灵活决定什么时候深入思考比固定使用深度思考模式效果更好这一策略让小模型的得分接近顶级商业大模型的水平。