这套“世界模型考试“,终于把AI视频生成的真实水平测了个底朝天

📅 2026/8/12 9:48:44
这套“世界模型考试“,终于把AI视频生成的真实水平测了个底朝天
这项由中国科学院自动化研究所CASIA联合香港中文大学CUHK、上海人工智能实验室SLAI、高德地图AMAP及清华大学THU共同完成的研究于2026年8月以预印本形式公开发布论文编号为arXiv:2608.02603。感兴趣的读者可通过该编号在arXiv平台查阅完整原文。**研究背景为什么给AI视频生成打分这么难**考虑这样一个场景你在玩一款电子游戏操控一个角色走向一段楼梯。一个真正理解世界的游戏引擎会让角色的脚步随台阶高低起伏一个只懂皮毛的引擎则可能让角色像幽灵一样直接飘过楼梯双脚悬空。这两种游戏你一眼就能分出好坏。然而现在的AI视频生成模型评测体系长期停留在画面好不好看和角色有没有按指令动的层面根本没有追问那个更关键的问题**这个AI生成的世界真的会对周遭环境做出合理反应吗**这正是这支研究团队想要解决的问题。他们开发了一套名为**WorldExam**的评测基准把视频世界模型的能力层层拆解从表面画质一直追问到深层的世界反应性——也就是说当AI生成的角色靠近障碍物时障碍物会动吗当它撞上别人时对方会让路吗当不稳定的物体失去支撑时它会掉下来吗**一、什么是世界模型为什么它和普通视频生成不一样**普通的AI视频生成就像一台高级打印机你描述一个场景它给你生成一段符合描述的视频追求的是看起来像真的。而世界模型追求的是更高一层的目标它需要像一个微型物理世界一样运转能够根据当前状态推断出接下来应该发生什么而不仅仅是画出指令要求的内容。打个比方一台普通视频生成AI像是一位经验丰富的摄影师你说要拍什么他就拍什么画面精美构图讲究。而世界模型则更像一位导演兼物理学家——他不仅要拍出你要求的场景还要确保场景中每一个物体的行为符合物理规律每一个路人的反应符合社会常识每一块地形都会对角色的运动产生真实影响。目前这类模型主要分三种。**摄像机驱动型**模型接受摄像机的运动轨迹作为指令本质上是在控制观察世界的视角如何移动。**动作驱动型**模型接受类似电子游戏键盘的操作指令W前进、S后退、A左移、D右移等直接控制场景中的角色动作。**语言驱动型**模型则接受自然语言描述你用文字说角色向前走然后右转它就生成对应视频。三种类型的模型各有所长但也各有短板WorldExam的一个重要贡献就是用统一的框架把这三种类型放在同一张考卷上进行比较。**二、WorldExam是一张怎样的考卷四个难度层级**WorldExam的设计逻辑就像学校里的分层次考试从最基础的写字工整吗逐步升级到能解应用题吗再到能解开放式大题吗。整套基准共包含1474道测试题横跨八项专项任务形成四个由浅入深的诊断层级。**第一层是视觉质量Visual Quality**考察的是最基础的画面好不好看。这里涉及六项通用指标画面前后颜色是否一致照度一致性、画面是否有闪烁抖动时序稳定性、主体形象是否保持连贯主体一致性、整体美感如何美学质量、动作是否流畅运动平滑度以及基本的成像质量。这一层是所有模型的入门考做得不好的模型直接暴露了生成能力的基线缺陷。**第二层是控制遵从性Control Adherence**考察的是模型能不能按指令动。这里分为两项任务。摄像机控制测试摄像机运动是否真的按照指令描述的方向和时间比例执行主体控制则测试场景中的指定角色能否按照给定的方向序列运动。这一层相当于考察执行力——指挥官下达命令士兵是否准确执行。**第三层是空间一致性Spatial Consistency**考察的是模型有没有空间记忆。通过场景重访任务实现让摄像机先往某个方向运动然后原路返回看最终画面是否和一开始的初始帧保持一致。这就像你在一个房间里先向左走再向右走回原位——如果你是真正理解这个空间的你看到的应该和出发时一样。而如果模型只是在编造视频往往在返回时会生成截然不同的场景就像一个路痴从原路返回却发现街道全变了。**第四层是世界反应性World Reactivity**这是整张考卷最难的部分也是WorldExam最核心的创新所在。这一层要测试的是模型在没有被明确告知应该发生什么的情况下能否根据初始场景自动推断出合理的连锁反应。**三、世界反应性这道大题究竟怎么考**世界反应性这一层共设五项任务每项任务的设计都遵循同一个原则指令只告诉模型做什么动作但绝口不提环境应该如何响应。**地形交互Terrain Interaction**场景中有楼梯、斜坡、沟渠或桥梁等地形指令只说向前走但从未提到你要上台阶了脚要抬高。评测的是模型能否自动推断出角色在不平坦地形上的正确高度变化和身体姿态调整。一个好的世界模型角色脚踩台阶时应该一步一步抬脚一个只看表面的模型角色可能会浮空漂过去像没有重力一样。**物体交互Object Interaction**场景中放置了一个可以被撞动的物体指令只说向前走但从未说撞上那个物体会发生什么。评测的是接触发生后物体的反应是否符合其物理属性——松散的物体应该被推动柔软的物体应该变形坚硬固定的物体应该阻挡主体。最糟糕的情况是主体像幽灵一样穿过物体或者物体完全无动于衷。**社会交互Social Interaction**场景中有其他行人或智能体当主体移动到他们附近时这些路人应该如何反应指令只控制主体的运动从不说明周围的人要怎么应对。评测的是这些背景角色能否做出合理的回避、礼让或停步等社交反应。如果路人对一辆径直开来的车毫无反应继续若无其事地走进车轮那说明这个世界根本不活。**物理反应Physical Reaction**这项任务测试的是一个纯粹由物理规律驱动的过程例如一个重心超出支撑面的篮子开始缓慢倾倒、最终落地或者一个被推动的物体在惯性作用下继续滑行。某些情况下指令甚至是停止?意思是主体完全静止让物理过程自行演化。评测的是引力、摩擦力、动量、弹性等物理规律是否真实地体现在画面中。**目标完成Goal Completion**这是唯一只面向语言驱动型模型的任务也是整套考卷概念层次最高的一项。给定一个高层次目标例如用螺丝刀松开蓝色玩具车的电池仓螺丝场景中摆放了蓝色玩具车、红色玩具车、螺丝刀还有一枚硬币作为干扰物。模型需要自己判断应该拿起螺丝刀而不是硬币应该操作蓝色玩具车而不是红色的应该对准电池仓的螺丝位置……整个执行过程的每一步都由模型自行推断而不是由指令逐帧指定。这考察的是一种类似理解意图、自主规划、正确执行的综合能力。**四、1474道题是怎么设计出来的**WorldExam的题目设计分两条路线。针对摄像机控制和场景重访这类静态场景任务研究团队直接从已有的真实场景数据集中挑选合适的第一人称视角图像然后搭配精心编排的摄像机运动指令组合。针对主体控制和五项世界反应性任务这类动态交互任务则启动了一个更精密的流水线。首先研究团队为每项任务建立了一个情景模式库例如地形交互任务中包含了楼梯占29%、地下通道16%、平台15.5%、台阶块15%、斜坡10%等多种地形类型物体交互任务中包含了门/闸门24%、标识牌/锥桶13%、容器12%、墙体12%等各类物体。从模式库中抽取一个具体情景后一个由大语言模型驱动的结构化案例生成器会将其扩展为完整的场景描述草稿包括详细的场景文字描述、用于生成初始帧图像的提示词、主体控制指令以及一份用于最终评测的核查清单草稿。接下来用图像生成模型批量生成N张候选初始帧再由人工筛选。筛选标准非常具体关键物体必须清晰可见、空间布局必须支持预设行为的发生、图像内容必须与场景描述一致、并且场景中必须留有足够的运动空间。已经提前展示了最终结果例如物体已经倒地、关键实体被遮挡、或者物理上根本无法完成预设动作的图像都会被淘汰。最终选定的初始帧图像会送入图像条件案例精炼器对场景描述、语言提示词和核查清单进行细化确保所有描述都与实际图像中的实体和空间关系精确对应。这套流程确保了每一道题目都是可解的同时又不会在题目本身中泄露答案。**五、评分是怎么做的从3D重建到AI阅卷**WorldExam的评分体系同样分层设计不同任务用不同的评分方式但整体逻辑就像一个多学科联合阅卷小组。针对摄像机控制、场景重访、主体控制和地形交互这四项任务研究团队采用了一种颇具创意的方法把生成的视频立体化。具体来说他们用一个名为VGGT-Ω的几何重建模型从每帧画面中估算出摄像机的位置、姿态和场景深度信息相当于把二维视频还原成一个三维空间然后在三维空间里对轨迹进行精确的数学分析。摄像机控制的评分是把从视频中还原出来的摄像机运动轨迹与指令要求的理想轨迹进行比对分别计算平移误差和旋转误差。为了公平处理不同类型模型的差异研究团队还设计了一套图像空间位移对齐机制——因为相同的数值指令在不同模型中可能触发完全不同幅度的画面变化就像同样踩下油门不同马力的车会产生完全不同的加速度直接比较数值误差并不公平。解决方法是先给每个摄像机驱动型模型做一次标定测试测量它在默认输入下能产生多大的画面位移然后据此缩放输入指令让所有模型生成的画面位移量处于同一基准线上再进行比较。场景重访的评分更有意思在摄像机执行完往返运动之后从返回段中选取与初始摄像机姿态最接近的那一帧与初始帧进行图像质量比较用PSNR峰值信噪比、LPIPS感知相似度和SSIM结构相似性三个指标衡量画面的保真度再结合是否真的回到了初始视角这个二元判断综合给出最终分数。主体控制的评分则是用SAM2这个图像追踪工具从初始帧的主体掩码出发全程追踪主体的运动轨迹再用VGGT-Ω将这条追踪轨迹从二维像素坐标还原到三维世界空间最后评估三维轨迹是否符合指令要求的运动方向。地形交互的评分有一个巧妙设计除了生成视频用的初始帧之外研究团队还额外提供了一张无主体的地形图——就是把角色从场景里抹掉让3D重建算法能够看清完整的地形几何形状。这样就能精确地把主体的三维运动轨迹投影到地形表面上逐点比较主体高度和地形高度的变化是否吻合。至于物体交互、社会交互、物理反应和目标完成这四项任务涉及的是语义理解和因果判断无法用轨迹误差来量化因此改用GPT-5.5作为AI阅卷老师对照案例专属核查清单逐条评判。每张核查清单通常包含6到8个可观察的具体条目例如篮子是否从洗衣机上倒下而非滑回原位、物体的运动是否从支撑点附近开始倾斜等。AI老师从视频中均匀采样10帧逐条给出满足或不满足的判断任何模糊、不可见或画面外的情况都算不满足最终得分是满足条目数占总条目数的比例。为了验证AI阅卷的可靠性研究团队专门做了人工评测对照实验在800个评测样例上由三名人类标注员独立打分以多数票决定参考答案再与AI老师的分数进行相关性分析。结果显示在所有800个样例上AI老师与人类评分的斯皮尔曼相关系数达到0.8614皮尔逊相关系数达到0.8583属于强相关说明这套AI阅卷机制是可靠的。**六、20个模型上考场结果如何**研究团队共评测了20个代表性视频世界模型其中6个摄像机驱动型、7个动作驱动型、7个语言驱动型包括NeoVerse、InSpatio-World、WorldPlay、LingBot-World、Veo 3.1、Hailuo 2.3、Vidu Q3等业界知名模型。在摄像机控制这道题上摄像机驱动型模型的优势非常明显。其中NeoVerse以97.33的高分领跑InSpatio-World以85.94紧随其后这两个模型的共同特点是都采用了3D重建后重新投影的生成策略——先从初始图像重建出三维结构再把新的摄像机视角渲染出来因此摄像机轨迹的控制精度极高。反观采用将摄像机姿态编码成向量输入策略的ReCamMaster和FantasyWorld分数分别跌至38.64和18.46尽管这两个模型的画质评分依然很高。这说明画质好并不等于控制精确两者可以完全脱节。在动作驱动型模型中WorldPlay以92.74的成绩脱颖而出是该类型最强的选手。语言驱动型模型整体表现最弱最好的Hailuo 2.3只有63.29说明用自然语言来精确描述复杂的摄像机运动序列本身就存在相当大的信息损失。场景重访这道题上NeoVerse和InSpatio-World都实现了100%的返回成功率综合得分分别为89.25和85.90。WorldPlay在动作驱动型中表现最佳返回成功率79%综合分72.51。语言驱动型中最好的Hailuo 2.3返回成功率只有50.5%综合分48.70——意味着有近一半的时间模型让摄像机迷路了无法回到出发点。进入动态交互赛道后画风发生了明显转变。在主体控制这道题上动作驱动型模型的优势出现了LingBot-World以55.47拿到最高分WorldPlay得49.75而语言驱动型模型最好的Veo 3.1只有37.28。然而即便是动作驱动型模型的最高分离满分也还相差很远常见的失误是模型把主体控制指令错误地理解成了摄像机运动或者场景直接静止不动。地形交互这道题动作驱动型模型暴露出了一个关键问题从主体控制到地形交互分数出现了悬崖式下跌。WorldPlay的主体控制分是49.75但地形交互只有27.49LingBot-World从55.47跌到24.33。换句话说即便这些模型能让角色向前走它们也大多数时候不知道走在台阶上应该怎么走。而语言驱动型模型在这道题上反超了动作驱动型Vidu Q3得64.39Hailuo 2.3得61.57Seedance 1.5得53.83全面超过动作驱动型的最高分27.49。物体交互上Veo 3.1以75.96领跑Vidu Q3以71.59紧随而动作驱动型最好也只有33.75。语言驱动型模型在这道题上展现出了明显的理解力——它们似乎更懂得接触会产生什么后果。社会交互这道题的差距最为悬殊。Veo 3.1拿到了85.10的高分Vidu Q3拿到了81.91而动作驱动型最好的LingBot-World只有60.37。大量失败案例是路人完全无视走过来的主体或者主体直接穿过路人就像双方都是幽灵。物理反应这道题Hailuo 2.3以63.84拿到最高分Veo 3.1和Vidu Q3分别以61.76和61.23紧随动作驱动型最好的LingBot-World只有33.43。物理过程的自主演化对动作驱动型模型来说几乎是盲区。目标完成这道语言模型专属题HappyHorse 1.0和Veo 3.1以85.33和85.30并列第一表现出色。而Kling 2.5尽管在视觉质量上是语言驱动型模型中得分最高的目标完成分却只有48.25清晰印证了画面好看≠理解任务意图这一结论。研究团队还额外验证了评测系统对底层技术细节的鲁棒性用另一个深度估计模型DA3替换原本的几何重建工具重新跑了所有几何相关指标。结果显示所有模型在静态场景赛道的整体分数平均绝对变化只有3.09%在动态交互赛道只有0.57%模型排名基本保持不变。这说明评测结论不依赖某一个特定的底层工具具有相当的稳定性。**七、这套考试揭示了什么**通过这张覆盖四个层级、八项任务、三类接口的统一考卷一个清晰的格局浮现出来。摄像机驱动型模型是摄像机控制和场景空间记忆方面的绝对强者但它们的接口根本不支持角色动作控制在世界反应性测试上连上场的资格都没有。动作驱动型模型能较精确地控制角色运动但它们往往只是让角色动起来而无法让世界其他部分对这个动作做出响应——地形不配合、物体不反应、路人不让路、物理过程不展开。语言驱动型模型在理解和生成复杂的交互结果上表现最好能更好地处理场景条件反应但在执行复杂的精确运动控制时远不如前两类模型准确。更重要的是视觉质量高并不能预测世界反应性好。七个语言驱动型模型的视觉质量通用分数集中在79.64到81.04的极窄区间内但它们的任务综合分却从39.85到65.02大幅散开相差将近30分。这意味着用画质来评价世界模型就像用一份菜的摆盘精美程度来评价厨师的烹饪水平——有时候确实相关但根本不是核心能力的体现。归根结底这项研究的核心发现是当前没有任何一个模型能同时在所有任务上表现优秀三种接口类型各自擅长不同的事世界反应性这一核心能力在所有类型的模型中都有相当大的提升空间。让AI生成的世界真正活起来、真正会对外界刺激做出合理反应仍然是这个领域面临的重大未解难题。WorldExam的意义在于它第一次用一套严格统一的框架把这个差距清晰地量化和呈现了出来为后续研究者指明了需要努力的方向。QAQ1WorldExam评测基准和其他视频生成评测工具有什么区别AWorldExam最核心的区别在于它专门测试世界反应性——也就是AI生成的场景中环境有没有对角色的行为做出合理回应。现有的大多数评测工具主要看画面质量或指令是否被执行但不追问角色走到台阶上脚步有没有随台阶起伏撞上物体后物体有没有被推动这类更深层的问题。WorldExam设计了四个难度层级、八项专项任务并且统一覆盖了摄像机驱动、动作驱动和语言驱动三类模型是目前覆盖面最广、诊断层次最深的同类评测框架之一。Q2为什么语言驱动型模型在世界反应性任务上比动作驱动型模型表现更好A从WorldExam的实验结果来看语言驱动型模型在地形交互、物体交互、社会交互等任务上全面超过了动作驱动型模型。研究团队的分析认为语言驱动型模型在训练过程中接触了大量带有因果关系和物理常识描述的文本数据因此对接触会导致什么结果不稳定物体会如何运动有更多隐性的知识积累。而动作驱动型模型的训练目标更偏向于精确执行离散动作对场景中其他元素的联动响应关注较少导致角色虽然能按指令移动但周围的世界却无动于衷。Q3WorldExam评测中用AI自动打分准确吗和人类判断一致吗A研究团队对此进行了专项验证。在物体交互、社会交互、物理反应和目标完成这四项需要语义判断的任务中他们抽取了800个评测样例由三名人类标注员独立打分以多数票作为参考答案再与GPT-5.5的AI打分进行比较。结果显示两者的斯皮尔曼相关系数为0.8614皮尔逊相关系数为0.8583属于强相关水平。具体到各项任务目标完成任务的一致性最高0.8960社会交互任务相对最低0.7019但整体来看AI评分与人类判断的吻合度足以支撑可信的模型比较结论。