ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language ...

📅 2026/8/22 13:28:17
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language ...
文章主要内容与创新点总结一、主要内容研究背景:多模态大型语言模型(MLLMs)在复杂视频推理场景中常出现错误,但现有基准缺乏对模型识别和纠正这些错误能力的系统性评估,亟需专门的评测工具与优化方案。ViRectify基准构建:涵盖三大视频推理领域(动态感知、科学推理、具身决策),整合7个多样化数据集,确保泛化性与适用性。通过AI辅助标注+人工验证的流程,构建含3万+实例的数据集,包含两种错误来源(专有模型注入错误、8个不同规模MLLMs的自然错误),覆盖4类错误类型(问题误解、幻觉、逻辑错误、视觉感知错误)。数据集特点:支持细粒度错误识别与追踪(标注每个推理步骤的正确性、构建错误传播图)、要求基于视频证据的错误纠正(关联关键时间戳生成有理据的修正方案)。轨迹证据驱动的纠正框架:两阶段训练范式:第一阶段通过监督微调(SFT)结合图基损失,引导模型学习错误轨迹的结构依赖;第二阶段基于GRPO强化学习,引入时间对齐、答案准确性、格式一致性的复合奖励函数,提升模型对视频关键片段的利用能力。实验与分析:对16个先进MLLMs(含4个专有模型、12个开源模型)进行评测,发现即使最优的GPT-5纠正准确率仅31.94%,开源模型与专有模型存在显著性能差距。