字节:PRISM提升多模态指令遵循 📅 2026/8/16 23:59:03 标题PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis来源arXiv, 2608.05249v1️文章简介研究问题如何让多模态大模型有效理解并执行包含多重优先级规则的复杂指令而非仅回答单一问题主要贡献论文提出PRISM数据合成框架及评估协议通过结构化评分标准监督显著提升模型对多规则、优先级感知指令的理解能力。重点思路定义评分标准理解任务将模型角色从生成者转变为执行者输入图像和结构化、带优先级的评分标准要求模型逐条验证规则并给出总体判断。构建PRISM四阶段数据合成流水线首先基于图像意图发现人物角色与任务其次利用前缀引导生成包含感知、推理等五类及三种优先级的规则集接着通过多维质量评估筛选高质量数据最后生成包含视觉 grounding、逐条验证及聚合结论的结构化响应轨迹。设计无裁判评估协议PRISM-Eval引入宽松和严格两种准确率指标通过确定性匹配固定标签进行评估无需在推理时调用外部裁判模型确保评估的高效性与客观性。分析总结显著提升特定能力仅在1万条合成数据上进行微调Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%大幅提升至30.1%且该增益可迁移至不同架构的其他开源模型。保持通用性能在提升评分标准理解能力的同时模型在MMBench、OCRBench等14个通用基准测试上的平均性能保持不变甚至略有提升证明该方法未损害通用能力。关键组件有效性消融实验表明移除优先级标注会导致严格准确率大幅下降证明语义优先级结构至关重要而移除结构化思维链则影响通用基准表现说明两者互补。超越推理时策略相比零样本或顺序查询等无需训练的推理策略PRISM通过训练内化验证过程在单轮调用中实现了更高的准确率和效率。个人观点论文设计了一个规则验证任务迫使模型学习如何作为执行者去解析和内化复杂规则。