多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述

📅 2026/8/2 8:44:49
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述
MLLM在细粒度视觉理解上仍然吃力答案往往依赖图中只占极小比例的决定性细节而在整图推理时这些细节被海量视觉 token 淹没。在整图推理时这些细节往往只占图像中很小一块被大量无关视觉 token 包围极易在全局场景的合理猜测中被忽略——模型可能基于全局语义给出看似合理、实则漏掉关键局部证据的答案。Thinking-with-Images方案给 MLLM 配备了智能体式的视觉工具在推理过程中主动裁剪、放大、检查感兴趣区域。这确实提升了细粒度理解开销较大需要反复编码图像每次 crop 都重新过视觉编码器需要多次模型调用多步推理 工具调用。这引出一个问题能否通过训练把视觉放大的收益内化进模型让模型在单趟前向传播single forward pass里就能从整图中利用细粒度证据而不再依赖推理期的工具关键现象——regional-to-grdobal perception gap区域到全局的感知差距同一个 MLLM当输入是以证据为中心裁剪出的小图时比输入完整大图时答得更准。这说明很多失败不是因为模型认不出细节而是因为模型在全局上下文里难以聚焦到相关细节。Vision-OPD (Vision On-Policy Distillation)从同一个 MLLM 实例化两个条件策略——Teacher老师:只看证据裁剪图crop相当于模型开了一个特权视角Student学生:看完整大图即标准推理场景。学生先在线on-policy生成回答然后让老师和学生在这条学生自己生成的轨迹上做逐 token 的分布差异最小化。这样就把模型放大看的特权能力迁移到了看整图的策略中。2. 动机Less is More少即是多2.1 一个可验证的假设作者提出一个简洁的验证思路对比同一个模型在两种输入下的表现——Global input全局输入喂完整大图Regional input区域输入只喂以证据为中心裁剪出的小图。如果模型在裁剪图上答对、在整图上答错就说明模型其实能识别该证据只是无法在全局上下文中聚焦到它。瓶颈是聚焦能力不是识别能力。2.2 定性案例基于 Qwen3.5-9B 的定性案例。问题问护耳罩是什么颜色。输入整图→ 模型预测black错输入裁剪区域→ 模型正确预测green对。决定性证据在孤立看时清晰可辨但在全局上下文中被淹没。2.3 系统性验证差距是普遍存在的在 ZoomBench 上的系统评测表明这并非个别现象而是一个系统性规律区域输入的精度持续高出全局输入18~22 个百分点。更关键的是——即便是非常大的模型、闭源模型GLM-4.6V、GPT-5.4、Gemini-3.5-Flash、Gemini-3.1-Pro也都有显著的差距证明单纯堆参数无法关闭这个 regional-to-global gap。结论既然模型自己的区域感知始终强于全局感知那么就可以用前者作为特权监督privileged supervision来提升后者——把放大的收益内化进单趟前向无需推理期工具。3. 方法Vision-OPD区域→全局的在线策略自蒸馏整个方法由两大部分组成(A) 数据合成构造 triplet与(B) 在线自蒸馏训练。论文的 Overview 图把这两部分画得很清楚Vision-OPD 总览。左在证据裁剪图上生成细粒度问题并通过边界框叠加把问题锚定回整图。右用同一个 MLLM 实例化 teacher 策略p T ( ⋅ ∣ x crop ) p_T(\cdot\mid x_{\text{crop}})pT​(⋅∣xcrop​)与 student 策略p S ( ⋅ ∣ x global ) p_S(\cdot\mid x_{\text{global}})pS​(⋅∣xglobal​)。学生在线生成 rollouty ∼ p S y\sim p_Sy∼pS​沿该轨迹计算逐 token 散度D ( p T ∥ p S ) D(p_T\|p_S)D(pT​∥pS​)作为稠密监督梯度只流经学生 logits实现无标注的自蒸馏。算法流程输入训练集 D {(x_i, x_i, q_i)}; MLLM p_θ; 散度 D如 JSD_β 定义 p_S(·|x, q) : p_θ(·|x, q) # 学生整图条件 p_T(·|x, q) : p_θ(·|x, q) # 老师裁剪图条件特权视角 for step 1 … M: 采样一个 batch B ⊆ D for 每个 (x, x, q) ∈ B: y ~ p_S(·|x, q) # 学生在线采样 ℓ(x,x,q) 1/|y| Σ_n D( p_S(·|x, q, y_n) || stopgrad( p_T(·|x, q, y_n) ) ) L 1/|B| Σ_{(x,x,q)∈B} ℓ(x,x,q) 用 L 更新 θ注意stopgrad梯度不回传到老师老师只提供目标分布。实验结果参考文献Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillationhttps://arxiv.org/abs/2605.18740代码https://github.com/VisionOPD/Vision-OPD