V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time In...

📅 2026/8/20 15:25:28
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time In...
文章核心总结与创新点一、主要内容本文聚焦多模态大型语言模型(MLLMs)的幻觉问题(生成内容与输入视觉信息不一致),其根源在于"视觉忽视"(模型未能充分重视输入图像)。现有干预方法仅关注"如何干预",而忽略"何时干预",导致过度干预(引入新幻觉、增加计算开销)和通用任务性能下降。为此,作者提出轻量级视觉推理时干预框架V-ITI,通过两个核心模块协同解决问题:视觉忽视检测器(VND):基于头级激活模式训练探针,精准识别视觉忽视发生的时机,避免无差别干预;视觉召回干预器(VRI):仅在检测到视觉忽视时,将预存的视觉激活信息与当前头激活融合,强化模型对相关视觉令牌的注意力。实验覆盖8个基准数据集和不同MLLM家族(LLaVA-1.5、Qwen-VL),结果表明V-ITI在减少视觉相关幻觉的同时,保持了通用视觉语言任务性能,且计算开销与贪心解码接近,显著优于现有逻辑干预(VCD、ICD)和注意力干预(OPERA、INTER)方法。二、创新点问题揭示:指出MLLM幻觉缓解中被忽视的"过度干预"问题,系统分析视觉忽视的机制,证明头级激活模式可作为视觉忽视的有效检测信号;干预范式创新:提出首个同时解决"何时干预"和"如何干预"的视觉推理时干预框架,通过检测器与干预器的结合实现选择性、自适应干预;轻量化