INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

📅 2026/8/21 11:36:45
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
文章核心内容与创新点总结一、主要内容本文针对大型视觉语言模型(LVLMs)在部署时面临的计算资源消耗大、现有剪枝方法导致性能大幅下降的问题,提出了一种名为INTERLACE的层剪枝与高效适配框架。该框架通过三阶段核心流程实现模型压缩与性能保持:冗余识别:以连续三层为一个"三元组"(triplet),计算隐藏状态的余弦相似度,识别局部冗余的三元组及组内最冗余的层;层分配策略:对选中的三元组,冻结第三层作为稳定特征锚点,删除前两层中更冗余的层,对剩余层进行微调以补偿丢失的模型容量;高效微调:仅使用FineVision数据集1%的样本(约24万条),微调1个epoch,且仅更新被标记为微调的层,其余层保持冻结。实验基于Qwen3-VL-8B和4B模型,在12个涵盖视觉问答、文本图表理解、细粒度感知、科学推理的基准测试中验证:删除25%的层后,8B模型仍能保持86.1%的基线性能,相对微调后的稠密模型性能 retention 达88.9%,同时实现1.18倍的推理提速,显著优于Wanda、SLEB等现有剪枝方法。二、核心创新点三元组-based冗余分析:通过分析连续三层的局部冗余模式,避免了连续块剪枝导致的微调不稳定性,同时精准定位非连续冗余层;交错冻结-微调设计:冻结三元组第三层作为结构约束锚点