R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization 📅 2026/8/17 22:13:50 R2Q 论文总结与核心部分翻译一、主要内容总结该论文针对大语言模型(LLMs)2位量化中存在的精度严重下降问题,提出了一种名为残差细化量化(Residual Refinement Quantization, R2Q)的新型2位量化框架。核心思路是将2位量化过程分解为两个连续的1位子量化步骤:第一步对原始权重进行粗粒度1位近似,第二步对量化残差进行1位细化修正,通过残差学习机制构建自适应量化网格,从而充分利用2位量化的有限表示能力。论文在Llama、OPT、Qwen等主流模型上,通过问答、常识推理、语言建模等多类基准测试验证了R2Q的有效性。实验结果表明,无论是细粒度还是粗粒度量化设置,R2Q均持续优于现有2位量化方法,在提升模型性能的同时,增强了训练稳定性并加速了收敛速度。此外,R2Q采用模块化设计,可无缝集成到现有量化感知训练(QAT)框架中,具备良好的兼容性和实用性。二、创新点量化过程分解策略:首次将2位量化问题拆解为两个独立的1位子问题,通过粗粒度近似+残差细化的两步流程,构建了灵活可学习的量化网格,突破了传统静态网格(如RTN)在低比特场景下的表示局限。分布无关的最优解设计:推导了1位子问题的最优解(基于符号函数和L1范数的缩放因子),该解不依赖特定权重分布,提升了模型在不同架构下的鲁棒性。模块化即插即用特性:设计为独立模块,可直接集成到BitDistiller等现有量化框架中,无需修改原有架构即可实现性能