【MLSys 2024】AWQ:激活感知权重量化——把大模型装进边缘设备|从端侧大模型部署视角

📅 2026/8/14 17:21:48
【MLSys 2024】AWQ:激活感知权重量化——把大模型装进边缘设备|从端侧大模型部署视角
摘要本文解读 MLSys 2024 论文《AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration》。该论文提出激活感知权重量化AWQ通过融合激活统计、逐通道等价缩放与单超参网格搜索在不做任何训练或重构的前提下把大模型压缩到 4-bit其特别之处在于用保护约 1% 显著权重通道替代了硬件不友好的混合精度。实验表明 AWQ 在所有模型尺寸7B–70B与位宽INT3/INT4下困惑度一致优于 RTN 与 GPTQ配套 TinyChat 框架实测3.2–3.3 倍加速甚至让 70B 模型在 64GB 内存的 Jetson Orin 上运行为端侧大模型部署提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息为什么大模型上边缘设备这么难研究主线从问题到结论基准/方法设计三个核心环节量化方法全景方法细节从误差分析到系统落地实验设计与结果结果对比总结关键发现局限性常见问题FAQAWQ 和 GPTQ 的本质区别是什么为什么保护 1% 权重就能大幅降低量化误差AWQ 需要多少校准数据AWQ 支持多模态模型吗AWQ 能带来多少实际加速为什么量化权重就能加速生成参考链接论文基本信息项目内容标题英文AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration标题中文AWQ激活感知权重量化——把大模型装进边缘设备作者Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han机构MIT EECS · MIT-IBM Watson AI Lab · NVIDIA · SJTU · Tsinghua · UMass Amherst会议MLSys 2024arXivhttps://arxiv.org/abs/2306.00978项目网站https://github.com/mit-han-lab/llm-awq为什么大模型上边缘设备这么难在边缘设备上直接运行大语言模型可以省去云端往返时延、支持离线使用、保护用户隐私还能降低云基础设施成本——这是虚拟助手、聊天机器人、自动驾驶等实时应用的关键诉求。但大模型的体积是最大障碍以 Llama-2-70B 为例仅 FP16 权重就需要 140GB 内存远超任何边缘设备。低比特权重量化是压缩模型的核心手段但两条既有路线都有硬伤量化感知训练QAT依赖反向传播更新量化权重训练成本高到难以扩展到百亿参数模型训练后量化PTQ虽然免训练但在 4-bit 以下精度退化严重。最接近的既有工作是GPTQICLR 2023它用二阶信息做逐列误差补偿但重建过程可能过拟合校准集——在分布外的任务上损害模型的通用能力而大模型恰恰是通用主义者。从历史视角看AWQ 并非孤立出现它来自 MIT HAN Lab 十余年的效率 AI 主线Deep Compression → MCUNet → SmoothQuant且发表后被HuggingFace Transformers、vLLM、llama.cpp、TensorRT-LLM等主流框架原生支持成为 4-bit 量化的工业事实标准Marlin、QuIP# 等后续工作都以它为基线——这是量化领域罕见的从算法到基础设施迁移。研究主线从问题到结论图 10研究主线——从内存墙问题、低比特量化痛点经激活感知缩放方法到 3.2–3.3 倍实测加速Mermaid 流程图基准/方法设计三个核心环节AWQ 的设计围绕三个环节展开全程不需要反向传播也不需要任何重构识别显著通道实验表明把按激活分布选出的 0.1%–1% 权重通道保留为 FP16就能让 OPT-6.7B 的 INT3 量化困惑度从 23.54 降到 11.58——而按权重范数选则几乎无效23.41说明显著性由激活分布决定。等价缩放保护对显著通道乘以缩放因子 $s1$ 并等效反缩放输入 $x$量化后变为 $Q(w\cdot s)(x/s)$相对误差从 $\Delta\cdot\text{RoundErr}(w/\Delta)\cdot x$ 降为 $\frac{\Delta}{\Delta}\cdot\frac{1}{s}$ 倍——显著通道的量化误差被严格压缩且无需混合精度。自动搜索尺度把缩放空间限制为 $\mathbf{s}\mathbf{s}_X^{\alpha}$其中 $\mathbf{s}_X$ 是校准集上的逐通道激活均值$\alpha\in[0,1]$ 做 20 步网格搜索配合权重裁剪最小化量化 MSE。图 1AWQ 概览——4-bit 量化 LLM 部署到各类边缘平台实测 3–4 倍性能提升配套 TinyChat 电脑Jetson Orin Nano8GB 显存、15W 功耗量化方法全景图 11量化方法全景——W4A16 权重仅量化分支下AWQ 与 GPTQ 的定位对比Mermaid 分类图方法细节从误差分析到系统落地为什么缩放有效考虑权重分组 $\mathbf{w}$ 的线性运算 $y\mathbf{w}\mathbf{x}$量化函数为 $Q(\mathbf{w})\Delta\cdot\text{Round}(\mathbf{w}/\Delta)$。对单个元素 $w$ 乘以 $s1$ 后舍入误差分布不变平均约 0.25且单元素缩放通常不改变组内最大值即 $\Delta\approx\Delta$于是缩放后相对误差缩小到原来的 $\frac{\Delta}{\Delta}\cdot\frac{1}{s}$——这是 AWQ 全部有效性的理论支点。但 $s$ 不能无限大$s4$ 时 21.2% 的通道 $\Delta$ 发生变化非显著通道误差被放大实验最优值在 $s2$ 附近OPT-6.7B PPL 从 23.54 降到 11.92。系统侧TinyChat的落地同样关键量化层采用即时反量化INT4 权重在矩阵乘内核内当场转回 FP16避免中间 DRAM 写回SIMD 感知打包按设备 SIMD 位宽重排 4-bit 权重ARM 128-bit 寄存器一次装 32 个权重最高 1.2 倍加速核融合把 LayerNorm 合并为单核、QKV 投影合并、KV cache 预分配。对 Falcon 这类前向实现低效的模型仅 FP16 核融合就有 1.6 倍加速。图 5128-bit 寄存器内交错排列 32 个 4-bit 权重$w_0, w_{16}, w_1, w_{17}, \dots$反量化与 FMA 都走向量化路径图 2基于激活分布找出 1% 显著权重保留 FP16OPT-6.7B INT3-g128 的 PPL 从 43.2 降至 13.0左→中AWQ 用逐通道缩放达到类似效果且保持统一量化格式右实验设计与结果评测协议权重量化 INT3/INT4、分组大小 g128校准集只用 Pile 的 16 条序列不针对下游任务$\alpha$ 网格 20 步。模型覆盖 LLaMA/Llama-27B–70B、OPT、Mistral/MixtralMoE、Vicuna指令微调、OpenFlamingo-9B/LLaVA-13B/VILA多模态。主指标为 WikiText-2 困惑度越低越好基线为 RTN、GPTQ、GPTQ-R。主表Llama-2 系列 INT3-g128 困惑度模型FP16RTNGPTQAWQLlama-2-7B5.476.666.436.24Llama-2-13B4.885.525.485.32Llama-2-70B3.323.983.883.74LLaMA-7B5.687.018.816.35AWQ 在所有尺寸与位宽下一致胜出值得注意的是 LLaMA-7B 一列中 GPTQ 甚至劣于 RTN8.81 vs 7.01暴露了重建方法对校准集的脆弱性。四个关键现象① 数据效率——AWQ 用 16 条校准序列就超过 GPTQ 用 192 条序列的困惑度数据需求差 10 倍② 分布鲁棒——PubMed 与 Enron 交叉校准评测中AWQ 对校准集分布最不敏感③ 多模态——OpenFlamingo-9B 的 INT4 量化退化从 4.57 降到 1.17VILA 在 11 个视觉语言基准上无损这是首个 VLM 低比特量化研究④ 极限低比特——INT2 下 RTN 完全失效AWQ 与 GPTQ 正交叠加后显著改善使 2-bit 走向实用。图 3RTX 4090 上 Llama-2/MPT/Falcon 实测 2.7–3.9 倍加速Llama-2-7B 从 52 tokens/s 提升到 62 tokens/sFP16 核融合量化核再叠加 3.1 倍图 4生成阶段算术强度约 1远低于 4090 上 165 FLOPs/Byte 的 roofline 阈值推理受内存带宽限制权重访问主导内存流量4-bit 量化把算术强度提升到约 4图 6INT3-g128 下 AWQ 在 Vicuna-7B/13B 的 GPT-4 评分均优于 RTN 与 GPTQ80 题 × 双向 160 次评测图 7INT4-g128 下 AWQ 保留关键语义细节RTN 输出退化错误用红色标出图 8AWQ 量化后的 LLaVA-13B 能理解从太空看地球的梗图语义RTN 输出错误描述图 9AWQ 用约 16 条序列即收敛GPTQ 需 192 条PubMed/Enron 交叉校准下 AWQ 几乎不过拟合结果对比总结图 12结果对比——Llama-2-7B INT3 困惑度 RTN 6.66 / GPTQ 6.43 / AWQ 6.24并兑现 3.2–3.3 倍加速Mermaid 流程图关键发现激活感知是决定性洞察OPT-6.7B INT3 下按激活分布保留 1% 通道 FP16 使 PPL 从 23.54 降到 11.39而按权重范数选择几乎无改善23.41——显著性必须看激活。等价缩放追平混合精度统一 INT4 量化达到 1% FP16 混合精度同等的困惑度且零硬件额外开销这是 Oral 级执行质量的直接证据。10 倍数据效率16 条校准序列 vs GPTQ 的 192 条AWQ 的困惑度反超且 PubMed/Enron 交叉评测不过拟合。首个 VLM 量化OpenFlamingo-9B INT4 退化 4.57→1.17VILA 在 11 个基准上无损多模态与指令微调模型全适用。端到端加速兑现TinyChat 实测 3.2–3.3 倍加速对比 HuggingFace FP16对比 llama.cpp 在 Orin 上快 1.7 倍70B 模型部署于 Jetson Orin13B 模型在 8GB 显存的 RTX 4070 上达到 30 tokens/s。生态级采纳被 HuggingFace Transformers、vLLM、llama.cpp、TensorRT-LLM 原生支持成为 4-bit 量化事实标准附录 H 历史视角。局限性仅权重量化W4A16 设定下激活仍为 FP16未覆盖 W8A8 等激活量化场景。仍需少量校准数据虽然只需激活均值但仍依赖 Pile 数据做统计。搜索无最优保证$\alpha$ 网格搜索是启发式没有全局最优的理论证明。系统平台绑定TinyChat 的打包与内核针对 NVIDIA GPU / ARM CPU 定制跨平台移植成本高。常见问题FAQAWQ 和 GPTQ 的本质区别是什么GPTQ 通过二阶信息重构权重来补偿量化误差依赖校准集且可能过拟合AWQ 不做任何重构只用激活均值指导逐通道缩放来保护显著权重因此数据效率高 10 倍且分布鲁棒。为什么保护 1% 权重就能大幅降低量化误差量化误差正比于权重量化步长与激活幅值的乘积激活幅值大的通道误差贡献最大。保留这些通道的精度或等价地缩放它们就保住了模型最重要的特征实验中 OPT-6.7B INT3 困惑度从 23.54 直降到 11.58。AWQ 需要多少校准数据仅需约 16 条文本序列Pile 子集测量逐通道激活均值而 GPTQ 需要约 192 条AWQ 用更少数据取得更好结果且对校准集分布如 PubMed vs Enron不敏感。AWQ 支持多模态模型吗支持。论文首次系统研究 VLM 量化OpenFlamingo-9B INT4 退化仅 1.1732-shotVILA 在 11 个视觉语言基准上无损LLaVA-13B 视觉推理定性结果优于 RTN。AWQ 能带来多少实际加速TinyChat 框架在 RTX 4090 上对 Llama-2/MPT/Falcon 实测 2.7–3.9 倍加速对比 HuggingFace FP16跨桌面与移动 GPU 平均 3.2–3.3 倍对比 llama.cpp 在 Jetson Orin 上快 1.7 倍。为什么量化权重就能加速生成生成阶段算术强度约 1 FLOPs/Byte远低于 GPU 的 roofline 阈值推理完全受内存带宽限制且权重访问主导内存流量4-bit 权重把算术强度提升到约 4理论上限提高 4 倍。参考链接arXiv 论文https://arxiv.org/abs/2306.00978项目主页与代码llm-awqhttps://github.com/mit-han-lab/llm-awqGPTQICLR 2023https://arxiv.org/abs/2210.17323SmoothQuantICML 2023https://arxiv.org/abs/2211.10438LLM.int8()NeurIPS 2022https://arxiv.org/abs/2208.07339给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件