INT4 通俗完整讲解

📅 2026/7/23 18:48:41
INT4 通俗完整讲解
一、基础概念INT4 =4 位整数量化AI 大模型里每一个权重数字,原本标准格式是 FP32(32 位浮点数),占用 4 字节显存。 量化:把高精度小数,压缩成低位数整数,大幅减少显存占用,代价是轻微损失一点 AI 精度,日常使用几乎感知不到。常见量化规格对比(直观看懂压缩比例):FP32:32bit,原始完整精度,显存占用最大FP16/BF16:16bit,减半显存,你 3060 支持INT8:8bit,再减半INT4:4bit,再砍一半,显存直接压缩到原版 1/8二、INT4 核心作用(对你最关键)极致省显存以大模型权重举例:7B FP16:约 13G 显存7B INT4:仅 3.5~4G 显存 13B、30B 同理,显存直接砍 75%,低配显卡才能跑大模型。降低硬件门槛你的 3060 只有 12G 显存,不做 INT4 量化,连 13B 模型都加载不进去;开启 INT4 后才能正常运行。小幅提速 数据体积变小,GPU 读写更快,推理生成文字速度会有小幅提升。三