lift-oQ4 vs lift-oQ8 vs bf16:MLX社区7大量化版本怎么选最合适

📅 2026/8/17 18:12:39
lift-oQ4 vs lift-oQ8 vs bf16:MLX社区7大量化版本怎么选最合适
lift-oQ4 vs lift-oQ8 vs bf16MLX社区7大量化版本怎么选最合适【免费下载链接】lift-oQ4项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ4lift-oQ4 是 MLX 社区针对文档抽取视觉大模型 lift9B Qwen3.5推出的数据驱动混合精度量化版本平均每个权重仅约 4.6 比特把近 18GB 的 bf16 全精度模型压缩到 5.6GB在 Apple Silicon 上能跑到约 100 tokens/s。面对 lift-bf16、lift-oQ8、lift-oQ6、lift-oQ5、lift-oQ4、lift-oQ3.5、lift-oQ3 这 7 个量化版本新手往往纠结到底该选哪个本文用一张对比表加四个典型场景帮你快速锁定最合适的那一个。一、lift 是什么为什么会有 7 个版本lift 是一个专门做结构化抽取的视觉语言模型VLM输入 PDF、发票、合同或表格截图输出符合 JSON Schema 的规整数据相当于图片/文档 → 结构化 JSON的利器。它基于 Qwen3.5 架构、约 90 亿参数支持图文混合输入模型结构与说明可参考 README.md 和 config.json。MLX 社区把它转换成 Apple Silicon 原生可运行的格式并一口气发布从 bf16 全精度到 oQ3 的 7 个版本用来覆盖不同内存配置的 Mac 用户——这也是本次对比的由来。二、7 个版本一表看懂体积、内存、速度版本量化方式平均位数文件大小峰值内存生成速度lift-bf16全精度 bf1616 bit18 GB19.9 GB31 t/slift-oQ8oQ 混合精度≈8.69.7 GB12.3 GB58 t/slift-oQ6oQ 混合精度≈67.7 GB9.4 GB73 t/slift-oQ5oQ 混合精度≈56.7 GB8.4 GB83 t/slift-oQ4oQ 混合精度≈4.65.6 GB7.2 GB100 t/slift-oQ3.5oQ 混合精度≈4.04.9 GB6.5 GB109 t/slift-oQ3oQ 混合精度≈3.54.6 GB6.2 GB119 t/s以上数据来自 README.md是在单张发票抽取场景下的实测参考值M5 Max 128GB并非严谨基准仅供选型参考。三、oQ 量化是什么为什么 oQ4 只有 4.6 比特oQ 来自 oMLX 工具链它并不是简单地把所有权重压到同一个位数而是数据驱动、逐层分配精度对抽取结果影响大的层保留更多比特比如 5bit不敏感的层压缩到 4bit最终整体平均约 4.6 比特。这种好钢用在刀刃上的策略让 lift-oQ4 在体积缩小到全精度约三分之一的同时尽可能保住字段抽取的准确率。逐层量化配置就写在 config.json 的quantization字段里权重分片情况则记录在 model.safetensors.index.json共两个 safetensors 文件、约 6GB感兴趣的可以自己翻阅。四、怎么选4 个典型场景对号入座场景 1追求极致精度、内存管够 → 选 lift-bf16如果你跑在 64GB 以上内存的 M 系列 Max/Ultra 上且要处理最难的报表、手写文档bf16 全精度是最稳妥的选择。代价是 19.9GB 的峰值内存不是所有 Mac 都扛得住。场景 2精度优先、又要能本地跑 → 选 lift-oQ8oQ8 平均 8.6 比特质量最接近全精度体积却只有 9.7GB。适合 16GB 以上内存、把精度放在第一位的用户。场景 3日常发票/合同抽取最推荐 lift-oQ4 ⭐这是性价比甜点位5.6GB 文件、7.2GB 峰值内存16GB 内存的 MacBook 也能流畅运行速度高达 100 t/s。对常见的发票、合同、收据结构化抽取oQ4 的精度损失几乎可以忽略大多数个人开发者选它准没错。场景 4老款 Mac / 8GB 内存只要快 → 选 lift-oQ3.5 或 lift-oQ3oQ3 峰值内存只要 6.2GB速度冲到 119 t/s低配机器也能跑。但位数越低对模糊、复杂版式文档的抽取质量下降越明显建议先用简单文档验证效果再上线。五、三步上手在 Mac 上跑起 lift-oQ4装依赖通过 mlx-vlm 提供推理与 OpenAI 兼容服务能力单图抽取用一条命令直接生成 JSON结构化输出起服务后配合 JSON Schema保证返回结果合法、类型正确。命令行单图抽取uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ4 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800OpenAI 兼容服务uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ4 --port 8080服务端通过 llguidance 在解码阶段强制执行 JSON Schema输出一定是合法且符合类型的 JSON非常适合对接自动化流程。完整的 Python 调用示例含 base64 图片与 schema 定义见 README.md。六、一个必须知道的坑eos 修复上游模型只设置了248044一个结束符而对话轮次实际以|im_end|token 248046收尾——不修复的话MLX 服务端会一直生成、停不下来。MLX 社区版已在 generation_config.json 中把eos_token_id修复为[248044, 248046]直接使用即可如果你自行重新转换模型务必记得补上这个修复。图文输入模板可以对照 chat_template.jinja 查看。七、总结一张图记住选择逻辑你的需求推荐版本精度天花板 大内存lift-bf16精度优先 16GB 内存lift-oQ8日常抽取 速度质量兼顾lift-oQ4首选低配机器 极致速度lift-oQ3 / lift-oQ3.5需要本地部署时可通过 git clone 拉取模型仓库git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ4配合 mlx-vlm 即可在 Apple Silicon 上离线运行。选型没有绝对答案先拿一张你自己的发票跑一遍比任何参数表都直观。【免费下载链接】lift-oQ4项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考