Maple-Preview-GGUF快速开始:4种量化变体文件选择终极指南 📅 2026/8/17 18:12:59 Maple-Preview-GGUF快速开始4种量化变体文件选择终极指南【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUFMaple-Preview-GGUF 是一个面向本地推理场景的GGUF 量化模型仓库托管了 deepgrove 团队 Maple-Preview20B-A1B 混合专家推理模型的 4 种量化变体文件。无论你想在纯 CPU 还是小显存 GPU 上运行这份快速开始指南都能帮你搞懂 TQ1_0、TQ2_0 三元量化方案与 Q4_K、FP16 输出头精度的组合差异几分钟内选出最合适的 GGUF 文件并完成本地部署。一、Maple-Preview-GGUF 是什么先认识这款 20B-A1B 推理模型Maple-Preview 是 deepgrove 团队为端侧高效推理而设计的推理模型核心规格如下20B-A1B 架构约 200 亿参数每次推理仅激活约 10 亿参数兼顾容量与速度**24 层、256 专家8 个激活**的 MoE 混合专家结构3:1 SWA-512:GA 注意力设计长上下文表现更稳主打原生推理能力在内存-性能、速度-性能的帕累托前沿上表现亮眼而GGUF 格式是 llama.cpp 生态的标准量化格式可以把动辄上百 GB 的原生权重压缩到几个 GB让普通笔记本也能本地运行大模型——这正是这个仓库存在的意义。二、4 种量化变体文件一览一分钟看懂文件命名仓库根目录下共 4 个 GGUF 文件命名规律是maple-preview-TQ{版本}-head-{精度}.gguf量化变体文件体积特点maple-preview-TQ1_0-head-Q4_K.gguf4.64 GiB最小巧最省内存maple-preview-TQ1_0-head-F16.gguf5.06 GiBTQ1_0 高精度输出头maple-preview-TQ2_0-head-Q4_K.gguf5.50 GiB解码速度快maple-preview-TQ2_0-head-F16.gguf5.91 GiB精度最高体积最大其中TQ1_0与TQ2_0是两种不同的三元Ternary量化打包方案head指 LM 输出头被单独保留为Q4_K或FP16高精度避免推理质量因量化而大幅下滑。三、TQ1_0 与 TQ2_0 核心区别更快还是更省选择困难症用户最关心的问题来了TQ2_0普遍更快的推理速度但内存占用略高适合追求性能的玩家TQ1_0内存占用更低适合显存/内存紧张的设备Q4_K 输出头体积更小、解码更快是性价比之选FP16 输出头精度更高但体积与算力开销也随之上升一句话总结要速度选 TQ2_0要省内存选 TQ1_0输出头优先 Q4_K追求极致精度再上 FP16。四、CPU 实测速度对比量化变体性能一目了然官方在 M5 Pro纯 CPU、16 线程、512 prompt tokens、128 生成 tokens上的实测数据极具参考价值矩阵权重LM 输出头体积Prefill 速度Decode 速度TQ1_0FP165.06 GiB515.41 tokens/s161.06 tokens/sTQ1_0Q4_K4.64 GiB513.33 tokens/s231.13 tokens/sTQ2_0FP165.91 GiB618.57 tokens/s169.81 tokens/sTQ2_0Q4_K5.50 GiB610.48 tokens/s252.74 tokens/s可以看到Q4_K 输出头让解码速度提升约 40%而 TQ2_0 在预填充Prefill阶段优势明显——两者叠加的TQ2_0-head-Q4_K是速度党的最优解。五、按场景选文件最快配置方法参考内存只有 5GB 左右选maple-preview-TQ1_0-head-Q4_K.gguf4.64 GiB⚡追求最快解码体验选maple-preview-TQ2_0-head-Q4_K.gguf252 tokens/s追求最佳生成质量选maple-preview-TQ2_0-head-F16.gguf5.91 GiB⚖️体积与质量平衡之选maple-preview-TQ1_0-head-F16.gguf六、快速开始下载与本地运行步骤第 1 步克隆仓库获取全部 4 个量化变体文件git clone https://gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF第 2 步准备运行时。TQ1_0/TQ2_0 属于新型三元量化格式需要使用 deepgrove-ai 提供的自定义 llama.cpp 分支仓库 README 中有详细说明普通版 llama.cpp 可能无法识别。第 3 步加载模型并对话以速度最快的变体为例llama-cli -m maple-preview-TQ2_0-head-Q4_K.gguf -p 你好请介绍一下你自己 -t 8七、使用须知与常见问题 项目采用MIT 开源协议可自由使用与二次开发 Maple-Preview 现阶段聚焦原生推理能力在 Agent 类基准上可能表现平平工具调用场景建议等待正式版❓ 下载的.gguf文件体积异常请确认已安装 Git LFS 插件后再克隆以上便是 Maple-Preview-GGUF 快速开始的完整指南。对照文中的体积、速度与场景建议现在就去挑选属于你的量化变体文件开启本地推理之旅吧【免费下载链接】maple-preview-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/deepgrove/maple-preview-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考