本地跑开源模型前要问的 5 个问题

📅 2026/8/21 21:09:09
本地跑开源模型前要问的 5 个问题
把开源模型权重下载到本地跑听起来自由数据不出机房也能脱离按 token 计费。真正卡人的很少是「会不会敲命令」而是下完几十 GB 才发现许可证不能商用、显存不够、上下文开太短、或框架与显卡对不上。下面五个问题建议在点下载之前就问完。一、许可证允许你怎么用开源模型的「开源」口径并不统一。权重、代码、训练数据可能各有协议。先看清楚1是否允许商用2是否要求署名、是否限制调用方产品形态3合并进你的服务对外提供时有没有额外条款4输出内容是否有使用限制较少见但要扫一眼说明个人学习与公司产品答案可能不同。许可证不合格后面的技术问题都白做。二、显存 / 内存够不够参数量大致决定权重体积但运行时还要留给 KV cache、激活值、框架开销。粗直觉非常粗仅供建立数量级1同等精度下参数越多权重越占显存2上下文越长KV cache 越吃显存3显存不够时可能落到系统内存 / 磁盘卸载速度会断崖式变慢实操建议1先查模型卡上的参数量与推荐配置2按你的 GPU 显存留余量不要按「刚好装下权重」卡死3CPU-only 能跑不等于能用先定义可接受的 token/s问不清显存就先别追最大参数。三、要用什么精度 / 量化同样一个 70BFP16、8bit、4bit 量化后的体积与质量不同。需要权衡1质量量化越狠越省显存越可能伤效果2速度取决于内核、硬件与实现不是单调关系3格式GGUF、GPTQ、AWQ 等与推理引擎绑定选型顺序我习惯是先定「任务能不能接受的质量下限」再选能塞进显存的最高精度而不是先下 4bit发现不行再反复重下。四、推理框架与硬件是否匹配常见路线包括名称会随时间变以你当下生态为准1面向本地聊天的一体客户端2llama.cpp 一类偏 CPU / 消费级显卡友好的路径3vLLM、TGI 一类偏服务化吞吐的路径4各家原厂或社区的 CUDA / ROCm / Metal 后端开跑前确认1显卡架构是否被支持驱动、CUDA 版本2你要的量化格式是否被该框架读取3要不要 OpenAI 兼容 API方便接现有工具4许可与遥测有的客户端默认联网内网场景要关掉框架选错表现为装得上、载得进、一推理就崩或慢到不可用。五、用途、上下文与成功标准是什么「能聊天」和「能当同事」不是同一目标。先写清1用途补全代码、内网知识问答、批量摘要、还是实验玩票2上下文文档问答需要多长窗口是否要 RAG3并发单人本地还是小团队同时打 API4验收延迟、正确率、能否离线、日志是否落盘没有验收标准就会陷入无尽换模型。有了标准才能决定「小模型 RAG」是否优于「硬上大参数」。下面是一个给自己看的最小清单示例。用途内网文档问答不接外网 硬件24GB 显存 上下文检索 Top-5 片段模型窗口 8K 许可证允许商用 验收常见问题准确率可接受首 token 2s全程可离线上面清单中每一行都能否决某个候选模型。比先下载再后悔便宜。六、五个问题怎么串起来建议顺序A许可证B用途与验收C显存与上下文D量化档位E框架与驱动许可证与用途不合格直接停。硬件与框架不匹配换模型或换引擎。不要颠倒成「先追榜一再看能不能商用」。七、常见误区1只看参数量榜单激活参数、训练质量、任务匹配往往更重要。2忽略上下文真实占用权重能装进显存长上下文一开照样 OOM。3默认所有「开源」都可商用先读 LICENSE / 模型卡。4把演示视频帧率当成你的机器性能对方可能多卡或更短上下文。5没有回退方案本地跑不动时是否允许走私有化 API、或缩小模型 RAG事先要有计划。八、小结本地跑开源模型前先问五句许可、显存、量化、框架、用途。五句都有答案再下载权重。这样省下的不只是磁盘还有两周排障时间。完