【AI】本地大模型搭建-1 KoboldCpp

📅 2026/8/16 7:35:45
【AI】本地大模型搭建-1 KoboldCpp
文章目录本地大模型搭建全流程RTX 5060 Ubuntu KoboldCpp一、整体架构二、环境信息三、网络验证已完成 ✅验证命令实测结果⚠️ 注意事项四、踩坑记录4.1 UI 白屏 ≠ 模型没启动五、安装 KoboldCpp六、下载 GGUF 模型量化版本对比8GB 显存视角七、KoboldCpp 参数配置v1.118.1 实测参数表启动步骤按顺序一层验证完再进下一层八、停止 / 卸载模型释放显存8.1 KoboldCpp本次实际使用方式8.2 关掉终端后显存仍未释放8.3 如果用的是 Ollama备选九、性能记录与后续调优实测数据结论下一步调优方向本地大模型搭建全流程RTX 5060 Ubuntu KoboldCpp与 AI 协作搭建本地大模型的完整记录已按主题整理。环境Windows 11 RTX 5060 Laptop 8GB VMware Ubuntu KoboldCpp一、整体架构核心思路模型推理放在 WindowsGPU 直通Ubuntu 虚拟机作为远程客户端两者通过 VMware VMnet8 跨网络访问。Windows 11 ├── RTX 5060 Laptop 8GB │ └── KoboldCppGPU 推理引擎 │ └── HTTP API 0.0.0.0:5001 │ └── VMnet8 网卡192.168.107.1 │ VMware NAT 网关192.168.107.2 ▼ Ubuntu VM192.168.107.195 └── 远程访问测试curl / wget数据流已全部验证打通 ✅Ubuntu VM192.168.107.195 → VMware NAT → Windows192.168.107.1 → KoboldCpp → RTX 5060要点不需要改动 VMware 网络架构——Windows 在 VMnet8 上有明确 IP192.168.107.1直接用 IP 访问即可。Windows 上的 KoboldCpp 必须监听0.0.0.0不能只监听127.0.0.1并放行防火墙否则 Ubuntu 访问不到。这个案例本身就是跨虚拟网络访问宿主机服务的典型实验Ubuntu → 路由 → VMware NAT → Windows。二、环境信息项目值宿主机Windows 11GPURTX 5060 Laptop显存 8151 MiB ≈ 8GB内存32GB硬盘3TBNVIDIA 驱动610.74CUDA Driver13.3UMD无需安装 CUDA ToolkitUbuntu VM192.168.107.195/24网关 192.168.107.2VMware NATWindows VMnet8192.168.107.1三、网络验证已完成 ✅目标链路Ubuntu → VMware NAT → Windows VMnet8最终到 Windows 上的推理引擎。验证命令# 1. Ubuntu 里 ping Windows 虚拟网卡ping-c4192.168.107.1# 2. Windows CMD 确认 VMnet8 地址ipconfig# 找 VMware Network Adapter VMnet8 → 192.168.107.1# 3. 验证 HTTP 层Windows 先启动临时服务# Windows PowerShellpython-mhttp.server8080--bind0.0.0.0# Ubuntu 里wget-O- http://192.168.107.1:8080# 或 curl实测结果Ubuntu ping192.168.107.14/4 通过0% 丢包延迟约 0.5ms链路完全打通。⚠️ 注意事项ICMP 通 ≠ TCP 端口通Windows 防火墙可能放行 ping 但拦截具体端口。若 HTTP 测试失败依次检查防火墙 → 监听地址 → 监听端口 → VMnet8 → 虚拟网络。四、踩坑记录4.1 UI 白屏 ≠ 模型没启动白屏可能只是浏览器 UI 问题模型可能已正常加载到 GPU、后端正常。不要为了白屏反复双击 launch每启动一次就会再加载一个模型进显存多次之后 8GB 显存瞬间被占满。判断方法看启动终端输出 nvidia-smi显存占用。五、安装 KoboldCpp下载地址KoboldCpp 官方 GitHub →Releases→ Windows 的 CUDA 版本。版本选择驱动已是CUDA 13.3优先选 CUDA 13 版如koboldcpp_cu13.exe不必迁就旧 CUDA。本次实际版本KoboldCpp v1.118.1启动后正确识别 RTX 5060 Laptop GPU。六、下载 GGUF 模型第一轮只做环境验证用Qwen3-8B Q4_K_M约 5.03GB不要一上来就下大模型。下载地址Qwen/Qwen3-8B-GGUFHugging Face文件Qwen3-8B-Q4_K_M.gguf存放目录D:\AI\Models\量化版本对比8GB 显存视角版本大小评价Q4_K_M5.03 GB★★★★★ 最稳第一轮首选Q5_K_M5.85 GB★★★★☆ 可跑但更吃显存Q6_K6.73 GB★★★☆☆ 逼近显存极限Q8_08.71 GB❌ 文件已超 8GB 显存第一轮不要提示Qwen3-8B 只是点火塞。跑通链路后如需更强的对话/推理能力建议换 12B/14B 更大模型Q4/Q5 量化而不是一直用 8B。七、KoboldCpp 参数配置v1.118.1 实测参数表参数设置说明BackendUse CUDA已自动识别 RTX 5060 Laptop GPUGPU ID0单卡保持 0Use MMQ☑ 保持—GPU Layers-1自动分配无需手动填 99Use MMAP☐ 不勾第一轮求稳FlashAttention☑ 保持长上下文有价值Context Size8192从默认 12288 下调给显存留余量KV Cache 也吃显存ContextShift☑ 保持长对话有用Launch Browser☑ 保持启动后自动打开 Web UIRemote Tunnel☐ 关闭不需要暴露公网Force AutoFit / Use Jinja☐ 关闭第一轮全部保持关闭Port5001—Host0.0.0.0⚠️ 必须只监听 127.0.0.1 时 Ubuntu 访问不到启动步骤按顺序一层验证完再进下一层选择 GGUF 模型文件D:\AI\Models\Qwen3-8B-Q4_K_M.gguf按上表配置参数点Launch / Start观察控制台输出应有 CUDA / RTX 5060 / offloading layers另开 PowerShell 运行nvidia-smi -l 1每秒刷新显存应从 ~1531 MiB 涨到 5000~7000 MiB/ 8151 MiB生成文字时 GPU-Util 明显上升 → 证明GPU 真在推理而不是 CPU 在跑Windows 浏览器打开http://127.0.0.1:5001先本地测试模型能否正常对话Ubuntu 里wget -O- http://192.168.107.1:5001验证跨网络可达不要一次性做十件事每层确认通过再继续八、停止 / 卸载模型释放显存8.1 KoboldCpp本次实际使用方式直接关闭启动终端窗口点 ×或终端内按Ctrl C关闭后KoboldCpp 后端停止 → 模型从显存卸载 → 显存释放浏览器页面失效属正常8.2 关掉终端后显存仍未释放nvidia-smi# 查看占用进程taskkill/IM koboldcpp.exe/F# 按实际进程名执行不要照抄8.3 如果用的是 Ollama备选ollamaps# 查看当前加载的模型ollama stop qwen3:8b# 只卸载模型、释放 GPU 显存服务保留推荐taskkill/IM ollama.exe/F# 需要整个服务关闭时# 终端对话中直接 Ctrl C 终止当前推理九、性能记录与后续调优实测数据推理速度42.28 t/sGenerated: 26/350 in 0.61s——消费级 GPU 表现不错当时参数n_ctx 8192、n_predict 350、temperature 1、top_p 0.95结论感觉模型效果不尽如人意主要不是电脑慢而是 8B 模型本身的能力上限 参数/上下文设置问题。下一步调优方向先把 KoboldCpp Qwen3-8B 的正确参数搞明白思考模式thinking、上下文长度、GPU offload上下文长度渐进测试8192 → 12288 → 16384链路稳定后如需更强对话能力换 12B/14B 更大模型Q4/Q5 量化