如何快速把本地大模型喂给 Coding Agentclub-3090 通过 LiteLLM 网关让 Claude Code、Hermes 用上你的 RTX 3090【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090club-3090是一个社区开源的本地大模型部署方案专为 RTX 3090 / 4090 / 5090 打造支持 vLLM、SGLang、llama.cpp 等多引擎开箱提供 Qwen3.6-27B、Gemma 4 等模型的实测配置。它内置的LiteLLM 网关能把本地大模型统一成标准 OpenAI 接口让你的Coding AgentClaude Code、Hermes Agent 等直接调用自己的显卡——零 API 费用、代码不出本机、262K 长上下文随便用。️为什么本地大模型适合喂给 Coding AgentCoding Agent 的工作模式是读大量文件 → 长对话 → 持续多轮工具调用这对推理服务有三个要求长上下文、高吞吐、前缀缓存。本地部署在这三点上并不比云端差而且完全免费。上图是 club-3090 在单张 RTX 3090 上实测的 Qwen3.6-27B 生成速度代码场景 66~67 token/s意味着 Agent 每写一段代码只需一两秒等待——交互体验足够流畅。一张图看懂 LiteLLM 网关的工作方式club-3090 的核心设计是**Agent 永远只连网关不直连模型**Claude Code / Hermes / omp ──► LiteLLM 网关 :4000 ──► 当前实际在服务的模型:8113、:8142 …网关的路由表在每次switch.sh启动/停模型时自动重新渲染由 scripts/lib/litellm-sync.sh 完成只暴露真实在服务的端点因此你切换模型 slug 时不用改任何 Agent 配置网关里看到的就是此刻正在跑的模型并自动带上该次启动的真实上下文窗口如 262,144 token网关配置模板在 services/litellm/docker-compose.yml模型目录在 services/litellm/config.yaml。用终端驾驶舱c3tools/serve-cockpit/可以浏览全部可服务配置按 GPU 数量一键筛选适合你的 slug。三步接入从 clone 到 Agent 上线前置条件LinuxWindows 先装 WSL2、Docker NVIDIA Container Toolkit、磁盘空间放模型权重。新手可以从 docs/GETTING_STARTED.md 开始约五分钟即可出第一个回复。第 1 步部署并启动本地大模型git clone https://gitcode.com/gh_mirrors/cl/club-3090 cd club-3090 bash scripts/setup.sh # 选模型自动下载并校验权重 bash scripts/launch.sh # 选配置启动并做健康检查第 2 步给网关设置一个属于你自己的密钥网关默认使用公开默认密钥同网络内任何人都能调用。一条命令生成并应用自己的密钥bash scripts/gateway-key.sh rotate --apply第 3 步确认网关在线bash scripts/gpu-mode.sh gateway之后每当你用bash scripts/switch.sh slug切换模型网关路由会自动同步Agent 侧零改动。选 slug 时看显存预算24GB 单卡上vLLM 48K~200K 上下文、llama.cpp 262K 上下文各有对应配置详见 docs/SINGLE_CARD.md 与 docs/DUAL_CARD.md。Claude Code 连接本地大模型4 个环境变量搞定在~/.claude/settings.json中加入{ env: { ANTHROPIC_BASE_URL: http://127.0.0.1:4000, ANTHROPIC_API_KEY: 你的网关密钥, CLAUDE_CODE_ENABLE_GATEWAY_MODEL_DISCOVERY: 1, CLAUDE_CODE_MAX_CONTEXT_TOKENS: 262144 }, model: qwen3.8-27b }关键点ANTHROPIC_BASE_URL填网关地址不带/v1绝不能填模型引擎端口开启 Model Discovery 后Claude Code 会列出网关当前服务的所有模型走 vLLM 或 SGLang slug 时Claude Code 的 Anthropic 请求会被原样转发到引擎自身的/v1/messages端点模型的思考过程thinking blocks能完整传回并在后续轮次回放——这是本地模型保持长程推理连贯性的关键参考机实测含工具调用的任务首轮 18 秒后续--continue追问 2 秒97–99% 的提示词命中前缀缓存。Hermes Agent 一键接入一条脚本写入 ProviderHermes 无需手写配置项目自带一键脚本bash scripts/hermes-setup.sh # 在 ~/.hermes/config.yaml 写入 club provider hermes chat --provider custom:club -m qwen3.8-27b脚本会读取网关当前路由快照模型 上下文窗口并安全写入 Hermes 配置不动你的默认模型设置。两个推荐项开启hermes config set model.reasoning_echo true让模型每轮带回自己的推理过程工具循环中看得见计划用-t terminal,file,code_execution,…指定纯本地工具集避免 Hermes 默认的浏览器/联网工具把请求发往机器外。Hermes 状态栏自带cache_hit缓存命中率与tps指标边用边看网关效果。参考机实测工具调用链 29 秒完成、跨轮前缀缓存命中 98%、双子 Agent 并行 22 秒全部成功。省钱的关键盯住前缀缓存命中率长会话中Agent 每轮都要把全部历史重新发给模型。前缀缓存命中率 90% 以上是健康线——命中意味着引擎直接复用已算过的 KV不重复计算、不重复烧电bash scripts/cache-share.sh # 查看各引擎自启动以来的缓存命中 bash scripts/cache-share.sh --watch 30 # 边工作边实时监控本地部署还有一层云端没有的好处能效可调。如上图所示3090 在 290W 功耗上限附近达到最高能效0.111 TPS/W长时间跑 Agent 会话时锁一个合理的功耗上限既能控温又能省电。常见坑与排查清单现象原因与解法请求报400 No connected db.客户端密钥与网关LITELLM_MASTER_KEY不一致常见于轮换密钥后忘了更新核对~/.config/club-3090/secrets.envClaude Code 报System message must be at the beginningslug 在模板修复前启动用switch.sh重新启动且 llama.cpp 的 Qwen3.8 slug 不适配 Claude Code请用 vLLM/SGLang slug切换模型后网关还是旧路由更新仓库后路由不会自动刷新跑一次bash scripts/lib/litellm-sync.sh想抓包看网关到底转发了什么bash scripts/litellm-log.sh on开请求日志默认关闭排完记得off长会话被意外压缩CLAUDE_CODE_MAX_CONTEXT_TOKENS没按当前 slug 的窗口设置小模型 slug 要调低⚠️ 记住两条纪律网关监听所有网口不要删掉密钥切换 slug 会重启网关请在 Agent 的轮次边界切换。延伸阅读docs/CODING_AGENTS.md —— 本篇的完整出处omp / pi / Hermes / dsh / Claude Code 全量配置细节与实测数据docs/LOCAL_AI_PRIMER.md —— 本地 AI 零基础入门硬件、引擎、量化白话讲解docs/COMPARISONS.md —— 自托管 vs 云端 API 的对比docs/TROUBLESHOOTING.md 与 docs/FAQ.md —— 排障手册models/ —— 全部模型 × 引擎 × 拓扑的 compose 配置目录BENCHMARKS.md —— 每一行实测数字的出处【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考