【免费下载链接】local-studioControl panel for VLLM, Sglang, llama.cpp, exllamav3项目地址https://gitcode.com/gh_mirrors/vl/local-studio点击查看免费下载Local Studio 是一款本地优先的 LLM 工作站把 vLLM、SGLang、llama.cpp、MLX 等自托管推理引擎的部署、监控与对话统一在一个界面里完成。只需 5 步你就能在自己的机器上跑起本地大模型、实时查看 GPU 状态并用 OpenAI 兼容 API 或内置 Workbench 发起对话——无论用的是 NVIDIA 显卡还是 Apple Silicon 芯片这份完整指南都能带你顺利上手。第 1 步安装并启动 Local Studio Local Studio 由两个共享同一套 Controller API 的模块组成controller/ — Bun/Hono 后端负责模型生命周期启动、停止、配方、下载、OpenAI 兼容代理、GPU 指标与日志frontend/ — Next.js React 界面以及 macOS 上的 Electron 桌面壳macOS 用户一键桌面版下载官方签名 DMG 双击安装即可安装脚本会自动备份旧版本并支持回滚应用还会自动检查更新。Linux / macOS 源码安装前置工具链Bun 1.3.14、Node.js 22.19、Python 3.10、Git推荐安装uvgit clone https://gitcode.com/gh_mirrors/vl/local-studio cd local-studio npm run doctor # 校验工具链 npm run setup # 按锁文件一次性安装全部工作区依赖然后在两个终端分别启动详见 README.mdbun --cwd controller run dev # 控制器监听 127.0.0.1:8080 npm run dev # 前端监听 127.0.0.1:3000浏览器打开http://localhost:3000/setup设置向导会自动出现。第 2 步识别硬件并一键安装推理引擎 ️向导第一步会展示这台机器的 CPU、内存、GPU、显存VRAM四行关键指标然后根据平台提供受管运行时的免配置安装平台推荐引擎NVIDIA 显卡Linux CUDA 驱动vLLM / SGLang / llama.cppApple SiliconMLX 后端引擎会安装为受管虚拟环境数据目录下的runtime/venvs/backend-latest不需要你手动折腾 Python 环境llama.cpp 走 GGUF 模型MLX 走mlx_lm.server全部由控制器统一调度。 项目在 frontend/public/images/hardware/ 收录了从 RTX 3090 到 RTX Pro 6000 的 14 款 NVIDIA 显卡以及 DGX Spark、Mac Studio、Mac mini 等整机官方图方便你对号入座估算显存预算。第 3 步下载并启动本地模型 ⚡模型选择页不是简单甩一个目录而是基准测试驱动的推荐逻辑Recommended— 按真实测量结果展示能装进你这台机器的模型按 1.5 倍内存余量筛选并标注预期解码速度tok/s与适配引擎Search Hugging Face— 搜索下载任意开源模型Downloads— 下载任务管理支持暂停 / 恢复 / 取消下载 → 服务 → 验证三步是同一个实时清单逐行自动打勾看着它一步步活起来。全部完成后一键启动模型还可以立即跑一次 benchmark直接看到 tok/s 成绩。模型适配规则记录在 docs/models-catalog.md模型权重最多占用内存池的 70%其余留给 KV 缓存、激活值与运行时本身。第 4 步实时监控系统与 GPU 状态 首页就是Status 仪表盘frontend/src/features/dashboard/四块内容一屏掌握控制器矩阵— 本地或远程 GPU 机上每个控制器的在线状态模型状态区— 当前进程、当前配方以及启动 / 停止 / benchmark 操作GPU 区— 利用率、显存占用等实时指标运行时 / 活动条— 运行环境状态与最近活动所有指标通过 SSE 事件流实时推送controller/src/modules/system/无需手动刷新。第 5 步与本地模型对话 方式一内置 Workbench。打开/agent页面frontend/src/features/agent/直接和刚启动的模型流式对话支持工具调用、文件读写与终端面板。方式二OpenAI 兼容 API。控制器本身就是标准 OpenAI 兼容代理controller/src/modules/proxy/把任意客户端的 Base URL 指向它即可OPENAI_BASE_URLhttp://127.0.0.1:8080/v1可用端点详见 controller/README.md端点用途GET /v1/models列出可用模型POST /v1/chat/completions聊天补全POST /v1/responsesOpenAI Responses API 透传POST /v1/messagesAnthropic Messages API 透传用量统计你的机器都干了什么 /usage页面frontend/src/features/usage/用四个标签页呈现Models— 每个模型被要求做什么、跑得多快prefill / decode 速度、首 token 时延Activity— 按小时 / 按天的 Token 活跃度热力图Controller— 控制器每个路由的请求量与状态码Errors— 最近的失败请求与工具调用附控制器实际记录的错误信息常见问题 ❓消费级显卡能跑吗能。Nano 档位见 controller/contracts/model-index.json专为单张消费级显卡设计Qwen 9B 级别的模型在 RTX 4090 这类显卡上即可流畅推理。手机能访问吗可以。Local Studio 2.9.0 在「Settings → Profile phone」扫码即可与 KittyLitter 应用配对需 KittyLitter 1.6.0iPhone / iPad / Android 上查看同一套 agent 会话与流式内容。能管理远程 GPU 机吗能。在远端设置LOCAL_STUDIO_HOST0.0.0.0与LOCAL_STUDIO_API_KEYREADME.md前端通过BACKEND_URL指向它控制器安装器会自动注册为用户级系统服务登录后自动拉起。继续深入核心模块速查 模块说明controller/后端模型生命周期、OpenAI 兼容代理、系统状态与 SSEfrontend/src/features/setup/首次运行设置向导frontend/src/features/dashboard/Status 仪表盘与控制面板frontend/src/features/recipes/模型目录、配方与下载管理frontend/src/features/agent/Workbench agent 会话界面docs/models-catalog.md模型目录与显存适配规则按这 5 步走完你的本地 LLM 就同时具备了部署、监控、对话三件套——剩下的就是挑选更合适的模型和配方了。赞分享【免费下载链接】local-studioControl panel for VLLM, Sglang, llama.cpp, exllamav3项目地址https://gitcode.com/gh_mirrors/vl/local-studio点击查看免费下载相关推荐本地LLM与MCP-Agent集成5步快速部署完整指南本地LLM与MCP Agent集成5步快速部署完整指南 在AI应用开发中数据隐私和成本控制成为企业关注的核心问题。MCP Agent框架通过统一接口设计让人工智能AI AgentAgent 框架MCP ClientsAgent 工作流AI视频生成的终极本地部署指南5步快速上手AI视频生成的终极本地部署指南5步快速上手 想要在本地环境中搭建强大的AI视频生成工具吗HeyGem.ai作为一款支持完全本地部署的AI视频生成平台能够通人工智能AI 应用数字人媒体生成桌面应用原神API高级用法过滤、搜索和批量获取数据的技巧原神API高级用法过滤、搜索和批量获取数据的技巧 想要快速获取原神游戏数据并构建自己的应用吗这个开源的原神API项目为你提供了完整的游戏数据接口✨ 本文将后端创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考