不上云 API,本地硬件跑通 AI 虚拟主播:Neuro 项目实操指南

📅 2026/8/26 20:03:53
不上云 API,本地硬件跑通 AI 虚拟主播:Neuro 项目实操指南
不上云 API本地硬件跑通 AI 虚拟主播Neuro 项目实操指南【免费下载链接】NeuroA recreation of Neuro-Sama originally created in 7 days.项目地址: https://gitcode.com/gh_mirrors/neuro6/NeuroNeuro 是一个开源 AI 虚拟主播项目把语音识别、大模型对话、语音合成全部跑在自己的电脑上在消费级硬件上还原一个能实时语音互动的主播。本文写给想搭本地语音 VTuber、没有高端显卡、又不想付云 API 费的读者。 直播里为什么需要一个会说话的主播直播内容最怕冷场主播离开十分钟公屏就安静下来。一个 AI 虚拟主播能接住每一条弹幕还能用语音和真人主播闲聊跨场直播保持同一个人格。Neuro 用 7 天完成开发证明了这件事用消费级硬件就能做——没有云 API模型全部本地运行。 Neuro 能做什么六项主要能力一句话定位Neuro 是本地大模型、语音模型与直播平台之间的调度器每个环节都可替换。✓ 实时语音对话Whisper 系流式识别边说边转写XTTSv2 语音合成支持声音克隆双向对话延迟低✓ Twitch 弹幕互动读取聊天、识别频道、语音实时回复支持黑名单过滤✓ 记忆系统自动把对话要点提炼进向量库重启后仍可召回也支持手动添加长期记忆✓ 音频播放播放预生成的背景音乐或翻唱曲目✓ VTube Studio 形象控制口型联动、表情热键、预设场景切换✓ 模块化架构每个功能都是独立线程模块加一个文件即可扩展官方演示截图中虚拟形象、左侧聊天面板与右侧 Twitch 弹幕栏同时工作——这就是本地 AI 虚拟主播的典型形态。 部署前环境速查项目要求说明GPUNVIDIA显存至少 12GB作者实测环境为 RTX 4070显存不足可换更小的量化模型CPU / 内存Ryzen 7 级 CPU、32GB 内存作者开发机参考值系统Windows 11开发环境Python 3.11 必需建议用虚拟环境PyTorch2.2.2 CUDA 11.8需先单独安装装完依赖后确认没被覆盖LLM 运行时单独安装并启动 text-generation-webui必须开启 OpenAI 兼容 API 扩展麦克风 / 音箱各一个用项目内工具脚本确认设备编号 安装与首次运行4 步走通第 1 步装依赖。先装 PyTorch再装项目依赖git clone https://gitcode.com/gh_mirrors/neuro6/Neuro cd Neuro python -m venv venv source venv/bin/activate pip install torch2.2.2 torchvision0.17.2 torchaudio2.2.2 --index-url https://download.pytorch.org/whl/cu118 pip install -r requirements.txt完成信号执行pip listtorch 与 torchaudio 仍是 2.2.2cu118没有被覆盖。第 2 步准备配置文件。参考.env.example创建.env填入 Twitch 应用凭据与 Huggingface token往 voices/ 目录放一个 5~30 秒的 .wav 参考人声。TWITCH_APP_ID你的应用ID TWITCH_SECRET你的应用密钥 TWITCH_CHANNEL你的频道名 HF_TOKEN你的Huggingface令牌完成信号.env 各字段填齐voices/ 里有一个参考人声文件。第 3 步设设备与人格。运行python utils/listAudioDevices.py记下麦克风与音箱编号再到 constants.py 里逐条修改标记为 #UNIQUE# 的字段设备编号、频道名、人声文件名、你的名字和 AI 的名字。SYSTEM_PROMPT 里写人格设定与对话示例注意它不能超过上下文长度。完成信号所有 #UNIQUE# 字段都换成了你自己的值。第 4 步启动并接入。先启动 text-generation-webui在 Session 页开启 OpenAI API 扩展并加载模型推荐 Llama 3 8B 的量化版再在项目目录执行python main.py。会弹出 Twitch 授权页确认后 STT 与 TTS 模型开始加载。完成信号终端打印 SYSTEM READY——此后即可开口对话。️ 功能体验从对话到记忆语音对话。这是使用频率最高的部分。说话时流式转写在后台进行话音落下几乎立刻出文字回复由 TTS 边合成边播放不用等完整句子。只要第 3 步设备编号填对启动后就能直接聊。Twitch 弹幕互动。Twitch 模块默认关闭。填好频道与凭据后从控制面板启用即可超过 TWITCH_MAX_MESSAGE_LENGTH 的超长消息会被丢弃敏感词由 blacklist.txt 过滤。记忆。记忆模块默认开启每隔几条消息模型会把对话提炼成问答对存入向量库对话中相关内容自动召回重启也不丢。想加固定设定比如我最爱喝芒果冰沙直接编辑 memories/ 下的初始记忆文件数据库为空时会自动加载格式细节见 memories/readme.md。背景音乐与翻唱。音频播放器模块默认开启把音频文件放入 songs/ 目录即可触发播放适合放预生成的翻唱。多模态视觉。默认关闭。在 constants.py 的 MULTIMODAL_ENDPOINT 填入本地多模态模型服务地址作者用 MiniCPM-V int4约占 8GB 显存后系统会自动截图让模型看屏幕内容并纳入对话上下文。控制面板。项目用 socket.io 连接一个网页控制面板默认 8080 端口可管理各模块、更新黑名单、触发动画面板是独立的前端项目按 README 指引部署即可。 真实上场三个实战场景场景一开一场 Twitch 直播。1在 Twitch 开发者后台创建应用回调地址填http://localhost:17563凭据写入 .env2首次启动完成授权后启用 Twitch 模块3把虚拟形象画面用 Spout2 接入 OBS 开播。真人负责出镜AI 负责接住弹幕。场景二接 VTube Studio 虚拟形象。1安装 VTube Studio 与模型作者用 Hiyori系统装一条虚拟音频线2把 TTS 输出送进虚拟线在 VTube Studio 里以虚拟线为麦克风把嘴部参数挂到麦克风音量上3在 constants.py 调 VTUBE_MODEL_POSITIONS 预设位置匹配你的直播构图。口型会随音量自动开合控制面板还配了热键与场景切换按钮。场景三写一个自己的模块。1在 modules/ 下新建 Python 文件继承 Module 基类2实现 run() 方法通过共享的 signals 对象读写对话与事件状态3需要向大模型喂信息时实现 get_prompt_injection() 返回注入文本与优先级。每个模块独立线程运行CtrlC 时自行清理退出。 排障速查出问题时先查这里现象可能原因解决办法启动后 torch 报 CUDA 不匹配requirements.txt 覆盖了 PyTorch 版本按第 1 步重装 cu118 版pip list 确认 2.2.2装依赖时大量版本冲突项目未完全锁版本对照 pipfreeze.txt 里作者实测过的组合听不见 / 找不到麦克风设备编号填错重跑 utils/listAudioDevices.py把正确编号写回 constants.pyTTS 加载报 DeepSpeed 错误DeepSpeed 需单独安装按 AllTalkTTS 说明装对应版本或直接下载其官方 wheel加载 Llama 3 报 401受限模型未带 token.env 填 HF_TOKEN且 Huggingface 账号已同意模型条款AI 响应很慢上下文过长或模型过大调低 CONTEXT_SIZE换 4-bit 量化模型输出偶发不当内容本地模型无护栏敏感词加进 blacklist.txt注意可能引发平台封禁风险自担 资源与下一步README.md完整安装说明、架构拆解与免责声明部署前先读一遍constants.py全部开关的中枢#UNIQUE# 标记字段必须改成自己的值Neuro.yaml一份完整的人设配置示例写 SYSTEM_PROMPT 时可直接参考memories/readme.md记忆格式与导入导出机制modules/内置模块源码扩展功能时最好的参照如果显存只有 12GB建议先跑通语音对话 弹幕互动这条主线再逐步叠加多模态与虚拟形象。项目本身 7 天写成代码短而直白通读一遍源码就是掌握这个本地 AI 虚拟主播最快的方式。【免费下载链接】NeuroA recreation of Neuro-Sama originally created in 7 days.项目地址: https://gitcode.com/gh_mirrors/neuro6/Neuro创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考