如何用 VoxCPM 实现多语言语音合成与音色克隆:从安装到微调的实操指南 📅 2026/8/24 21:20:43 如何用 VoxCPM 实现多语言语音合成与音色克隆从安装到微调的实操指南【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM 是一个不依赖离散语音分词器tokenizer-free的端到端语音合成系统输入任意文本即可直接渲染出自然语音。当前主力版本 VoxCPM2 参数量 2B在超过 200 万小时的多语言语料上训练支持 30 种语言、声音设计、可控音色克隆并原生输出 48kHz 音频。本文按先看清产出、再讲原理、最后上手的顺序整理安装、调用与微调的完整路径。一、先说结果你能拿到什么样的语音在动手前先把 VoxCPM 能交付的东西列清楚后面每一步都是围绕它们展开。三种生成模式模式需要参考音频输入产出声音设计Voice Design否自然语言音色描述 目标文本全新音色可控克隆Controllable Cloning是参考音频 可选风格指令 目标文本保留原音色、可调语速/情绪的语音极致克隆Ultimate Cloning是还需文字稿参考音频 对应文字 目标文本音频续写最大限度还原音色细节几个关键规格决定它适不适合你的场景覆盖 30 种语言及四川话、粤语、吴语等部分中文方言输入文本无需手动标注语言输出采样率 48kHz参考音频可以是 16kHz内置上采样无需外接超分RTX 4090 上 RTF 约 0.3配合 Nano-vLLM 可压到约 0.13支持流式生成代码与权重均为 Apache-2.0 许可免费且可商用。如果只是把一段文字念出来用默认的声音设计即可只有要用某个人的声音念时才需要进入克隆相关模式。二、它和先切音素再拼语音的常规做法差在哪多数传统 TTS 走的是文本 → 离散语音 token → 声学模型 → 波形的流水线离散化会在信息上留一道缝。VoxCPM 属于 tokenizer-free 路线文本直接进入扩散自回归模型全程在 AudioVAE V2 的潜空间里生成连续语音表征再解码成波形。整条链路分四段LocEnc → TSLM → RALM → LocDiT底座是 MiniCPM-4。因为不做离散 token 化韵律和表现力的上限更高这也是它在 InstructTTSEval 这类按指令设计音色的评测里能拿到头部分数的原因。维度离散 token 流水线VoxCPMtokenizer-free中间表征离散语音 token连续潜空间表征信息损失有量化/离散化损失无韵律上限受 token 分辨率限制更高输出采样率常见 16–24kHz原生 48kHz三、首次运行安装、加载与第一个语音文件3.1 安装与硬件前提pip install voxcpm环境要求 Python ≥3.10 且 3.13、PyTorch ≥2.5.0、CUDA ≥12.0。VoxCPM2 推理约需 8GB 显存没有 NVIDIA 显卡时命令行与 Web 界面支持cpu、mpsApple Silicon等设备。3.2 用 Python API 跑通第一条音频from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate( text这是一条由 VoxCPM2 合成的多语言语音。, cfg_value2.0, inference_timesteps10, seed42, ) sf.write(demo.wav, wav, model.tts_model.sample_rate)两个常用参数值得记住cfg_value是引导强度推荐 1.0–3.0inference_timesteps是扩散步数推荐 4–30越大越稳但越慢。固定seed可以让结果更可复现。3.3 命令行与本地 Web 界面不想写 Python 时CLI 覆盖了同样能力voxcpm design --text 你好VoxCPM。 --output out.wav voxcpm clone --text 这是一段克隆语音。 --reference-audio ref.wav --output out.wav voxcpm batch --input texts.txt --output-dir outs想要图形界面时直接起 Web 应用再开浏览器python app.py --port 8808 # 打开 http://localhost:8808 python app.py --device auto # 自动选择 cuda / mps / cpu四、声音设计、可控克隆与极致克隆指令怎么下三种模式共用同一个generate接口差别只在传不传参考音频、以及是否给文字稿。4.1 声音设计只给描述不给音频把音色描述用半角括号放在文本开头即可无需任何参考音频wav model.generate( text(一位年轻女性声音温柔甜美)欢迎使用 VoxCPM2, cfg_value2.0, inference_timesteps10, seed42, )描述里可写性别、年龄、语气、情绪、语速等CLI 下则用--control传这段描述。4.2 可控克隆参考音频 风格指令传一段参考音频锁定音色再用指令调整表达方式wav model.generate( text(语速稍快语气轻快)这是带风格控制的可控克隆结果。, reference_wav_pathpath/to/voice.wav, cfg_value2.0, inference_timesteps10, seed42, )注意参考音频走的是reference_wav_path且该模式仅 VoxCPM2 支持。4.3 极致克隆音频续写同时提供参考音频和它的文字稿模型把它当作已经说出的前文继续往下说还原度最高。为了最大化相似度可把同一片段同时传给prompt_wav_path和reference_wav_pathwav model.generate( text这是极致克隆的续写结果。, prompt_wav_pathpath/to/voice.wav, prompt_text参考音频对应的文字稿。, reference_wav_pathpath/to/voice.wav, )三种模式里极致克隆会禁用风格指令因为续写本身已经接管了表达。五、用自己的数据微调从标注清单到 LoRA 权重官方说法是 5–10 分钟音频就足以让模型适配某个特定说话人、语言或领域。微调分 LoRA参数高效推荐和全量 SFT 两条路。5.1 准备 JSONL 训练清单每行一个 JSON 对象至少包含音频路径和文本{audio: data/audio1.wav, text: 这条音频对应的文字。, duration: 3.5}duration是可选字段填了能在过滤阶段少加载一次音频多数据集训练时可加dataset_id区分。仓库里examples/train_data_example.jsonl有一份可直接参考的样例。5.2 启动训练先克隆仓库拿到训练脚本与配置git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM# LoRA 微调推荐 python scripts/train_voxcpm_finetune.py --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml # 全量微调 python scripts/train_voxcpm_finetune.py --config_path conf/voxcpm_v2/voxcpm_finetune_all.yaml配置里的sample_rate必须与 AudioVAE 编码器一致默认 16000out_sample_rate为 48000LoRA 默认r32、alpha32。想边训边试效果可以起训练 WebUIpython lora_ft_webui.py # 打开 http://localhost:7860六、部署、性能与实测中的参数经验这一节把实际跑下来会反复碰到的点记一下避免踩重复的坑。显存与速度VoxCPM2 推理约 8GB 显存。追求吞吐时用 Nano-vLLM 或 vLLM-Omni 这类推理引擎RTF 能从约 0.3 降到约 0.13后者还提供 OpenAI 兼容的/v1/audio/speech接口方便多租户部署。设备选择命令行和 Web 都支持--device取值auto / cpu / mps / cuda / cuda:NApple Silicon 上auto会自动走 MPS。稳定性声音设计和可控克隆的结果可能随运行波动官方建议对不满意的音色多生成 1–3 次再挑固定seed有助于对比但不保证逐位复现。边界官方支持 30 种语言列表外的语言可自行测试或用自有数据微调补齐reference_wav_path参考克隆仅 VoxCPM2 可用。合规音色克隆能生成高度逼真的合成语音官方明确禁止用于冒充、欺诈或虚假信息落地时建议对 AI 生成内容做标识。下一步先按第三节跑通demo.wav确认设备与显存满足要求需要固定音色时准备一段 10 秒左右的干净参考音频试一次可控克隆要长期用某个特定说话人就按第五节备 5–10 分钟数据做一次 LoRA 微调。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考