如何用一次普通话录音,做出会说三种方言的AI播客?

📅 2026/8/17 21:50:44
如何用一次普通话录音,做出会说三种方言的AI播客?
如何用一次普通话录音做出会说三种方言的AI播客【免费下载链接】SoulX-PodcastSoulX-Podcast is an inference codebase by the Soul AI team for generating high-fidelity podcasts from text.项目地址: https://gitcode.com/gh_mirrors/so/SoulX-Podcast你有没有遇到过这样的尴尬辛苦录好的播客只能覆盖说普通话的听众想给外地同事、家乡长辈也做一版听得亲切的内容却请不起方言配音。而SoulX-Podcast这个开源的高保真语音合成项目正在把这件事变得像复制粘贴一样简单——只需一段普通话音频它就能生成同样音色的四川话、河南话、粤语甚至让两个 AI 角色像真人一样自然对谈。一个困扰电台主播的真实问题我认识一位地方台的编辑每周要为一档科普栏目配三种版本普通话版、方言版、还有面向老人的慢速版。每多一个版本就意味着多一次约棚、多一位配音、多一轮审听。她经常开玩笑说要是 AI 能替我说话就好了。 如今这句玩笑话真的被 SoulX-Podcast 变成了现实——它是一款面向多说话人播客场景的开源语音合成系统支持普通话、英语以及四川话、河南话、粤语三种中文方言主打跨方言零样本声音克隆与副语言控制笑声、叹气、呼吸等。听起来是不是有点意思往下看。三分钟跑通先把第一期节目做出来别急着研究原理我们直接上手。整个过程只需要三步硬件上有一块 8GB 显存以上的 NVIDIA 显卡体验最佳纯 CPU 也可以先跑起来试试。# 1. 克隆项目并安装依赖 git clone https://gitcode.com/gh_mirrors/so/SoulX-Podcast cd SoulX-Podcast conda create -n soulxpodcast python3.11 -y conda activate soulxpodcast pip install -r requirements.txt # 2. 下载基础模型普通话 英语 huggingface-cli download --resume-download Soul-AILab/SoulX-Podcast-1.7B \ --local-dir pretrained_models/SoulX-Podcast-1.7B # 3. 启动 Web 界面 python3 webui.py --model_path pretrained_models/SoulX-Podcast-1.7B启动后打开http://localhost:7860你会看到一个双人对话界面左右两侧分别上传两位说话人的参考语音和文本中间填对话稿点合成即可得到音频。想立刻听效果界面上自带了普通话和三种方言的播客模板示例一键加载就能试听。想试试命令行跑批量脚本也可以直接执行官方示例bash example/infer_dialogue.sh产出文件会保存在outputs/目录下。对应脚本模板见 example/podcast_script/script_mandarin.json。一张图看懂它到底强在哪把 SoulX-Podcast 和市面上常见的单说话人 TTS语音合成工具放在一起差异一目了然能力维度传统单说话人 TTS普通多语言 TTSSoulX-Podcast跨方言零样本声音克隆❌ 不支持部分支持需逐语言训练✅ 一次录音多方言复用多说话人自然对话播客❌ 仅独白⚠️ 需拼接音色✅ 原生支持多轮对谈副语言控制笑声/叹气等❌❌✅ 内置五种事件标签长文本长格式生成⚠️ 易失真⚠️ 易失真✅ 面向播客专门设计其中零样本声音克隆的意思是你不必为每个方言分别录音训练只用一小段参考音频就能迁移音色。官方示例里的参考音频最短的只有10 秒左右——也就是说你随手录一段自我介绍就够用了。在说话人相似度、语音质量和可懂度这些关键指标上官方也给出了与同类模型的对比数据。下方雷达图中红色曲线代表 SoulX-Podcast在多数维度都处于领先位置谁在用它四个真实场景 教育工作者把同一堂科普课用普通话、英语和当地方言各生成一版发到班级群和家校群孩子们各听各的接受度明显更高。点睛多语言教学材料的成本第一次降到了一键生成。 有声书与广播剧爱好者一个人分饰四五个角色全靠给每个角色分配不同的参考音频。点睛一个人就是一支配音团队。 企业培训负责人总部的安全培训课件转成各分支机构的当地方言版本员工听课时的代入感强了不少。点睛不必再为每个地区单独录素材。 自媒体创作者用固定音色建立个人 IP再按选题切换普通话或方言版本一条内容覆盖多种受众。点睛声音是可以复用的资产。每个场景背后都是同一套能力方言克隆、多角色对谈、副语言加持。不写代码也能懂的原理把跨方言声音克隆想象成临摹签名你给出一份自己的签名样本参考音频系统学会笔迹特点后就能用不同的字体风格方言写出来——笔迹还是你的风格可以换。再通俗一点讲参考音频像一张声音身份证负责锁定音色方言提示词像一句开场提示告诉模型本次要切换到哪种方言口音副语言标签像剧本里的舞台提示比如在文本里插入|laughter|就能加入笑声让对话不那么播音腔。如果你愿意多了解一点核心采样参数也很直观from soulxpodcast.config import Config, SamplingParams config Config(modelpretrained_models/SoulX-Podcast-1.7B) sampling_params SamplingParams(temperature0.6, top_p0.9)temperature控制创造性top_p控制连贯性。看不懂也没关系——Web 界面里默认值已经调好直接点合成就行这部分完全可以跳过。项目支持 24kHz 采样率的 WAV 输出接近常见播客的音质标准。开源协议与社区生态项目采用Apache 2.0 协议代码和模型权重都可以自由使用、修改和商用对独立开发者和企业都很友好。社区方面团队发布了配套技术报告《SoulX-Podcast: Towards Realistic Long-form Podcasts with Dialectal and Paralinguistic Diversity》供研究参考在 Hugging Face 上提供在线 Demo 和模型仓库官方维护的技术交流群也欢迎新用户加入遇到问题可以直接和开发者交流。接下来的路线图也值得期待短期支持更多中国方言与少数民族语言、优化推理速度、扩充副语言标签中期实时流式生成、视频播客、个性化声音定制。方言提示词的样例数据已随仓库提供可参考 example/dialect_prompt/sichuan.txt 查看四川话的思维链写法。新手最关心的六个问题Q1最低需要什么配置四核以上 CPU、16GB 内存、约 10GB 可用磁盘存放模型推荐 NVIDIA GPU8GB 显存以上以获得更好体验。Q2参考音频要录多长、有什么讲究官方示例最短约 10 秒即可。建议选背景噪音小、发音清晰的片段效果会明显更好。Q3怎么让两个角色聊起来在对话文本里用[S1]、[S2]标注说话人轮流发言即可界面的播客模板里就有现成例子。Q4基础模型和方言模型有什么区别基础模型覆盖普通话和英语方言模型SoulX-Podcast-1.7B-dialect额外支持四川话、河南话、粤语。Q5生成一段音频要等多久在 RTX 3060 这类常见消费级显卡上生成耗时约为实时时长的 1.52 倍即 10 分钟播客约需 1520 分钟。Q6生成的声音能商用吗可以Apache 2.0 允许商业使用。但提醒一句如果参考音频来自他人务必先获得本人授权。从今天开始做出你的第一个方言播客回到开头那位电台编辑的故事——现在她只需要录一段普通话自我介绍剩下的四川话版、河南话版、粤语版交给 SoulX-Podcast 就能在几十分钟内全部完成。这条路其实你也可以走克隆项目、下载模型、打开网页、填一段对话稿四步之后属于你的方言播客就诞生了。最好的学习方式就是动手今晚就试试吧。让文字会说话让方言被听见——你的第一期节目也许就藏在一次小小的点击里。【免费下载链接】SoulX-PodcastSoulX-Podcast is an inference codebase by the Soul AI team for generating high-fidelity podcasts from text.项目地址: https://gitcode.com/gh_mirrors/so/SoulX-Podcast创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考