三行代码生成 LRC 字幕:OpenLRC 音频转录翻译完整指南

📅 2026/8/22 13:27:06
三行代码生成 LRC 字幕:OpenLRC 音频转录翻译完整指南
三行代码生成 LRC 字幕OpenLRC 音频转录翻译完整指南【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc给播客或歌曲做带时间轴的字幕过去是件苦差事先逐句听写文字再回去对齐时间戳一小时的音频少说要折腾一下午。OpenLRC 把这条链路自动化了——它是一个开源的 Python 工具用 faster-whisper 做语音识别再交给 GPT、Claude 这类 LLM 做翻译输入音频文件输出的就是可直接放进播放器滚动的 LRC 字幕。从一份播客说起手工两小时现在十分钟假设你录完了一期英文播客想放出带中文字幕的版本。传统做法是听一遍、打一遍字然后把每句的时间戳手动填进字幕文件错一句就得重听一段。更麻烦的是纯靠 Whisper 直接转写还容易出现幻觉——音频有噪声或音量忽大忽小时它会凭空编出句子。OpenLRC 的思路是在转写前先做一遍预处理响度归一化压平音量需要时再跑降噪可选把难听清的音频先变成听得清的再交给 faster-whisper。转写结果带有词级时间戳后面所有对齐问题都由时间戳自动解决人只负责检查。它到底在做什么核心流程是一句话LRCer.run()一次调用完成预处理 → 转录 → 翻译 → 生成字幕四步。转录阶段用 faster-whisper 输出带词级时间戳的文本翻译阶段按段落顺序调用 LLM并且保留上下文所以长文本里的人名、指代不会前后矛盾最后由字幕引擎生成 LRC视频输入则自动生成 SRT还能一键输出双语字幕。多文件场景下转录是串行的翻译会多线程并行跑批量处理不会很慢。想深入看实现openlrc/openlrc.py 里的LRCer类是整条流水线的调度中心配合 openlrc/translate.py 的翻译逻辑基本能覆盖主要路径。两步拿到你的第一个 LRC 文件先装好依赖faster-whisper需要 ffmpegGPU 环境还需要 CUDA 相关库没有 GPU 也能跑只是慢些翻译需要一个 LLM 的 API Key比如OPENAI_API_KEY设为环境变量即可。pip install openlrc然后 Python 里三行搞定from openlrc import LRCer lrcer LRCer() lrcer.run(./data/test.mp3, target_langzh-cn)跑完同目录就会出现test.lrc。不想写代码的话项目自带 Streamlit 界面streamlit run openlrc/gui_streamlit/home.py几个真正做得细的地方翻译不是逐句孤翻。同一文件内的段落按顺序翻译上下文会带给模型比一句一请求的脚本连贯得多还支持术语表glossary把aoe4: 帝国时代4这种映射写进 JSON专有名词就不会被机翻成奇怪的东西。Lean 翻译模式省 token。可以配便宜模型做机翻 大模型做校对的混合架构对长时间音频来说成本差异明显。README 里给过一笔账用gpt-4o-mini这类小模型一小时的音频翻译费用大约一美分。成本有闸门。TranslationConfig提供fee_limit超预算会停批量跑之前值得设一下。导入很轻。只 import 配置类和LRCer时torch、spacy、faster-whisper 这些重依赖不会提前加载用到哪一步才加载哪一步作为库嵌进自己的项目时启动很快。适合谁用以及它管不了什么适合的音乐人、播客主、语言学习者、视频剪辑师基本是有音频、要字幕、想省事的三类人。要留意的边界翻译必须走 LLM API需要自备 Key 并承担 token 费用需要降噪noise_suppressTrue时要装openlrc[full]会带进 torch 和 DeepFilterNet体积不小语言支持受底层 spacy 分句模型限制实际支持约 25 种主流语言冷门语言慎用背景音乐很重的录音预处理能帮忙但别指望它做人声与音乐分离——这条在作者自己的 TODO 里还没做。下一步建议先用一段两分钟的音频试跑把skip_trans、bilingual_sub、clear_temp这几个开关各摸一遍基本就知道它能怎么帮你。想继续往下挖LRCer.run()的 docstring 和defaults.py里的 ASR/VAD 默认参数是理解行为细节的捷径。【免费下载链接】openlrcTranscribe and translate voice into LRC file using Whisper and LLMs (GPT, Claude, et,al). 使用whisper和LLM(GPTClaude等)来转录、翻译你的音频为字幕文件。项目地址: https://gitcode.com/gh_mirrors/op/openlrc创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考