εar-VAE:回归听觉感知的高保真音乐重建

📅 2026/7/29 15:48:02
εar-VAE:回归听觉感知的高保真音乐重建
良好的音频生成范式大概的确需要 latent。待压缩的音频无论取 patch 还是 STFT从无到有的新 dim本质上都承担着时域压缩的功能但音频在不同时间尺度下有无法归纳的 semantic 周期在频域做 polar 或原始 complex 的各种变换也始终找不到 RGB 那样轮换对称的、优雅的信息形式。既然压缩范式趋于稳定那么在等效的权重大小和正则化手段下acoustic 质量或许只能从监督的视角抠一点信息余量出来。这是我们工作的出发点我们希望音频的编解码是压缩毛巾而不是压缩饼干——水分挤得出去还要还原得回来。具体而言现有开源模型的训练目标在三个地方与听觉感知脱节。一是感知加权缺席人耳对中高频敏感、对低频迟钝逐频带等权的误差对二者一视同仁模型容量被浪费在耳朵并不在意的细节上。二是相位无人监督瞬态与清晰度写在相位随时间与频率的变化里缺乏约束就出现瞬态涂抹与电流声。三是空间信息被压扁左右声道间的相位差IPD是中低频声像定位的物理依据缺少监督声场扁平、声像漂移。εar-VAE 围绕这三点设计44.1 kHz 立体声1024 倍压缩141M 参数。本文先讲各处设计的动机定量结果统一放在第四部分。⏩一、架构非对称生成器与判别器的减法1.1 生成器两处关键的取舍生成器采用编码器-解码器结构骨架沿用 Stable-Audio-Open 的 VAE编码器用 5 层步幅卷积逐级下采样strides 为 [2,4,4,4,8]总压缩率 1024 倍。激活函数选 SnakeBeta——它给网络注入周期归纳偏置我们的实验里优于 ELU 和 LeakyReLU。第一处取舍在上采样方式。转置卷积和上采样卷积都能完成放大后者的高频略精细但整体响度和能量掉得明显前者牺牲少量高频分辨率换来充沛得多的能量。音乐重建里响度一掉耳朵立刻知道我们选了转置卷积。所有卷积层做权重归一化解码器输出沿用 SAO 的做法不接 tanh它会引入谐波失真。第二处取舍在 Transformer 的位置。Mimi 等模型在编码器和解码器两端都插入 Transformer横跨整个瓶颈我们在音乐信号上的实验发现把 Transformer 全部集中在解码端效果最好。解释也直接编码端的卷积先把局部时频特征提炼成鲁棒的表示解码端的 self-attention 再在合成阶段建模跨频带的长程和声依赖。瓶颈处共两层带 RoPE 位置编码的 Transformer。εar-VAE 总体架构图 1εar-VAE 总体架构卷积编解码器、Transformer 瓶颈与 MS-STFT 判别器重建损失经 K-weight 滤波后在感知域计算。1.2 判别器两处减法及其依据判别器只保留多分辨率 STFT 判别器窗长 [2048,1024,512,256,128]hop 为窗长的四分之一做了两处减法。弃用 MPD。MPD 为语音里稳定的周期模式设计但音乐的速度与节奏型千变万化MPD 对 period 参数高度敏感没法在所有速度的乐曲上给出稳定判别。更要紧的是实验发现它会在立体声声场中引发乐器定位的混乱。多尺度 STFT 判别器本身已经足够鲁棒MPD 在这里是多余的。弃用 CQT 判别器。BigVGAN-v2 等工作用 CQT 做补充判别但 CQT 的对数频率刻度带来强烈的旋律归纳偏置使判别器成了事实上的旋律专家。训练前中期生成器确实更快学会旋律线条代价是过多容量被分给旋律而打击乐瞬态、混响尾音、空间信息这些在 CQT 域里不显著的成分被系统性忽视模型最终收敛到更低的上限。STFT 的频响更均匀、没有音乐偏好逼着生成器均衡地重建信号的所有成分。⏩二、损失函数把感知写进优化目标2.1 K-weighting一条老生不常谈的曲线K-weighting 是个老生不常谈的东西。它本身朴实、先验却渗透进了现代数字音频工业的上下游——它被放在响度表里而等响之外人耳总是偏好更响的内容响度战争的演化便是佐证。这条低切高抛的滤波器由 ITU-R BS.17702006定义后被 EBU R128 采纳为响度测量的基石一级搁架式滤波器抬升中高频近似声音绕头部衍射产生的声学增益一级高通滤波器衰减低频来自 Soulodre 主观响度实验中与听感相关性最好的 RLB 曲线。我们把它放在所有基于 STFT 的重建损失幅度、相关、相位之前让误差在感知相关的域里计算。A-weighting 则大不一样——它之前活跃在 stable-audio-tools 的训练 recipe 里。可以清晰地观察到它几乎只留下保守的中低频和保守的中高频尽管低和高没有统一的定义因为它设计之初服务于噪声的量级计算而不是扩声。而高频恰是重建最困难、最需要误差信号引导的频段用 A-weighting模型在最难的地方只能拿到最弱的监督。K-weighting 与 A-weighting 曲线图 3K-weighting 与 A-weighting 曲线。A 曲线在 10 kHz 以上衰减K 曲线为搁架式抬升。这条曲线的每一级都有可解释的来源但为什么它适合作为重建损失的加权并没有现成答案——它为响度测量而生不为监督深度模型而生。我们的信心来自结果论数字音频走进人耳数十年听音习惯已经某种程度上天然拟合了这条曲线直到今天听觉消费对应的生产者们依然离不开响度表以及数字背后的这条曲线作为工程质量的参考。把误差搬进它定义的感知域是风险最小的先验。另一个设计点是K-weighting 只加在重建损失上不加在判别器路径上。原因有二。其一VAE 重参数化引入的噪声是全频段覆盖的如果所有损失都感知不到低频低频段的输出会停留在噪声状态——低频可以少管不能不管。其二重建损失是直接的样本级监督判别器的 GAN 损失和 feature-map 损失的引导相对间接加权要放在监督最直接的位置。2.2 相位另一个重灾区相位是另一个重灾区。对深度学习模型的监督范式而言信息向 stable-to-noise 收敛的痕迹在各方各面都有相位在这样的环境下尤其令人痛苦。从时间尺度看自然音频的相位在角度上具有连续性——30 度的上一刻不会和 90 度的下一刻接轨但时域上的震荡频率以 44.1 kHz 为例其速率对目前 1d 卷积的特征捕捉造成了巨大压力。从频率尺度看随着频率升高单位时间尺度下相位的震荡速率也在上升。时域变化剧烈频域变化不一直接对相位用 L1/L2 或余弦相似度是一个 ill-posed 的优化问题模型会优先拟合变化慢的中低频相位把高频相位整个放弃。我们寄希望于端到端的监督能强迫模型学到它尽力的部分于是不监督相位本身改为监督相位的两个一阶偏导IF 刻画相位沿时间的局部演化对应可感知的音高变化GD 刻画相位沿频率的变化对应各频率成分的时间对齐——瞬态是否锐利、起音是否整齐写在这里。Phase Loss 对真值与估计的 IF、GD 取 L1 距离权重所有相位差以 $2\pi 取模避开 \pm\pi$ 边界的跳变。电流声正是局部相位不光滑的产物监督变化率比监督绝对值稳定得多也更对口感知。配合 Phase Loss 的是 Correlation Loss求和号内是归一化的互功率谱提出相位差除以幅度乘积后简化为取实部即逐时频点鼓励相位对齐。两者分工明确Phase Loss 管相位沿时间、频率两个方向的平滑Correlation Loss 管频谱的相位一致尤其作用于和弦、泛音这类复音元素。2.3 MSLR幅度四路相位两路立体声有两种等价表示Left/Right 与 Mid/Side。我们借鉴混音工程中在这两个视角之间切换的做法但按监督对象做了区分这一区分的依据来自心理声学。双工理论duplex theory告诉我们中低频的声像定位主要靠相位与时间差高频则靠强度差立体声音乐的空间信息大量写在前者里落到信号上就是声道间相位差IPD。M/S 变换对复数谱是线性操作但落到幅度与相位上就不再简单M/S 幅度仍有明确的感知含义——Mid 对应相关能量Side 对应声像宽度混音工程的相关表正建立在这之上M/S 相位却是 L/R 幅度与相位的耦合函数IPD 这一有明确物理意义的量被打乱重编码。监督 M/S 相位等于让模型拟合一个高度耦合的非线性目标。实验结果与之吻合在相位损失中引入 M/S 分量会带来可闻伪影高频频谱发糊。幅度监督则相反M/S/L/R 四路能给出关于能量与声像最完整的引导。需要指出这一策略与 Stable-Audio-Open 不同是我们自己的实验结论。2.4 其余组件各自存在的理由多尺度对数幅度损失。取对数有两个作用顺应人耳的对数感知特性压缩动态范围防止高能量成分主导计算让低能量细节拿到应有的权重。距离度量选 L1 而非谱收敛SC损失——后者是相对误差对幅度快速变化的信号过于敏感L1 对动态复杂的音乐更稳定。Feature-map 损失。取判别器各子尺度的中间卷积层特征做 L1提供比标量判决稠密得多的监督信号直接作用于音色、瞬态与和声内容的重建。对抗损失。沿用最小二乘 GAN 目标生成器与判别器交替优化。**KL 正则**。编码器输出均值向量与尺度向量标准差经 softplus 保证为正。权重压到 $10^{-6}$潜空间的结构化由极微弱的正则兜底重建保真是第一优先级。⏩三、数据与训练训练分两个阶段的数据公开数据集FSD50K、FMA、DISCO-10M预训练约一万小时专业制作音乐的内部数据集继续训练。筛选规则按重建目标设计逐级递进。第一级做格式统一只收原生采样率 44.1 kHz 及以上的立体声更高采样率的向下采到 44.1 k——不做向上采样因为插值补不出原始奈奎斯特频率以上的真实内容只会留下一段空白频谱劣质插值器还会引入镜像伪影要从源头保证奈奎斯特频率附近存在真实能量。第二级按感知响度筛选以 EBU R128 标准的 LUFS-I 积分响度只保留 [-22,-5] LUFS 的曲目剔除过响或过轻的极端样本。第三级只作用于内部数据集处理削波不同于凡削波皆弃的保守策略我们刻意放宽——true peak 不超过 1.0 dBTP 的一律保留。理由是适度削波在现代母带环节几乎必然存在全部剔除会让训练数据与现代音乐工程的实际水平脱节。模型共 140.98M 可训练参数编码器 70.36M、解码器 70.49M、瓶颈 Transformer 仅 0.12M。训练 200 万步分三段10k 步热身只训生成器STFTKL 损失学习率线性爬升100 万步预训练全损失交替优化学习率按阶梯衰减100 万步继续训练内部数据恒定学习率。损失权重为。另有一项未成功的尝试值得记录。我们曾把重参数化的采样噪声从白噪声换成粉红噪声——$1/f$ 谱通常被认为更接近自然信号。结果是宽声像乐器的细节确有改善但整体频率能量关系被打破低频能量缺失。症结在于先验假设的自洽性KL 项要求后验向独立同分布的标准高斯收敛采样过程却注入时间相关的粉噪声二者相互矛盾模型只学会了匹配粉噪声逐点的均值与方差并未捕捉到它作为时间序列的长程相关特性。最终我们回到白噪声。⏩四、评测与结果4.1 指标设计相位准确性的量化常规指标有 MS-STFT 距离FFT [4096,2048,\dots,128]、MS-Mel 距离FFT [4096,2048,1024,512]hop 均为窗长的 1/4、SI-SDR以及用 FFmpeg 度量的真峰值响度差 dBTP。相位准确性长期缺少公认的客观指标我们提出 ICPC 与 CCPC理论基础是循环统计circular statistics。相位是角度量与在圆周上相邻线性平均却给出 0——算术统计在圆上不成立。正确的做法是把每个相位误差写成复平面上的单位相量考察相量和的长度mean resultant length方向一致则长度接近 1杂乱无章则接近 0。具体地ICPC 先用幅度乘积作权重低能量时频点的相位误差在感知上无关紧要加阈值掩膜剔除逐帧计算加权相量和的归一化长度再按帧能量加权平均CCPC 把同一套流程应用于声道间相位差IPD由计算的误差度量立体声空间关系的保全度。相位重建质量由此可以被定量比较。2.3 MSLR幅度四路相位两路立体声有两种等价表示Left/Right 与 Mid/Side。我们借鉴混音工程中在这两个视角之间切换的做法但按监督对象做了区分这一区分的依据来自心理声学。双工理论duplex theory告诉我们中低频的声像定位主要靠相位与时间差高频则靠强度差立体声音乐的空间信息大量写在前者里落到信号上就是声道间相位差IPD。M/S 变换对复数谱是线性操作但落到幅度与相位上就不再简单M/S 幅度仍有明确的感知含义——Mid 对应相关能量Side 对应声像宽度混音工程的相关表正建立在这之上M/S 相位却是 L/R 幅度与相位的耦合函数IPD 这一有明确物理意义的量被打乱重编码。监督 M/S 相位等于让模型拟合一个高度耦合的非线性目标。实验结果与之吻合在相位损失中引入 M/S 分量会带来可闻伪影高频频谱发糊。幅度监督则相反M/S/L/R 四路能给出关于能量与声像最完整的引导。需要指出这一策略与 Stable-Audio-Open 不同是我们自己的实验结论。2.4 其余组件各自存在的理由多尺度对数幅度损失。取对数有两个作用顺应人耳的对数感知特性压缩动态范围防止高能量成分主导计算让低能量细节拿到应有的权重。距离度量选 L1 而非谱收敛SC损失——后者是相对误差对幅度快速变化的信号过于敏感L1 对动态复杂的音乐更稳定。Feature-map 损失。取判别器各子尺度的中间卷积层特征做 L1提供比标量判决稠密得多的监督信号直接作用于音色、瞬态与和声内容的重建。对抗损失。沿用最小二乘 GAN 目标生成器与判别器交替优化。**KL 正则**。编码器输出均值向量与尺度向量标准差经 softplus 保证为正。权重压到 $10^{-6}$潜空间的结构化由极微弱的正则兜底重建保真是第一优先级。⏩三、数据与训练训练分两个阶段的数据公开数据集FSD50K、FMA、DISCO-10M预训练约一万小时专业制作音乐的内部数据集继续训练。筛选规则按重建目标设计逐级递进。第一级做格式统一只收原生采样率 44.1 kHz 及以上的立体声更高采样率的向下采到 44.1 k——不做向上采样因为插值补不出原始奈奎斯特频率以上的真实内容只会留下一段空白频谱劣质插值器还会引入镜像伪影要从源头保证奈奎斯特频率附近存在真实能量。第二级按感知响度筛选以 EBU R128 标准的 LUFS-I 积分响度只保留 [-22,-5] LUFS 的曲目剔除过响或过轻的极端样本。第三级只作用于内部数据集处理削波不同于凡削波皆弃的保守策略我们刻意放宽——true peak 不超过 1.0 dBTP 的一律保留。理由是适度削波在现代母带环节几乎必然存在全部剔除会让训练数据与现代音乐工程的实际水平脱节。模型共 140.98M 可训练参数编码器 70.36M、解码器 70.49M、瓶颈 Transformer 仅 0.12M。训练 200 万步分三段10k 步热身只训生成器STFTKL 损失学习率线性爬升100 万步预训练全损失交替优化学习率按阶梯衰减100 万步继续训练内部数据恒定学习率。损失权重为。另有一项未成功的尝试值得记录。我们曾把重参数化的采样噪声从白噪声换成粉红噪声——$1/f$ 谱通常被认为更接近自然信号。结果是宽声像乐器的细节确有改善但整体频率能量关系被打破低频能量缺失。症结在于先验假设的自洽性KL 项要求后验向独立同分布的标准高斯收敛采样过程却注入时间相关的粉噪声二者相互矛盾模型只学会了匹配粉噪声逐点的均值与方差并未捕捉到它作为时间序列的长程相关特性。最终我们回到白噪声。⏩四、评测与结果4.1 指标设计相位准确性的量化常规指标有 MS-STFT 距离FFT [4096,2048,\dots,128]、MS-Mel 距离FFT [4096,2048,1024,512]hop 均为窗长的 1/4、SI-SDR以及用 FFmpeg 度量的真峰值响度差 dBTP。相位准确性长期缺少公认的客观指标我们提出 ICPC 与 CCPC理论基础是循环统计circular statistics。相位是角度量与在圆周上相邻线性平均却给出 0——算术统计在圆上不成立。正确的做法是把每个相位误差写成复平面上的单位相量考察相量和的长度mean resultant length方向一致则长度接近 1杂乱无章则接近 0。具体地ICPC 先用幅度乘积作权重低能量时频点的相位误差在感知上无关紧要加阈值掩膜剔除逐帧计算加权相量和的归一化长度再按帧能量加权平均CCPC 把同一套流程应用于声道间相位差IPD由计算的误差度量立体声空间关系的保全度。相位重建质量由此可以被定量比较。4.2 主结果基线包括 DAC、Encodec、AudioGenAGC、Stable-Audio-Open以及声码器 BigVGAN。MuChin 与内部验证集的结果如下每格为 MuChin / 内部集六项指标全面领先。单声道的 MusicCaps 上结论一致SI-SDR 12.29次优 DAC 为 9.94。BigVGAN 是个很好的对照组它的 Mel 距离在多个数据集上最低SI-SDR 却崩到 -16 甚至 -34——频谱距离很小波形完全对不上。这提醒两件事指标要成套地看单一指标会说谎相位管不好频谱再像还原出来的也不是原来的声音。信号层面的另一项佐证是 THDNAES17 标准的总谐波失真加噪声THDN 与频响对比图 4各模型重建结果的 THDN 与频率响应对比。εar-VAE 的谐波分布与衰减模式最接近自然信号。频响分析还显示εar-VAE 的谐波分布与谐波衰减模式最接近自然——面对训练中未见过的复杂信号模型预测出的泛音结构更符合物理规律。4.3 消融逐项验证设计选择逐项分析仅 M/S 或仅 L/R 的空间监督都不够8.66 / 9.17印证 MSLR 分治的必要Correlation loss 带来 0.7 个 SI-SDR 点的提升9.17 → 9.85对应复音元素的相位一致CQT 降权有效、去掉更好10.21 → 10.56与旋律专家的分析相互印证K-weighting 优于 A-weighting10.86 对 10.08感知加权方向选对的收益明显Transformer 两层补齐最后的全局建模11.00可视化消融还显示没有它10 kHz 以上的泛音结构无法重建。前文的定性分析与这里的定量结果相互一致。消融实验的频谱对比图 5消融实验的频谱对比自上而下分别为Transformer 瓶颈、加权曲线、相位相关损失、M/S 与 L/R 表示的影响。⏩五、局限与展望我们的工作仍存在两方面局限。其一当前的潜表示停留在声学层面难以直接对齐语义空间——要实现风格、情绪条件化的下游生成潜空间还需要语义化改造。其二模型接近收敛时倾向于把混响、延迟、回声这类细微的空间效果当作低能量成分衰减而这些恰恰是感知上重要的部分设计针对性的损失函数以保全空间效果是明确的下一步。更长远的方向是在此基础上做可控的条件合成显式控制流派、情绪甚至以全新的频响和动态范围重混一首曲子。⏩六、结语既然重建的终点是听觉那么从加权曲线的选择、相位监督的对象到判别器的取舍、数据筛选的标准都先回答同一个问题——耳朵到底在意什么本文的一些技巧已被 Stable Audio 3 用于训练他们使用的 SAME codec很感谢他们的认可与改进。模型代码、权重与音频示例已全部开源https://eps-acoustic-revolution-lab.github.io/EAR_VAE/ 欢迎直接试听验证也希望这些工作经验能收获更多社区反馈。此工作完成于自由量级initi:AI公司阶段性服务于旗下产品“音潮涌现”的音乐生成效果更多信息可查看https://web.yinchaoyongxian.com/studio/about-us本组织专注与音频相关的研究与工程, 静候各位合作https://github.com/Eps-Acoustic-Revolution-Lab