AI 文本转语音(TTS)产生的噪音和伪影
使用 AI(TTS,SText-to-Speech))在合成人声时,几乎不可避免地会引入某种形式的噪音或伪影。
声码器伪影(Vocoder Artifacts)
现代 TTS 系统采用两阶段流水线架构:声学模型先将文本转为梅尔频谱图(Mel-spectrogram),声码器(如 HiFi-GAN、BigVGAN 等)再将频谱还原为时域波形。声码器伪影即产生于第二阶段——频谱到波形的重建过程中,是 AI 合成语音最主要的可感知噪音来源。
高频重建误差(用户最常感知到的"沙沙"声)
声码器对高频细节(通常>8 kHz)的还原能力有限。梅尔频谱在高频段的能量本就衰减严重,声码器在此基础上重建时,无法准确恢复原始的高频湍流成分(如齿擦音中的气流摩擦噪声),转而产生不连续的宽带噪声残差。
- 听感特征:极轻微的"沙沙"声或"嘶嘶"底噪,类似远处的白噪声。在正常语音段中因语音能量掩蔽效应而不太明显,但在静音段、句间停顿、弱辅音段等低能量区间可被感知。
- 频谱特征:在频谱图的高频区域(6 kHz 以上)表现为弥散的、不规则的浅色噪点,与真人语音高频段的自然湍流纹理是有结构的(与特定辅音对应),而声码器伪影的高频噪声是无结构的随机分布。
- 频响特征:主要影响 6 kHz 以上频段,不改变中低频段的频响曲线形态。
- 频率特征:宽带分布,无特定峰值频率,但能量随频率升高而递减。
- 剪映内处理:
- 降噪:音频 → 降噪,强度设为 60%–70%。AI 配音底噪极低,此档位足以清除声码器残留的高频噪声,同时不损伤语音主体。不要超过 75%,否则会产生"音乐噪声"伪影
- 人声增强:音频 → 人声增强,数值 40–50。该功能内部包含频谱修复逻辑,可在一定程度上填补高频段的噪声空洞
- 专业软件处理
- 动态均衡器压制高频噪声:使用 FabFilter Pro-Q4,在 8–12 kHz 频段设置一个动态 Bell 节点:增益 -2 dB,Q 值 1.5,触发模式设为"向下扩展"(Downward Expand),阈值 -30 dB。这样只在噪声能量超过阈值时才压制,语音段的齿擦音不受影响
- 频谱减法降噪:使用 iZotope RX 的 Spectral De-noise 模块:学习一段静音段的噪声指纹(Noise Profile),然后施加轻度降噪。该算法能精准识别宽带随机噪声并将其衰减,同时保留语音的瞬态细节
- 高通滤波:在 14–16 kHz 以上施加 12 dB/oct 的高通滤波。声码器伪影的有害成分集中在 6–12 kHz,14 kHz 以上的信息对语音清晰度贡献极小,直接切除可大幅降低噪声感知
过度平滑效应(声音"发闷"的根源)
声学模型通常采用均方误差(MSE)或 L1 损失函数训练,倾向于预测频谱的条件均值而非多模态分布中的精确值。这导致输出的梅尔频谱图丢失细粒度细节——共振峰边界过于圆滑、谐波结构过于均匀、频谱纹理被"涂抹"。声码器基于这张"模糊地图"重建波形时,相当于"无中生有"地填充缺失的细节,产生的波形缺乏真实语音的微观不规则性。
- 听感特征:声音发闷、缺乏质感和"颗粒感",长时间收听容易产生听觉疲劳。部分情况下可感知到一种低沉的"嗡嗡"感,这是声码器在细节缺失区域自行生成的低频伪谐波。
- 频谱特征:频谱图整体过于"干净",共振峰边界呈圆滑弧线而非真人语音的锐利条纹,高频段缺乏随机纹理。
- 频响特征:4 kHz 以上频段的频响曲线过于平滑,缺乏自然语音中应有的微小波动和峰谷。
- 频率特征:主要体现在 4 kHz 以上频段,高频泛音成分被系统性削弱。
- 剪映内处理
- 清晰度:音频 → 清晰度,提升 15%–25%。该功能本质是对中高频段(2–8 kHz)的谐波增强,可在一定程度上补偿过度平滑导致的高频缺失
- 均衡器:音频 → 均衡器,提升 3 kHz 处 +3 dB(增强"存在感"),提升 8 kHz 处 +1.5 dB(恢复"空气感"),衰减 300 Hz 处 -2 dB(消除闷罐感)
- 专业软件处理
- 谐波激励器:使用 Waves Aphex Vintage AxEss 或 FabFilter Pro-Q3 的谐波增强功能,在 4–8 kHz 频段添加偶次谐波。这相当于"伪造"声码器丢失的高频泛音细节,让声音恢复通透感和质感
- 多段压缩恢复动态:使用 FabFilter Pro-MB,在 4–8 kHz 频段设置轻度压缩(阈值 -24 dB,比率 1.5:1),增强该频段的动态变化,打破过度平滑造成的"一马平川"感
- 瞬态增强:使用 SPL Transient Designer 或 Audition 的动态处理,提升辅音起音的瞬态能量(Attack +3 dB),让被平滑掉的辅音"棱角"重新显现
- 参数均衡器精细补偿:使用 FabFilter Pro-Q4,在以下频率点设置 Bell 节点:2.5 kHz(+2 dB,Q=1.5)、5 kHz(+1.5 dB,Q=2.0)、10 kHz(+1 dB,Q=1.0)。逐频段补偿被过度平滑削弱的能量
相位重建偏差(影响"通透度"的隐性因素)
大多数 TTS 系统的声学模型仅建模幅度谱(梅尔频谱本质上是幅度谱的压缩表示),相位信息不在显式建模范围内。声码器要么通过对抗训练隐式学习相位与幅度的对应关系,要么使用 Griffin-Lim 等迭代算法从幅度谱近似重建相位。无论哪种方式,重建的相位分布与真实语音的相位结构均存在偏差。
- 听感特征:声音缺乏"通透度"和空间感,听起来偏"平"、偏"闷",不如真人语音那样有清晰的"轮廓感"。这种偏差通常不易被普通听众单独识别为"相位问题",但会整体降低声音的质感。
- 频谱特征:频谱图上不易直接观察(频谱图主要显示幅度信息),但通过相位谱分析可发现相位分布过于规律,缺乏真实语音的随机性。
- 频响特征:不直接改变频响曲线形态,但影响波形的时域精细结构。
- 频率特征:全频段受影响,但在中高频段(2–8 kHz)对听感的影响最为显著。
- 剪映内处理
- 人声增强:音频 → 人声增强,数值 50–60。人声增强功能内部包含相位校正逻辑,可在一定程度上改善因相位偏差导致的"平""闷"听感。
- 混响:音频 → 混响,添加极轻微的混响(衰减时间 0.3–0.5 秒,混合比 5%–8%)。轻微混响可以"模糊化"相位偏差带来的不自然感,让声音获得更自然的空间感。
- 专业软件处理
- 立体声展宽:使用 iZotope Ozone Imager,对单声道 AI 配音施加轻微的立体声展宽(宽度 10%–20%)。立体声处理会引入微小的左右声道相位差,"覆盖"原始单声道中的相位异常,让声音获得空间感和通透度。
- 卷积混响:使用 Waves IR-L,加载一个真实录音环境的脉冲响应(IR),对 AI 配音施加卷积混响。真实环境的 IR 包含自然的相位结构,可以"修正"AI 配音的相位偏差,让声音听起来像是在真实空间中录制的。
- 中侧处理:使用 FabFilter Pro-Q4 的 M/S 模式,对 Mid(中置)信号保持原样,对 Side(侧边)信号在 2–5 kHz 频段提升 2 dB。这可以增强声音的"宽度感"和"空气感",间接改善相位偏差带来的"平"听感。
谐波结构失真("金属感"伪影的来源)
部分声码器,会在特定频率上产生非自然的周期性谐波成分。这是因为声码器的生成器网络(通常为卷积或 Transformer 架构)在处理周期性信号时,可能引入与原始语音无关的谐波分量。
- 听感特征:声音带有"金属光泽"或"电子嗡鸣",尤其在浊音段(元音、鼻音)明显,听感上不自然。
- 频谱特征:频谱图上在基频的整数倍频率位置出现额外的亮线(非自然谐波),或在特定频率 bin 上出现周期性的能量条纹。
- 频响特征:频响曲线在特定频率位置出现不自然的尖峰。
- 频率特征:集中在基频的整数倍频率上(如基频 150 Hz 的 2 次谐波 300 Hz、3 次谐波 450 Hz 等位置出现异常能量)。
- 剪映内处理
- 均衡器衰减异常频点:音频 → 均衡器,在金属感最明显的频率位置(通常是 1–4 kHz 之间的某个窄带)设置一个窄带 Bell 节点:增益 -3 至 -5 dB,Q 值 3.0–5.0。需要边听边扫频定位具体频率。
- 更换音色:不同音色的声码器训练数据和质量不同,金属感严重程度差异很大。优先选择听感最自然的音色。
- 专业软件处理
- 动态陷波滤波器:使用 FabFilter Pro-Q4,在金属感对应的频率位置设置一个动态 Notch 节点:增益 -6 dB,Q 值 5.0–8.0,触发模式设为"动态均衡"。只有当该频率的能量超过阈值时才衰减。
- 频谱修复:使用 iZotope RX 的 Spectral Repair 模块:在频谱图上定位异常谐波亮线,选中后使用"Attenuate"模式衰减 6–10 dB。这是最精准的方法,可以逐条"擦除"异常谐波。
- 去谐处理:使用 iZotope RX 的 De-harmonics 模块(如可用),专门针对非自然谐波进行识别和衰减。
- 饱和/磁带模拟:使用 Waves J37,施加极轻微的磁带饱和(Drive 5%–10%)。磁带饱和会引入偶次谐波,"覆盖"声码器产生的奇次非自然谐波,让金属感转化为温暖的模拟质感。
标准术语
上述各类噪音和伪影统称为声码器伪影(Vocoder Artifacts)或合成伪影(Synthesis Artifacts)。在学术文献中,高频重建误差和过度平滑效应是最常被讨论的两类伪影,也是当前声码器研究的主要改进方向。
与"量化噪声"的区分
需要特别澄清的是,声码器伪影不是量化噪声。量化噪声产生于模拟-数字转换(ADC)过程中的离散化步骤,其能量极低(24 bit 量化下理论信噪比约 144 dB),在实际 AI 语音合成中完全可以忽略。声码器伪影的本质是模型重建能力的局限性——声学模型预测的频谱不够精确、声码器从频谱还原波形的能力不够完美——二者叠加导致输出波形与真实语音之间存在系统性偏差。这种偏差在听感上表现为可感知的噪音和伪影,其能量远高于量化噪声,是 AI 合成语音区别于真人录音的标志性特征之一。
数值计算残差(Numerical Computation Residual)
数值计算残差是 AI 合成语音中能量最低、听感上最不可闻的一类噪声,但它客观存在,且在特定条件下可被放大至可感知水平。其本质是数字计算过程中的精度损失在输出波形中的体现,与声码器伪影(模型重建能力局限)属于完全不同的成因类别。数值计算残差是 AI 合成语音中能量最低、最不需要担心的噪声类型。在实际制作中,应将全部精力放在处理声码器伪影(高频重建误差、过度平滑效应、相位偏差、谐波失真)上,数值计算残差只需通过"导出 WAV 格式 + 避免多级有损编码"即可完全规避,无需任何主动处理。
浮点运算累积误差
多层神经网络的前向传播涉及数百万次浮点乘加运算。即使在 FP32(32 位单精度浮点)下,每次运算也会产生约 10⁻⁷ 量级的舍入误差。这些误差在逐层传播过程中逐步积累,最终在输出端叠加为微弱的宽带随机噪声。其能量通常低于 -90 dBFS,远低于人耳听阈。
推理量化引入的额外误差
为加速推理、降低内存占用,部分部署方案会将模型权重从 FP32 量化为 FP16(16 位半精度浮点)甚至 INT8(8 位整数)。这种模型量化会引入额外的数值误差——FP16 的精度约为 FP32 的 1/65536,INT8 的精度约为 FP32 的 1/16777216——误差量级显著高于 FP32 推理。如果剪映的 TTS 推理采用了低精度量化方案,输出波形中的数值计算残差能量会相应抬高,但通常仍低于 -70 dBFS,在正常监听条件下不可闻。
格式转换截断失真
声码器输出的波形为 float32 格式(32 位浮点),在导出为 WAV(int16/int24)或嵌入 MP4(AAC 编码)时,需要进行位深转换。如果转换过程中缺乏正确的抖动(Dither)处理——即在截断前人为注入极微弱的随机噪声以打破量化相关性——可能引入截断失真,表现为低电平的谐波失真或噪声调制。正确的 Dither 处理可将截断失真的听感从"可闻的相关性失真"转化为"不可闻的不相关宽带噪声"。
- 听感特征:几乎不可闻。在正常监听音量下完全被语音信号掩蔽。实际使用中可安全忽略,不构成任何听感问题。仅在以下极端条件下可被感知:
- 将音频增益提升 40–60 dB 后(专业测试场景)
- 在绝对静音段使用高灵敏度耳机以极大音量监听
- 经过多级有损压缩/解压循环后(如反复导出 MP3 再导入编辑)
- 频谱特征:理想白噪声频谱——各频率能量均等,在频谱图上表现为均匀的、极浅的灰色底色,无任何峰值频率或结构性特征。与声码器伪影在高频段的不规则亮斑形成鲜明对比。
- 频响特征:完全平坦,不改变任何频段的频率响应曲线形态。
- 频率特征:均匀分布于 20 Hz–20 kHz 全频段,无特定频率集中,属于理想的宽带随机噪声。
标准术语:这类噪声统称为数值计算残差(Numerical Computation Residual)或推理量化噪声(Inference Quantization Noise)。前者更常用于描述浮点累积误差,后者更常用于描述模型量化引入的额外误差。
音乐噪声(Musical Noise)
音乐噪声(Musical Noise)是频谱减法类降噪算法的典型副作用,表现为处理后音频中残留的类似乐器演奏的随机短促音调。
来源一:过度降噪引入的音乐噪声(经典机制)
产生原因:降噪功能基于频谱减法类算法:先将音频做短时傅里叶变换(STFT)得到频谱图,估算噪声能量后从信号频谱中减去噪声成分,再通过逆 STFT 重建波形。当降噪强度设置过高时,算法对噪声谱的估计出现偏差:
- 在某些时频点上,估算的噪声能量高于实际信号能量,减法结果被截断为零(非线性操作)
- 相邻时频点的增益值出现剧烈跳变——有的点被完全保留(增益=1),紧邻的点被完全切除(增益=0)
- 这种不连续的增益谱经过逆 STFT 变换后,在时域上表现为离散的、随机分布的短促音调突发
- 简言之:降噪算法"用力过猛",把频谱挖出了一个个随机空洞,空洞边缘的能量在时域上表现为类乐音的脉冲。
听感特征:
随机的短促"鸟叫声""叮当声""水下冒泡声""金属叮咛声",每个音调持续约 20–80 毫秒,频率位置随机跳变,无规律可循。在语音段的间隙(如句间停顿、弱辅音段)尤为明显,因为此时没有语音能量掩蔽。严重时会彻底破坏语音的自然感,听感上像"声音在冒泡"。
频谱特征:
频谱图上出现离散的、随机分布的孤立亮斑(窄带能量突发),每个亮斑在时间轴上持续 2–5 帧(约 20–80 毫秒),在频率轴上占据 1–3 个频率 bin(窄带)。这些亮斑与正常语音的连续频谱结构形成鲜明对比——正常语音的频谱是连续的条纹状,而音乐噪声是散落的"芝麻点"。
频响特征:
频响曲线出现不规则的凹陷和尖峰。凹陷对应被过度切除的频段,尖峰对应残留的孤立能量突发。整体频响形态被破坏,不再呈现自然语音的平滑包络。
频率特征:
突发能量集中在特定窄带频率上,位置随机、无固定规律。每次出现的频率都不同,相邻帧之间频率跳变幅度可达数百赫兹至数千赫兹。
来源二:声码器重建伪影(听感相似,机制不同)
产生原因:
HiFi-GAN 等神经声码器在将梅尔频谱图转换为时域波形时,由于生成器网络的卷积核在处理周期性信号时可能引入非自然的谐波分量,会在特定频率 bin 上产生周期性的能量条纹。这类伪影的成因是模型重建能力的局限性,与降噪算法的增益谱不连续无关,但在听感上与音乐噪声有相似之处(都表现为"金属感""电子嗡鸣")。
严格来说,这类伪影应归类为声码器伪影(Vocoder Artifacts)而非音乐噪声,但由于两者在听感上有重叠,实际制作中常被混淆。
- 听感特征:持续的"金属光泽""电子嗡鸣"或"机器人感",与来源一的随机短促音调不同,声码器伪影更倾向于持续性的金属质感,尤其在浊音段(元音、鼻音)明显。
- 频谱特征:频谱图上在基频的整数倍频率位置出现额外的亮线(非自然谐波),或在特定频率上出现周期性条纹,与音乐噪声的随机孤立亮斑不同。
- 频响特征:频响曲线在特定频率位置出现规律性的尖峰(对应非自然谐波),与音乐噪声的不规则凹陷/尖峰不同。
- 频率特征:集中在基频的整数倍频率上,位置有规律(与基频成整数倍关系),而非音乐噪声的随机分布。
训练数据残留噪声(Training Data Noise Residue)
训练数据残留噪声是指 AI 语音合成模型在训练过程中,将训练语料中携带的环境声学特征(底噪、混响、房间声学特性等)编码进模型参数,并在合成时主动复现出来的现象。其本质是模型对训练数据中非语音成分的过拟合——模型未能将语音信号与环境声学特征完全解耦,导致后者作为"寄生特征"被永久固化在模型权重中。
产生机制:
现代 TTS 系统的声学模型通过大量语音-文本配对数据进行监督训练。如果训练语料的录制环境不够"干净"——例如存在空调声、麦克风本底噪声、房间混响、远处交通噪声等——模型在最小化重建损失的过程中,会将这些环境特征与语音特征联合编码进参数中。具体而言,模型学到的不是纯粹的"文本→语音"映射,而是"文本→语音+环境声学特征"的联合映射。在推理合成阶段,模型会根据学到的联合分布同时生成语音内容和环境声学特征,表现为合成输出中携带与训练环境一致的底噪或混响。需要注意的是,这不是模型在"幻觉"——模型忠实地复现了它在训练数据中学到的声学模式,只是这些模式中包含了不应存在的环境成分。
- 听感特征:根据训练数据中环境特征的类型不同,听感表现分为两类:
- 底噪型残留:
- 在静音段或句间停顿处尤为明显,因为此时没有语音能量掩蔽。表现为一种平稳的、持续的"沙沙"底噪或低频"嗡嗡"声。
- 与录音环境相关——如果训练数据来自嘈杂环境,合成输出也会带有类似的环境特征。正常语音段中因掩蔽效应而不太明显,安静环境下可感知。
- 混响型残留:
- 表现为极轻微的"空间感",类似在小房间中说话的自然混响。句尾或长元音末尾可听到极微弱的延迟能量拖尾(衰减时间通常 <200 毫秒)。
- 通常不构成严重问题,反而在一定程度上增加声音的自然感。在干燥的录音棚环境中监听时更容易被察觉。
- 底噪型残留:
- 频谱特征:
- 底噪型残留:在频谱图上表现为持续性的宽带浅色底色,覆盖整个时间轴(包括语音段和静音段),在静音段尤为明显。能量分布取决于原始环境噪声的频谱特征。
- 混响型残留:在频谱图上表现为语音能量结束后的微弱延迟拖尾——在正常语音频谱条纹消失后,仍有极微弱的能量延续 2–5 帧(约 40–100 毫秒),能量逐渐衰减。
- 频响特征:
- 底噪型残留:频响曲线整体轻微抬升,抬升幅度取决于环境噪声的能量水平。如果是特定频段的噪声(如空调的低频嗡鸣),频响曲线在该频段会出现不自然的隆起。
- 混响型残留:低频段(200–500 Hz)频响轻微抬升 1–2 dB,对应混响能量在低频段的积累。中高频段频响基本不受影响。
- 频率特征:
- 底噪型残留:取决于原始环境噪声的频率分布。
- 空调/通风系统:能量集中在 100–500 Hz。
- 麦克风本底噪声:全频段均匀分布。
- 交通/建筑噪声:能量集中在 50–200 Hz。
- 电子设备干扰:可能在特定频率(如 50 Hz 工频及其谐波)出现窄带尖峰。
- 混响型残留:能量集中在 200–500 Hz 的低频混响区域,高频段的混响拖尾衰减更快(因高频声波被空气和墙面吸收更多)。
- 底噪型残留:取决于原始环境噪声的频率分布。
标准术语:这类噪声统称为训练数据残留噪声(Training Data Noise Residue)或数据驱动伪影(Data-driven Artifacts)。在学术文献中,混响型残留也被称为残留混响(Residual Reverberation)。
| 维度 | 训练数据残留噪声 | 声码器伪影 | 数值计算残差 |
| 成因 | 训练数据含环境噪声 | 模型重建能力局限 | 数字精度损失 |
| 能量级别 | -50 至 -30 dBFS | -40 至 -20 dBFS | <-70 dBFS |
| 可闻性 | 静音段可闻 | 正常条件下可闻 | 正常条件下不可闻 |
| 频谱特征 | 持续宽带底色或延迟拖尾 | 高频不规则亮斑 | 全频段均匀 |
| 是否与音色相关 | 是,不同音色差异大 | 是,不同音色差异大 | 否,与音色无关 |
| 是否可通过换音色解决 | 部分可以 | 部分可以 | 不可以 |
工程链路引入的噪音(Engineering Implementation Artifacts)
除了模型生成环节,TTS系统的工程部署链路也可能引入噪音:
- 采样率不匹配:训练采样率与推理采样率不一致,重采样滤波器设计不当会导致高频镜像残留,表现为"嘶嘶"声。
- 流式合成的边界伪影:在 block-wise 流式合成中(如每 240ms 输出一个音频块),块与块之间的拼接如果处理不当,会产生"咔哒"断续声。
- 增益控制缺失:输出波形峰值超出±1.0 范围后直接截断为 int16,导致削波失真(Clipping Distortion)。
标准术语:这类问题属于工程实现伪影(Engineering Implementation Artifacts)。
高频金属质感伪影
产生原因:声码器在高频段重建精度不足,生成对抗网络的生成器在 6 kHz 以上频段产生不连续的频谱分量,叠加后形成金属质感的谐振。
- 听感特征:声音带有"金属光泽"或"电子味",尤其在齿擦音(s、sh、z)和清辅音段明显,听感刺耳、不自然。
- 频谱特征:频谱图高频段(6 kHz 以上)出现不连续的亮线或斑点状能量分布,与真人语音高频段的弥散噪声纹理不同。
- 频响特征:高频段频响曲线出现不规则的峰谷起伏,偏离自然滚降。
- 频率特征:能量集中在 6–10 kHz 的特定频点,呈窄带分布。
爆破音咔嗒伪影
产生原因:声学模型在预测爆破音(b、p、t、d)的起音瞬间时,幅度谱出现突变(从静音到爆发能量的过渡不够平滑),声码器将此突变直接映射为时域波形中的脉冲。
- 听感特征:清晰的"咔"或"嗒"声,出现在爆破音起音处,类似硬物敲击声。
- 频谱特征:频谱图上在爆破音位置出现一条极窄的竖向亮线(宽带脉冲),能量集中在 50–300 Hz 的低频区域。
- 频响特征:不影响整体频响曲线,属于瞬态事件。
- 频率特征:能量集中在 50–300 Hz,属于极低频宽带脉冲。
拼接点伪影
产生原因:长文本被分段生成后拼接时,相邻片段的末尾与开头在波形层面存在不连续(振幅跳变、相位不连续、基频偏移)。
- 听感特征:拼接点处出现"咯噔"声、短暂的音量跳变或音调突变,破坏语句连贯性。
- 频谱特征:频谱图在拼接点位置出现横向的能量断裂或突变带。
- 频响特征:拼接点前后频响曲线可能出现不连续跳变。
- 频率特征:能量突变涉及全频段,无特定频率集中。
机械回响伪影
产生原因:Transformer 解码器在长序列生成中,注意力机制对历史 token 的缓存(KV Cache)依赖导致注意力权重畸变,某些音节被不自觉地重复或拖长。
- 听感特征:某个音节或词语被不自然地重复一次,或尾音被异常拖长,类似"机械回响"或"卡碟"效果。
- 频谱特征:频谱图上出现重复的共振峰模式,即相同频率结构在短时间内再次出现。
- 频响特征:重复段的频响曲线与前段高度相似。
- 频率特征:重复能量集中在被重复音节的共振峰频率上。
过度平滑伪影
产生原因:声学模型采用均方误差(MSE)作为训练损失函数,倾向于预测频谱的均值而非多模态分布中的精确值,导致生成的梅尔频谱图丢失高频细粒度细节。
- 听感特征:声音发闷、不够通透,缺乏真人语音的"颗粒感"和"质感",长时间收听容易产生听觉疲劳。
- 频谱特征:频谱图整体过于"干净",高频段缺乏随机纹理,共振峰边界过于平滑。
- 频响特征:高频段频响曲线过于平滑,缺乏自然的微小波动。
- 频率特征:主要体现在 4 kHz 以上频段,高频泛音成分被削弱。
注意力偏移伪影
产生原因:声学模型中的注意力机制在某些位置出现"注意力跳跃"——解码器在生成当前帧时错误地关注了远距离的编码帧,导致频谱内容出现不连贯的跳变。
- 听感特征:语音流中出现突然的音色变化或短暂的"闪烁"感,类似收音机调频时的瞬间串台。
- 频谱特征:频谱图上出现局部的频谱结构突变——某一帧或几帧的频谱模式与前后帧明显不一致。
- 频响特征:突变位置的频响曲线与前后帧存在显著差异。
- 频率特征:突变涉及多个频段,无特定频率集中。
