AI 旁白:去除杂音获得干净人声(基础篇)
电子合成的人声旁白(AI旁白、AI语音、TTS)主要有以下特点:清晰稳定,但缺乏人声的自然、温暖律动。
- 动态不自然:音量起伏小,整体响度过于平直,缺乏真实说话中的强弱对比;句间或词间偶有突兀的音量跳变,破坏听感连贯性。
- 频段不平衡:低频偶尔突兀(如某些元音过重),高频(尤其辅音如/s/、/t/、/c/)异常尖锐刺耳;整体频谱缺乏自然谐波结构,泛音不足,导致声音缺乏丰满度和空间感。
- 缺乏人声温度与自然律动:缺乏自然谐波与泛音,导致声音“干”、“扁”、“机械”,缺少真人发声中的温暖感、个性和情感共鸣。
- 动态单一或瞬态生硬:无法模拟人类说话中的自然重音、语调起伏和呼吸停顿。句子之间衔接生硬,重点词不突出,整体节奏像“读稿机”。
- 节奏机械、语流生硬:语速过于均匀,停顿刻板(常按标点机械断句);缺少连读、语气滑音、情感重音等自然语流特征,显得冰冷疏离。
- 中高频可懂度不足(在复杂声场中):关键语音频段(2–5 kHz)能量不足,在背景音乐或环境噪声中容易被掩蔽,影响信息传达。
- 整体响度偏低或不一致:不同段落或句子间感知响度波动大,需额外处理以满足广播或平台标准(如 LUFS 规范);直接提升音量易导致失真或加剧高频刺耳问题。
对于人声处理流程,一般采用,先修复最大问题,然后调整次要问题。所以一般常用流程是:降噪、EQ、去齿音、压缩。对于刺耳声严重的,应该先去除刺耳杂音,再采用压缩。
转化为单声道
使用 Adobe Audition,把立体声的人声旁白,转化为单声道:
- 提取中置声道:
效果(Effects)-立体声声像(Stereo Imagery)-中置声道提取器(Center Channel Extractor)。- 侧边声道电平(Side Channel Level):降低此值(甚至拉到最低)以彻底移除两侧声音。
- 中置声道电平(Center Channel Level):电平不动,或者提高此值以增强人声。
- 转化为单声道:
编辑-变换采样类型- 把声道改选为单声道- 把位深度改成32。这样就会把音频文件转化为 32 位浮点的单声道。 - 修复 DC 偏移:
收藏-修复 DC 偏移。
标记导出
- 在 Audition 中导出标记:在标记面板中全选标记(Ctrl+A),右键选择"将所选标记导出至 CSV",比如命名为原标记备份.csv。
- 在 Audition 中导入标记:在标记面板的空白处右键,选择"从文件导入标记",选择已保存的原标记备份.csv,标记就会出现在对应的时间位置上。
去除杂音
iZotope RX De-crackle:去除爆裂音。

去除 Plosive
Sonible Smart:Deess:低频强瞬态。

去除谐振
FabFilter Pro-Q 4:切除低频嗡嗡声。

SplitEQ
Eventide SplitEQ:衰减低频瞬态峰值,让音头变的圆润。

Future MB
Three-Body Tech Future MB:多频段压缩器。

- 频率波段:650 Hz 以下。
- 压缩目的:去除低频轰鸣,即 120 Hz、240 Hz、360 Hz、480 Hz 形成低频共振。
- 低频侧链:范围 100 Hz ~ 400 Hz;频点 120 Hz,Gai 24 dB,Q 2;240 Hz,Gai 24 dB,Q 2;180 Hz,Gai -24 dB,Q 2。
- 压缩阈值:-6 dB;范围:9 dB;启动:20 ms;释放:240 ms;压缩比:4:1;拐点:9 dB。输出增益:+1.2 dB。
- 频谱压缩:50%。
- 频率波段:650 Hz ~ 1.5k Hz。
- 压缩阈值:-24;范围:6 dB;启动:30 ms;释放:200 ms;压缩比:2:1;拐点:6 dB。输出增益:0 dB。
- 频谱压缩:40%。
- 频率波段:1.5k Hz ~ 4.5k Hz。
- 压缩阈值:-21;范围:6 dB;启动:30 ms;释放:150 ms;压缩比:2:1;拐点:3 dB。输出增益:0 dB。
- 频谱压缩:40%。
- 频率波段:4k Hz ~ 9k Hz。
- 压缩阈值:-21;范围:6 dB;启动:10 ms;释放:60 ms;压缩比:3:1;拐点:3 dB。输出增益:0 dB。
- 频谱压缩:50%。
- 频率波段:9k Hz ~ 20k Hz。
- 压缩阈值:0;范围:0 dB。输出增益:0 dB。
- 频谱压缩:70%。
Arbiter
TDR Arbiter:频率平衡。

SplitEQ
Eventide SplitEQ:增强光泽。

去除刺耳
FabFilter Pro-DS:去除毛刺。


Sibilance
Waves Sibilance:去除高频刺耳。


频谱修复
Accentize dxRevive Pro:专注于恢复对话清晰度、音调平衡和频谱完整性。

