• 首页
  • vue
  • TypeScript
  • JavaScript
  • scss
  • css3
  • html5
  • php
  • MySQL
  • redis
  • jQuery
  • AI 旁白:去除杂音获得干净人声(基础篇)

    电子合成的人声旁白(AI旁白、AI语音、TTS)主要有以下特点:清晰稳定,但缺乏人声的自然、温暖律动。

    • 动态不自然:音量起伏小,整体响度过于平直,缺乏真实说话中的强弱对比;句间或词间偶有突兀的音量跳变,破坏听感连贯性。
    • 频段不平衡:低频偶尔突兀(如某些元音过重),高频(尤其辅音如/s/、/t/、/c/)异常尖锐刺耳;整体频谱缺乏自然谐波结构,泛音不足,导致声音缺乏丰满度和空间感。
    • 缺乏人声温度与自然律动:缺乏自然谐波与泛音,导致声音“干”、“扁”、“机械”,缺少真人发声中的温暖感、个性和情感共鸣。
    • 动态单一或瞬态生硬:无法模拟人类说话中的自然重音、语调起伏和呼吸停顿。句子之间衔接生硬,重点词不突出,整体节奏像“读稿机”。
    • 节奏机械、语流生硬:语速过于均匀,停顿刻板(常按标点机械断句);缺少连读、语气滑音、情感重音等自然语流特征,显得冰冷疏离。
    • 中高频可懂度不足(在复杂声场中):关键语音频段(2–5 kHz)能量不足,在背景音乐或环境噪声中容易被掩蔽,影响信息传达。
    • 整体响度偏低或不一致:不同段落或句子间感知响度波动大,需额外处理以满足广播或平台标准(如 LUFS 规范);直接提升音量易导致失真或加剧高频刺耳问题。
    • 瞬态过冲:有些字的起始部分都有非常垂直的上升沿。这意味着声音是从静音直接跳到最大音量的,缺乏自然发声时的毫秒级起振过程。
    • 截断感强:有些字与字之间的间隔 10 ms,波形几乎归零,且结束得非常突然。这种“门限式”的开关特性,使得字与字之间缺乏自然的混响拖尾或气息连接,听起来非常生硬。
    • 过度压缩:有些字的能量块大小非常一致,缺乏自然语流中的轻重缓急。这种“砖墙式”的能量分布消除了语言的韵律感。
    • 谐波结构:有些字在低频段(小于1kHz),可以看到非常整齐、平行的水平条纹(谐波列)。这表明合成器产生的基频非常稳定,没有自然声带振动时的微小抖动。这种过度的稳定性是造成“机械感”的主要原因。
    • 有些汉字,其韵母部分,在 9.5k Hz 以上,偶尔会出现很短的咔哒声。
    • 汉字“戌、需、凶、兄",其声母部分,在 4k Hz ~ 10 kHz 之间,容易出现爆裂音。
    • 汉字“忌、吉、基、计”,其韵母部分,在 2k Hz ~ 4k Hz 之间,容易出现爆裂音。在 4.5k Hz ~ 7.5k Hz 之间,能量过强。
      建议调整方向:
    • EQ调整:适当衰减 200Hz-300Hz(约-2dB to -3dB)以减少浑浊;提升 2.5kHz - 4kHz(约+2dB)以增加咬字清晰度;使用高频激励器或均衡器提升 8kHz - 12kHz(Shelf boost)以增加空气感和丝滑度。
    • 谐波饱和:添加轻微的磁带饱和或电子管饱和效果,可以平滑掉合成声过于完美的谐波结构,增加自然的偶次谐波,使声音更温暖、柔顺。

    对于人声处理流程,一般采用,先修复最大问题,然后调整次要问题。所以一般常用流程是:降噪、EQ、去齿音、压缩。对于刺耳声严重的,应该先去除刺耳杂音,再采用压缩。


    转化为单声道

    使用 Adobe Audition,把立体声的人声旁白,转化为单声道:

    • 提取中置声道:效果(Effects)- 立体声声像(Stereo Imagery)- 中置声道提取器(Center Channel Extractor)
      • 侧边声道电平(Side Channel Level):降低此值(甚至拉到最低)以彻底移除两侧声音。
      • 中置声道电平(Center Channel Level):电平不动,或者提高此值以增强人声。
    • 转化为单声道:编辑- 变换采样类型- 把声道改选为单声道- 把位深度改成32。这样就会把音频文件转化为 32 位浮点的单声道。
    • 修复 DC 偏移:收藏- 修复 DC 偏移



    标记导出

    • 在 Audition 中导出标记:在标记面板中全选标记(Ctrl+A),右键选择"将所选标记导出至 CSV",比如命名为原标记备份.csv。
    • 在 Audition 中导入标记:在标记面板的空白处右键,选择"从文件导入标记",选择已保存的原标记备份.csv,标记就会出现在对应的时间位置上。



    去除杂音

    在 Studio One 中,使用其拆分频率,以 4k Hz 为分界点进行拆分,对其高频部分,使用De-click来去除高频杂音。



    De-click

    iZotope RX De-click:去除咔哒音。



    De-crackle

    iZotope RX De-crackle:去除爆裂音。



    Smart:Deess

    Sonible Smart:Deess:去除 Plosive,低频强瞬态。



    Re-Esser

    Wavesfactory Re-Esser:去除齿音中低频杂音。

    • Sibilance:700 Hz,低频搁架衰减 5 dB。1.2k Hz,衰减 5 dB,Q 值 2。
    • Total:11k Hz,衰减 12 dB,Q 值 1.5。



    提升振幅

    Softube Weiss MM-1 Mastering Maximizer:单声道的人声,在导出为单声道的时候,振幅会比源文件小 3 dB。这是有其转换模式决定:单→双→单。



    平滑瞬态

    Oeksound Spiff:衰减低频强瞬态。




    低切轰鸣

    FabFilter Pro-Q 4:去除低频。去除低频轰鸣,即 120 Hz、240 Hz、360 Hz、480 Hz 形成低频共振。

    • 低切 90 Hz,Q 1。
    • 120 Hz,动态衰减 4 dB,Q 3。
    • 180 Hz,动态衰减 3 dB,Q 4。
    • 240 Hz,动态衰减 3 dB,Q 4。
    • 360 Hz,静态衰减 3 dB,Q 5。
    • 480 Hz,动态衰减 3 dB,Q 6。
    • 900 Hz,动态衰减 3 dB,Q 2。



    对白恢复

    Accentize dxRevive Pro:专注于恢复对话清晰度、音调平衡和频谱完整性。




    低频轰鸣

    Eventide SplitEQ:衰减低频瞬态峰值,让音头变的圆润。



    Future MB

    Three-Body Tech Future MB:多频段处理器。

    • 相位模式:流动相位。
    • 频率波段:80 Hz ~ 700 Hz。
      • 压缩目的:去除低频轰鸣,即 120 Hz、240 Hz、360 Hz、480 Hz 形成低频共振。
      • 低频侧链:范围 100 Hz ~ 400 Hz;频点 120 Hz,Gai 21 dB,Q 2;240 Hz,Gai 21 dB,Q 2.5;170 Hz,Gai -9 dB,Q 3。
      • 压缩阈值:-6 dB;范围:9 dB;启动:20 ms;释放:150 ms;压缩比:3:1;拐点:12 dB。
      • 频谱压缩:40%。
      • 输出增益:+2.5 dB。前瞻时间:3ms。




    平滑自然

    Three-Body Tech Future MB:多频段处理器。

    • 相位模式:流动相位。
    • 频率波段:90 Hz ~ 250 Hz。
      • 压缩阈值:-22 dB;范围:4 dB;启动:25 ms;释放:250 ms;压缩比:2:1;拐点:8 dB。
      • 频谱压缩:30%。
      • 输出增益:1 dB。前瞻时间:2ms。
    • 频率波段:250 Hz ~ 600 Hz。
      • 压缩阈值:-24;范围:4 dB;启动:20 ms;释放:200 ms;压缩比:3:1;拐点:6 dB。
      • 频谱压缩:30%。
      • 输出增益:0 dB。前瞻时间:2ms。
    • 频率波段:600 Hz ~ 1.5k Hz。
      • 压缩阈值:-21;范围:4 dB;启动:15 ms;释放:150 ms;压缩比:3:1;拐点:5 dB。
      • 频谱压缩:25%。
      • 输出增益:1 dB。前瞻时间:2ms。
    • 频率波段:1.5k Hz ~ 4.5k Hz。
      • 压缩阈值:-21;范围:4 dB;启动:15 ms;释放:100 ms;压缩比:2:1;拐点:4 dB。
      • 频谱压缩:25%。
      • 输出增益:1 dB。前瞻时间:3ms。
    • 频率波段:5k Hz ~ 10k Hz。
      • 压缩阈值:-30;范围:4 dB;启动:10 ms;释放:30 ms;压缩比:4:1;拐点:2 dB。
      • 频谱压缩:40%。
      • 输出增益:0.5 dB。前瞻时间:3ms。
    • 频率波段:10k Hz ~ 20k Hz。
      • 压缩阈值:-36;范围:4 dB;启动:10 ms;释放:100 ms;压缩比:4:1;拐点:6 dB。
      • 频谱压缩:70%。
      • 输出增益:4 dB。前瞻时间:2ms。



    SplitEQ

    Eventide SplitEQ:增强光泽。



    Trinity Shaper

    Three-Body Tech Trinity Shaper:提升高频音头,增强咬字清晰;衰减低频音尾,让句子结束得更干净。




    去除刺耳

    FabFilter Pro-DS:去除毛刺。



    Sibilance

    Waves Sibilance:去除高频刺耳。