• 首页
  • vue
  • TypeScript
  • JavaScript
  • scss
  • css3
  • html5
  • php
  • MySQL
  • redis
  • jQuery
  • TTS 人声:频率均衡咬字清晰(干净篇)

    TTS 人声旁白具备的缺点:

    • 缺乏共鸣:缺乏真实的胸腔、咽喉、口腔等共鸣。在中低频缺乏,或者堆积。听起来,缺乏真人气息。
    • 听感冷硬:瞬态响应太快太强,不柔和。由于缺乏内在的真实情感驱动,导致语调生硬。
    • 机器感重:具有均匀的节拍、不变的音色以及僵化的重音,缺乏人类说话时微妙的时间抖动和气息变化。
    • 发音特点:电子合成人声旁白,包含大量的齿音(z, c, s, zh, ch, sh)和爆破音(b, p, d, t)。有些字高频能量强,还有些字在中频区有共振峰。
    • 低频区(80Hz - 250Hz):虽然做了低切,但合成男声的基频通常在 100Hz - 150Hz 左右,这部分能量比较均匀,没有明显的轰鸣,但可能存在合成器带来的“嗡嗡”感。
    • 中低频区(250Hz - 650Hz):这是男声的厚度区。在 300Hz - 500Hz 之间,通常是合成语音容易出现的“盒子声”或“塑料感”区域,需要适当压制以增加自然度。
    • 中高频区(1.5kHz - 4kHz):关键区域。对应人耳最敏感的听觉范围。对于电子音来说,这里的能量过强会导致“机器味”重,听久了耳朵累。需要重点处理。
    • 高频/齿音区(4kHz - 10kHz+):从频谱图上看到,顶部有明显的垂直亮线,对应“x, z, q, c”等字的摩擦音。合成器的齿音通常比真人更尖锐,且衰减不自然。




    虚拟麦克

    Antares Auto-Tune Mic Mod:虚拟麦克风,去除机器感,增强真人效果。




    前置话放

    Analog Obsession BritPre:增加中高频冲击力,减少中频空洞。




    重塑包络

    TBTECH Trinity Shaper:重塑瞬态。



    去除谐振

    Three-Body Tech SpecCraft:共振峰抑制。




    平滑瑕疵

    Three-Body Tech Future MB:多频段处理器。

    • 相位模式:流动相位。
    • 频率波段:80 Hz ~ 700 Hz。
      • 压缩目的:去除低频轰鸣,即 120 Hz、240 Hz、360 Hz、480 Hz 形成低频共振。
      • 低频侧链:范围 100 Hz ~ 400 Hz;频点 120 Hz,Gai 24 dB,Q 2;240 Hz,Gai 21 dB,Q 2.5;170 Hz,Gai -9 dB,Q 3。
      • 压缩阈值:-6 dB;范围:6 dB;启动:12 ms;释放:100 ms;压缩比:3:1;拐点:15 dB。
      • 频谱压缩:50%。
      • 输出增益:+2.5 dB。前瞻时间:3ms。



    Three-Body Tech Future MB:多频段处理器。

    • 相位模式:流动相位;升采样:2x;全局前视:0-5 ms;风格:Glue。
    • 频率波段:80 Hz ~ 250 Hz。
      • 压缩阈值:-22 dB;范围:6 dB;启动:20 ms;释放:150ms;拐点:9 dB;压缩比:2:1。频谱压缩:40%。
      • 输出增益:0 dB。前瞻时间:3ms。
      • 增益矩阵:接收 Band 1:30%,提升。中频衰减时,少量路由到低频增加温暖感。
    • 频率波段:250 Hz ~ 600 Hz。
      • 压缩阈值:-24 dB;范围:8 dB;启动:15 ms;释放:120 ms;拐点:6 dB;压缩比:3:1。频谱压缩:40%。
      • 输出增益:0 dB。前瞻时间:5ms。
      • 增益矩阵:自身:75%;Band 0:-30%; Band 2:-25%。
    • 频率波段:600 Hz ~ 2k Hz。
      • 向上压缩:阈值1:-30 dB;阈值2:-48 dB;范围:10 dB;启动:15 ms;释放:100 ms;压缩比:2.5:1;拐点:6 dB。向上频谱:25%。
      • 压缩阈值:-21;范围:4 dB;启动:15 ms;释放:100 ms;拐点:9 dB;压缩比:2:1。频谱压缩:20%。
      • 输出增益:0 dB。前瞻时间:3ms。
    • 频率波段:2k Hz ~ 5.5k Hz。
      • 压缩阈值:-22;范围:4 dB;启动:10 ms;释放:100 ms;拐点:4 dB;压缩比:2:1。频谱压缩:30%。
      • 输出增益:0 dB。前瞻时间:5ms。
    • 频率波段:5.5k Hz ~ 20k Hz。
      • 压缩阈值:-24;范围:3 dB;启动:10 ms;释放:100 ms;拐点:3 dB;压缩比:2:1。频谱压缩:20%。
      • 输出增益:0 dB。前瞻时间:3ms。



    Pre 31102

    NoiseAsh Audio Need Pre 31102:增加声音的“丝滑感”和“精致度”(非常微弱,主要是调节电平)。



    Scheps 73

    RRS Scheps 73:中低频温暖厚重、增强胸腔共鸣。




    动态均衡

    waves CLA-2A:压缩量 1 ~ 3 dB,最大不超过 5 dB。

    Peak Reduction:47 dB,Gain:34 dB。