• 首页
  • vue
  • TypeScript
  • JavaScript
  • scss
  • css3
  • html5
  • php
  • MySQL
  • redis
  • jQuery
  • 人声后期处理流程

    录音链路中的削波

    录制人声信号链:声音→麦克风→话放增益→声卡 AD 转换→宿主(Audition)→写入音频文件。

    麦克风阶段(单位:dB SPL):麦克风产生削波的阈值就是它的最大声压级(Max SPL),超过这个值,振膜/内部电路就会产生非线性失真。

    麦克风类型Max SPL 典型范围备注
    入门级电容麦108~120 dB SPL如 FIFINE A6V 约 110 dB SPL
    中端电容麦120~132 dB SPL如 RØDE NT1 为 132 dB SPL
    专业级电容麦130~145 dB SPL如 Neumann TLM 102 达 144 dB SPL
    动圈麦克风140 dB SPL以上通常极高,几乎不会因声压过载
    铝带麦克风≤130 dB SPL相对脆弱

    失真判定标准也因厂商而异:

    • 0.5% THD:传统专业标准(如 Neumann),代表"刚开始可闻失真"。
    • 1% THD:很多厂商使用的标准。
    • 3% THD:部分驻极体咪头的标准。
    • 10% THD:即声学过载点(AOP),代表严重失真。

    对人声录制而言:正常人声在嘴前 10-15cm 处约为 70-90 dB SPL,即使大声喊叫也很难超过 110 dB SPL。所以绝大多数麦克风在人声场景下不会在振膜层面削波。


    话放增益阶段(单位:dBu):话放是一个模拟放大器,它有最大输出电平限制。当增益把信号放大到超过这个上限时,内部电路饱和,产生模拟削波。

    设备类型削波点(最大输出电平)
    专业级设备+24 dBu 左右(最常见标准)
    部分高端设备+26 ~+28 dBu
    部分入门/便携设备+18 ~+20 dBu

    举个例子来说明这个过程:

    • 麦克风灵敏度为-36 dBV/Pa(约 16 mV/Pa)。你在距离嘴 15cm 处正常说话,声压级约 80 dB SPL,80 dB SPL 对应约 0.2 Pa。
    • 麦克风输出电压≈ 16 mV × 0.2 = 3.2 mV(约-50 dBV)。
    • 如果话放增益拧到 60 dB,输出=-50 dBV + 60 dB =+10 dBV ≈+12 dBu →安全。
    • 如果话放增益拧到 80 dB,输出=-50 dBV + 80 dB =+30 dBV ≈+32 dBu →超过+24 dBu,削波。

    所以话放阶段会不会否削波,不是看增益旋钮拧了多少 dB,而是看"麦克风输出电平+增益量"的总和是否超过话放的最大输出能力。

    对于人声录制来说,麦克风几乎不会过载,话放增益过大才是模拟阶段削波的主要元凶。而更常见的是话放输出信号太大,导致后面的 AD 转换器过载(超过 0 dBFS),这才是录音中最频繁发生的削波。


    声卡 AD 转换(模拟→数字的关键节点):AD 转换器有固定的数字上限——0 dBFS(Full Scale)。如果话放输出的模拟信号超过了 AD 转换器所能处理的最大电平,就会产生数字削波,并且后期无法修复。


    宿主软件内部(数字域):现代 DAW(包括 Audition)内部通常以 32 位浮点处理音频信号,浮点格式的动态范围极大,在宿主内部几乎不会发生削波。

    • 如果信号在进入 AD 时就已经削波了,即使在宿主内挂上限幅器,也救不了前面已经发生的削波。
    • 如果信号在模拟阶段未消波,经过 AD 转化后,未消波。那么进入宿主,被限幅器限制而防止消波,此时才会有效。


    写入音频文件

    音频文件的常见的位深度有:

    • 16 bit:当信号超过 0 dBFS 时,超过的部分直接丢失,波形顶部被"一刀切平",产生硬削波,这个失真不可逆。
    • 24 bit:当信号超过 0 dBFS 时,超过的部分直接丢失,波形顶部被"一刀切平",产生硬削波,这个失真不可逆。
    • 32-bit float:信号即使超过 0 dBFS,比如到了+20 dBFS,在文件中依然有对应的数值来完整记录这个波形,不会被截断。在后期处理中,把信号拉回到 0 dBFS 以下,波形完整还原,没有失真。

    32-bit float 只能防止"数字域"的削波,无法修复"模拟域"的失真。

    • 麦克风振膜过载(模拟失真)→ 32-bit float 救不了。
    • 话放电路饱和(模拟失真)→ 32-bit float 救不了。
    • AD 转换器过载(模拟→数字的硬削波)→ 32-bit float 救不了。

    因为失真发生在 AD 转换之前,信号在进入数字域的那一刻就已经是畸形的了。32-bit float 只是忠实地把这个畸形的波形存了下来,后期再怎么调增益,失真依然在那。

    2-bit float 真正能救的场景是:

    • 信号在 AD 转换时没有过载,但在 DAW 内部处理时(比如叠加多轨、加插件)超过了 0 dBFS。
    • 或者声卡/录音机本身支持 32-bit float 录制,在 AD 转换阶段就通过特殊机制(如双 ADC 架构)避免了削波。


    统一电平

    居家录制人声旁白,后期处理的第一步确实是增益分级(Gain Staging),也就是把电平提升到健康的工作区间。这一步的核心目的,是让信号拥有良好的信噪比,同时给后续的降噪、去混响、EQ和压缩留出充足的动态余量(Headroom),防止处理过程中出现削波失真。对于人声旁白,业界通用的标准如下:

    • 平均电平(RMS):建议控制在-18dBFS 到-12dBFS 之间。这是最理想的“工作区间”,能让后续的降噪器准确识别噪声样本,也能让压缩器更好地工作。
    • 峰值电平(Peak):建议控制在-12dBFS 到-6dBFS 之间。
    • 绝对红线:严禁超过 0dBFS(电平表爆红)。一旦削波失真,后期是无法修复的。

    这一步很重要:

    • 降噪更精准:如果原始信号太弱,直接进降噪器,软件很难准确区分“人声”和“噪声”,降噪效果会大打折扣,甚至产生“水声”伪影。
    • 避免二次失真:如果原始信号已经爆红,再挂任何效果器都是在处理一个已经损坏的信号,输出必然失真。
    • 统一工作标准:把平均电平统一拉到-18dB 左右,后续挂 EQ、压缩时,插件才能工作在最佳状态,参数调整也更有参考性。

    计量单位:

    • 峰值(Peak):只是音频波形中瞬间达到的最高点,它不能代表声音整体的响度。
    • RMS(Root Mean Square):代表信号的平均功率或平均能量。则更接近人耳对声音响度的真实感知。当你听一段人声旁白时,你感觉到的“音量大小”,其实是由 RMS 决定的。
    • dBFS(decibels relative to Full Scale):是数字音频的计量单位。在数字世界里,0dBFS 是绝对的天花板。一旦信号超过 0dBFS,就会发生削波失真(Clipping),声音会变得刺耳、破裂。

    平均电平(RMS):建议控制在-18dBFS 到-12dBFS 之间。将人声旁白的平均电平(RMS)控制在这个区间,主要是为了在信噪比、动态余量和插件工作状态之间找到最佳平衡:

    • 保证良好的信噪比(远离底噪):如果平均电平太低(例如低于-30dBFS),人声信号就会非常微弱,此时环境底噪、设备电流声的相对比例就会变大。将电平提升到-18dB 左右,能让清晰的人声稳稳地“浮”在底噪之上,后续的降噪插件也能更精准地识别并处理噪声。
    • 预留充足的动态余量(Headroom):人说话时会有轻重缓急,瞬间的峰值往往会比平均电平高出 6dB 到 10dB。如果平均电平已经是-6dB,那么说话稍微激动一点,峰值就会轻易撞上 0dBFS 导致失真。将平均电平控制在-18dB 到-12dB,峰值通常会落在-12dB 到-6dB 之间,这就为声音的起伏留出了足够的安全空间。
    • 让后期插件工作在最佳状态:绝大多数专业的音频处理插件(如 EQ、压缩器、混响等)都是基于模拟硬件的特性设计的,它们在接收-18dBFS 左右的电平信号时,能够模拟出最自然、最饱满的音色。如果输入信号太弱,插件可能无法被有效驱动;如果输入信号太强,插件内部处理时又容易产生额外的失真。


    降噪

    前期素材整理除电平与动态范围调整外,还包含基础降噪、去除脉冲噪声(Click、Crackle)、修复直流偏移等。完成基础噪声处理后,再进行整体响度调整、动态范围压缩,这一步才会对峰值振幅和平均 RMS 电平进行精准管控,让指标符合要求。


    交付标准

    国内网络视听节目的行业技术标准GY/T 377-2023《网络视听节目音频响度技术要求和测量方法》。网络视听节目音频实行“双轨制”响度标准:

    • 家庭/办公室等安静环境:目标响度为-24 LUFS(这是目前各大视频平台交付最主流的标准,旨在保留影视作品的动态范围)。
    • 车载/户外等嘈杂环境:目标响度为-15 LUFS。

    注意事项:国内很多短视频或纯网络视频平台(如抖音、快手、B站等)为了听感更“饱满”,通常会将响度提升到-14 LUFS 或-16 LUFS 左右。但如果是交付给爱奇艺用于网络电影、电视剧等正片播放,通常建议遵循-24 LUFS 的广播级/正片交付标准。如果交付的音频超出了容差范围,平台系统可能会自动对其进行响度归一化(响度均衡)处理,这可能会导致你精心调整的动态范围被压缩,影响最终听感。

    • 目标响度:-24 LUFS(容差±2 LUFS)
    • 真峰值电平(True Peak):不超过-1 dBTP
    • 对白响度:建议保持在-20 LUFS 至-12 LUFS 之间,以确保人声的清晰度和可懂度。