播客录音的降噪
一位嘉宾用笔记本的话筒,房间里有台冰箱。一场在咖啡馆录的采访,因为那是对方愿意见面的地方。 这一页讲的是:降噪在一期节目的工作流里该放在哪、该喂给它什么,以及它修不了什么。
处理每一条分轨,不是处理缩混
如果你的录音设备或远程平台给了你每支话筒一个文件,那些文件才是输入 —— 不是缩混。 三条理由,没有一条是「模型对单轨更聪明」:
- **每次运行只有一个预设。**你那位在处理过的房间里的搭档,和你那位用厨房笔记本的嘉宾, 需要的处理量不一样。在缩混里你只能挑一个折中值;分轨的话你可以放过一条、压另一条。
- **输出是单声道。**模型跑之前一切都会被并成一个声道,因为模型是单通道的。 喂给它一个立体声缩混,立体声就没了。先处理分轨,再缩混 —— 声像还在。
- **它不可逆。**把降噪拍进缩混,之后的每一个决定都是在它之上做的。 分轨的话,你手上仍然有原轨和处理后的那一版并排放着。
在调电平之前做这件事
我们不做任何响度归一化,而把噪音拿走就是把能量拿走:在我们自己的样例上, 处理后的版本比原版约低 2 LU。所以压缩、调平、以及你用来达到交付标准的一切, 都属于这一步之后。先给一条有噪音的轨调电平,等于是对着一个即将移动的底噪 做了所有判断。
音乐和音效也在它之后。模型保留它认得出是语音的部分,把其余压下去, 所以垫在人声底下的音乐床,正是它被造出来要去除的那类东西。先处理人声,再把音乐铺上去。
它修不了什么
- **房间里另一场对话。**这是个语音模型 —— 它保留语音,包括你不想要的那段。 你嘉宾身后咖啡馆的那张桌子,对它来说接近最坏情况,不是容易的那一种。
- **房间的回声。**一位在空卧室里的嘉宾,听到的是自己的声音晚一点到, 那和叠在上面的噪音是不同的问题。这个模型能去掉多少我们没量过; 先假设它留着,在播放器上听过再说。
- **削波和失真。**如果话筒被撞了、或者增益被顶死了,那段录音本身就缺信息。 降噪是把东西拿走,它没法把从来没录进去的东西放回来。 这些限制是从哪来的。
拿一期节目试
预览会挑你丢进来的东西里最响的 30 秒 —— 那是对「有代表性的一段」的一个合理猜测, 但不是你担心的那一段。如果有具体的某两分钟是空调启动的时候,把那一段单独导出来试, 你从最糟的那一段里学到的会比从最好的那一段里多。
从均衡开始。如果你要上强,注意听呼吸声、齿音和词尾 —— 过度处理最先在那里露出水声或机器味。清晰人声做得更少、留下更多房间的声音, 在噪音不重、而人声比安静更要紧的时候,那往往才是对的答案。 切换预设几秒钟就重跑完,所以三档都试过再决定。
预览的用处,是让你在把一整期节目交给它之前,先用你自己的录音验一下这条路。 一旦听着对了,同一张卡片会清洗完整的文件 —— 免费、在你自己的机器上, 而对一期一小时的节目来说,那是真的要等一会儿,不是一瞬间的事。