去除背景噪音
窗外的车流。一台你一小时前就不再听见的风扇。房间给每一段录音都加上的那层嗡嗡声。 这一页讲的是:什么可以从录音中去除、什么不能,以及怎么在一分钟之内、免费、 不用把文件交给我们,就知道你手上这一条是哪一种。
这个引擎实际在做什么
降噪用的是 DeepFilterNet 3,一个语音增强模型。它没有一条叫「车流」的规则, 也没有一个叫「空调」的开关。它有的是一套学出来的、关于人声每一刻长什么样的概念, 然后把不符合那个概念的部分压下去。
就这么回事。这一点值得弄明白,因为它把问题换掉了:问题不是你遇到的是哪一种噪音, 而是你的人声和它有多容易分开。
它是随着音频往前走、一小段一小段地推理,而不是把整个文件研究一遍 —— 所以 30 秒的预览是几秒钟的事,不是几分钟,在 iPhone 上也一样。 而且因为引擎是跑在你自己浏览器里的 WebAssembly,那几秒钟花的是你设备的算力。
什么情况下有用,什么情况下会吃力
下面这些是从模型的工作方式推出来的,不是我们拿一个和你类似的文件测出来的。 我们完整跑过并且公开的只有一条录音 —— 首页上那条街头采访,连着车流一起。 其余任何说法都是替你猜。
- **比较容易:**一段连续、没有结构的声音垫在清楚的人声后面。可用来分辨两者的信息很多。
- **比较难:旁边有人在说话。**这是个语音模型,所以它保留语音 —— 包括你不想要的那段。 背景里的谈话接近最坏情况,不是容易的那一种。
- **比较难:在时间和频率上都压在人声上的东西。**两者一旦重叠到那个程度, 底下就没剩多少可以重建的了。
- **不在范围内:损伤。**削波、被碰到的话筒、已经埋在噪声底噪之下的人声。 降噪是把东西拿走,它没法把从来没录进去的东西放回来。
- **不知道:房间的回声。**回声是你自己的声音晚一点到,不是叠在上面的另一个东西, 而这个模型能去掉多少我们没有量过。先假设它留着,在播放器上听过再据此安排。
我们不会发一张「我们能搞定的噪音」清单。对你这条录音,诚实的答案是用你这条录音去跑那个 A/B 播放器 —— 这也正是预览免费、而且一分钟之内就有结果的原因。
三档预设,没有哪一档是错的
预览好了之后,三档之间想切多少次都行。切换会重跑降噪,但不重跑其余的工作, 所以几秒钟就回来。
- 均衡 —— 模型自己的默认值。多数文件推荐这一档。
- 强 —— 压得更狠,可能会有水声或机器味。
- 清晰人声 —— 没那么激进,保留更多房间的声音。
降噪是有损处理:处理越强,越可能在去除噪音时一并损失部分人声。如果“均衡”档已经合适,就不需要再加强。 如果不对,判断「强」是改善还是灾难,最快的办法是按下去听。
你的文件不会被上传
这里没有一个可以选择退出的上传步骤。你的浏览器在本地打开文件,而引擎 —— 大约 9 MB 的 WebAssembly —— 会在你选好文件后一次性下载到设备。 打开这一页并不会下载它。你的音频也不会被拿去训练任何东西,这不是一句承诺: 我们做不到,因为我们从来没有收到过它。细节在我们的隐私说明里, 那里也讲了唯一一个将来会不一样的工具。