去除背景噪音

窗外的车流。一台你一小时前就不再听见的风扇。房间给每一段录音都加上的那层嗡嗡声。 这一页讲的是:什么可以从录音中去除、什么不能,以及怎么在一分钟之内、免费、 不用把文件交给我们,就知道你手上这一条是哪一种。

这个引擎实际在做什么

降噪用的是 DeepFilterNet 3,一个语音增强模型。它没有一条叫「车流」的规则, 也没有一个叫「空调」的开关。它有的是一套学出来的、关于人声每一刻长什么样的概念, 然后把不符合那个概念的部分压下去。

就这么回事。这一点值得弄明白,因为它把问题换掉了:问题不是你遇到的是哪一种噪音, 而是你的人声和它有多容易分开。

它是随着音频往前走、一小段一小段地推理,而不是把整个文件研究一遍 —— 所以 30 秒的预览是几秒钟的事,不是几分钟,在 iPhone 上也一样。 而且因为引擎是跑在你自己浏览器里的 WebAssembly,那几秒钟花的是你设备的算力。

什么情况下有用,什么情况下会吃力

下面这些是从模型的工作方式推出来的,不是我们拿一个和你类似的文件测出来的。 我们完整跑过并且公开的只有一条录音 —— 首页上那条街头采访,连着车流一起。 其余任何说法都是替你猜。

我们不会发一张「我们能搞定的噪音」清单。对你这条录音,诚实的答案是用你这条录音去跑那个 A/B 播放器 —— 这也正是预览免费、而且一分钟之内就有结果的原因。

三档预设,没有哪一档是错的

预览好了之后,三档之间想切多少次都行。切换会重跑降噪,但不重跑其余的工作, 所以几秒钟就回来。

降噪是有损处理:处理越强,越可能在去除噪音时一并损失部分人声。如果“均衡”档已经合适,就不需要再加强。 如果不对,判断「强」是改善还是灾难,最快的办法是按下去听。

你的文件不会被上传

这里没有一个可以选择退出的上传步骤。你的浏览器在本地打开文件,而引擎 —— 大约 9 MB 的 WebAssembly —— 会在你选好文件后一次性下载到设备。 打开这一页并不会下载它。你的音频也不会被拿去训练任何东西,这不是一句承诺: 我们做不到,因为我们从来没有收到过它。细节在我们的隐私说明里, 那里也讲了唯一一个将来会不一样的工具。