Remova o ruído de fundo
O ruído pode ser o trânsito do outro lado da janela, um ventilador que você deixou de perceber depois de uma hora ou o zumbido que a sala acrescenta a tudo que é gravado nela. Esta página explica o que pode ser removido de uma gravação, quais são os limites e como avaliar o seu caso — em um minuto, de graça, sem nos mandar o arquivo.
Como funciona o modelo
A limpeza usa o DeepFilterNet 3, um modelo de realce de voz. Ele não tem nenhuma regra para "trânsito" nem nenhum ajuste para "ar-condicionado". O que ele aprendeu foram as características da fala humana a cada instante; o que não corresponde a elas é atenuado.
É só isso, e vale entender, porque muda a pergunta. A questão não é qual é o seu ruído, mas até que ponto a voz pode ser separada dele.
Ele trabalha em trechos curtos conforme o áudio passa, em vez de estudar o arquivo inteiro. Por isso, uma prévia de 30 segundos leva segundos, não minutos — inclusive em um iPhone. Como o motor WebAssembly roda no seu próprio navegador, todo esse processamento acontece no seu dispositivo.
Cenários favoráveis e limitações
O que vem abaixo é raciocínio a partir de como o modelo funciona, não um teste que fizemos com um arquivo como o seu. Processamos e publicamos exatamente uma gravação completa — a entrevista de rua da página inicial, com trânsito e tudo. Qualquer outra afirmação seria apenas especulação.
- Mais fácil: um som contínuo e sem estrutura atrás de uma voz clara. Há informação suficiente para distinguir uma coisa da outra.
- Mais difícil: outras pessoas falando. Este é um modelo de processamento de fala, então ele preserva vozes — inclusive a que você não queria. Conversa de fundo está perto do pior caso, não do fácil.
- Mais difícil: qualquer coisa sobreposta à voz em tempo e frequência ao mesmo tempo, porque uma sobreposição tão próxima deixa pouca informação para separar os dois sons.
- Fora de alcance: áudio danificado. Isso inclui clipping, um impacto no microfone e uma voz já enterrada sob o piso de ruído. A remoção de ruído não reconstrói o que nunca foi gravado.
- Não sabemos: a reverberação da sala. O eco é a própria voz chegando com atraso, não um som independente sobreposto, e não medimos quanto disso este modelo remove. Considere que a reverberação permanecerá e confirme o resultado no player antes de planejar o restante do trabalho.
Não vamos publicar uma tabela de tipos de ruído que conseguimos remover. A resposta honesta está em ouvir a sua própria gravação no player A/B, por isso a prévia é grátis e leva menos de um minuto.
Como escolher entre os três ajustes
Quando a prévia estiver pronta, você poderá alternar entre três ajustes quantas vezes quiser. Ao trocar de ajuste, a limpeza é refeita, mas o restante do trabalho não; o resultado volta em segundos.
- Equilibrado — a configuração padrão do próprio modelo. Recomendado para quase tudo.
- Forte — aplica uma limpeza mais intensa e pode soar aguado ou robótico.
- Voz clara — menos agressivo, deixa mais da sala.
Remover ruído causa alguma perda: parte dos detalhes da voz pode ser sacrificada para reduzir o ruído. Se Equilibrado já soar bem, pare aí. Se não, o jeito mais rápido de saber se Forte é uma melhora ou um desastre é selecioná-lo e ouvir.
Processamento local, sem envio do arquivo
Não existe etapa de envio. O seu navegador abre o arquivo localmente, e o motor — cerca de 9 MB de WebAssembly — é baixado para você uma vez, depois que você escolhe um arquivo. Entrar nesta página não baixa nada. O seu áudio também nunca é usado para treinar modelos. Isso não é apenas uma promessa: seria impossível, porque nunca recebemos o arquivo. Os detalhes estão na nossa nota de privacidade, que também cobre a única ferramenta prevista que funcionaria de outro jeito.