Colocar um bipe em um trecho
O nome de uma fonte. Um endereço lido em voz alta. Um telefone que alguém falou sem pensar. Esta página é sobre cobrir um trecho de uma gravação com um bipe: o que exatamente é substituído, o que fica intacto e por que é você quem decide onde isso acontece.
Quem marca é você; nós não adivinhamos
As outras ferramentas para isso anunciam detecção automática: transcrevem a gravação, encontram as palavras e oferecem cobri-las. Nós não fazemos isso, e vale ler o motivo antes de escolher a ferramenta.
A detecção automática precisa de uma marcação de tempo por palavra. Para
silenciar uma palavra sem silenciar a frase inteira, algo precisa saber onde aquela
palavra começa e termina, com precisão de centésimos de segundo. Em inglês os
modelos de transcrição entregam isso. Fora do inglês, muitas vezes não: medimos o
whisper-base em chinês e as marcações vieram com granularidade de frase — uma
única fala de 3,8 segundos voltou como um trecho só, de 0,78 a 4,62. Dentro dele
não dá para cobrir um nome; só dá para cobrir a frase toda.
Isso vale para o único modelo que medimos, não para todos que existem. Mas basta para decidir o desenho: um recurso automático que funciona bem em um idioma e mal em outro é pior do que não ter recurso automático, porque olhando o resultado não se descobre em qual dos dois casos você está.
Então o trecho é marcado por você. Leva mais tempo e, em troca, não há falhas por omissão, nem falsos positivos, nem um idioma que funcione pior que outro: aqui não existe etapa de idioma, porque não existe etapa de transcrição.
O que entra no lugar do trecho
Um bipe de 1 kHz, o som que a televisão usa exatamente para isso. Não silêncio.
Essa escolha é de significado, não de qualidade de áudio. Um vão em silêncio é ambíguo: quem ouve não sabe se algo foi coberto de propósito ou se o arquivo está com defeito, a edição deu errado ou o microfone falhou. Um bipe diz uma coisa só, e diz sem margem para dúvida.
O nível fica em torno de metade do nível da sua gravação. Um tom puro no mesmo nível medido da voz é bem mais penetrante que a voz, então não pode simplesmente igualar; quanto abaixar só se julga de ouvido, e foi assim que o valor atual foi escolhido.
As bordas, e por que elas importam
No ponto em que o bipe encontra o seu áudio, os dois têm de se juntar sem um degrau na forma de onda. Sem isso, sai um clique — e um clique em cada ponta é, por si só, um sinal: entrega a qualquer ouvinte o instante exato em que algo foi retirado, que é o contrário do que você veio buscar.
Por isso o bipe começa e termina em zero, e os quatro milissegundos de áudio de cada lado são fundidos nele. Quatro milissegundos é pouco para que o fade seja audível e o bastante para que não haja nada a ouvir na junção: o salto na costura fica uma a duas ordens de magnitude abaixo dos maiores saltos entre amostras consecutivas que já ocorrem naturalmente no mesmo arquivo.
O fade consome uma lasca do áudio que você mantém, nunca do trecho que está sendo coberto. Fundir o lado coberto deixaria escapar os primeiros milissegundos dele em volume baixo. Quatro milissegundos de uma sílaba não são inteligíveis, mas este não é um lugar para acertar aproximadamente.
A duração não muda
A saída tem exatamente o mesmo número de amostras da entrada. Não existe opção de cortar o trecho, e isso é deliberado: encurtar o áudio deixaria fora de sincronia cada quadro de imagem depois daquele ponto.
Justamente porque a duração se mantém, um vídeo continua funcionando. A imagem é copiada sem alteração, o áudio tem a mesma duração de sempre e o movimento dos lábios continua caindo onde caía. Em limpar o áudio de um vídeo está como imagem e som são tratados.
No arquivo completo, no seu navegador
O bipe é aplicado enquanto o arquivo passa em fluxo: lê um bloco, limpa um bloco, escreve um bloco. Então não há limite de duração para contornar: uma entrevista de quarenta minutos é tratada como uma de dois, e o seu arquivo não é enviado a lugar nenhum. Em remover ruído de fundo está como a limpeza funciona e o que ela consegue e não consegue fazer.
Uma consequência dessa forma vale saber: os trechos são marcados antes de o processo começar, ouvindo o seu próprio arquivo original. Não há uma etapa em que você ouve o resultado pronto e depois aponta algo dentro dele — nessa altura a saída já foi escrita.
O que isto não faz
- Não encontra nada para você. Está explicado acima. Se o que você precisa é detecção automática de palavrão e o seu material está em inglês, uma ferramenta feita para isso vai servir melhor do que esta.
- Vale para a limpeza do arquivo completo, não para a prévia de 30 segundos. A prévia existe para você julgar a remoção de ruído; não mexer nela mantém esse julgamento limpo.
- Marcar exige que o seu navegador consiga reproduzir o seu arquivo. O nosso caminho de limpeza abre contêineres que um reprodutor comum não abre, então há arquivos que conseguimos limpar mas não reproduzir para marcação. Quando isso acontece, os controles de marcação desaparecem e dizem o motivo; a limpeza continua funcionando.
- No Firefox a limpeza do arquivo completo não está disponível. Ele não codifica AAC, que é o que a saída precisa, então o bipe não tem onde pousar ali. A prévia de 30 segundos funciona. Medido no Firefox 142.