Colocar um bipe em um trecho

O nome de uma fonte. Um endereço lido em voz alta. Um telefone que alguém falou sem pensar. Esta página é sobre cobrir um trecho de uma gravação com um bipe: o que exatamente é substituído, o que fica intacto e por que é você quem decide onde isso acontece.

Quem marca é você; nós não adivinhamos

As outras ferramentas para isso anunciam detecção automática: transcrevem a gravação, encontram as palavras e oferecem cobri-las. Nós não fazemos isso, e vale ler o motivo antes de escolher a ferramenta.

A detecção automática precisa de uma marcação de tempo por palavra. Para silenciar uma palavra sem silenciar a frase inteira, algo precisa saber onde aquela palavra começa e termina, com precisão de centésimos de segundo. Em inglês os modelos de transcrição entregam isso. Fora do inglês, muitas vezes não: medimos o whisper-base em chinês e as marcações vieram com granularidade de frase — uma única fala de 3,8 segundos voltou como um trecho só, de 0,78 a 4,62. Dentro dele não dá para cobrir um nome; só dá para cobrir a frase toda.

Isso vale para o único modelo que medimos, não para todos que existem. Mas basta para decidir o desenho: um recurso automático que funciona bem em um idioma e mal em outro é pior do que não ter recurso automático, porque olhando o resultado não se descobre em qual dos dois casos você está.

Então o trecho é marcado por você. Leva mais tempo e, em troca, não há falhas por omissão, nem falsos positivos, nem um idioma que funcione pior que outro: aqui não existe etapa de idioma, porque não existe etapa de transcrição.

O que entra no lugar do trecho

Um bipe de 1 kHz, o som que a televisão usa exatamente para isso. Não silêncio.

Essa escolha é de significado, não de qualidade de áudio. Um vão em silêncio é ambíguo: quem ouve não sabe se algo foi coberto de propósito ou se o arquivo está com defeito, a edição deu errado ou o microfone falhou. Um bipe diz uma coisa só, e diz sem margem para dúvida.

O nível fica em torno de metade do nível da sua gravação. Um tom puro no mesmo nível medido da voz é bem mais penetrante que a voz, então não pode simplesmente igualar; quanto abaixar só se julga de ouvido, e foi assim que o valor atual foi escolhido.

As bordas, e por que elas importam

No ponto em que o bipe encontra o seu áudio, os dois têm de se juntar sem um degrau na forma de onda. Sem isso, sai um clique — e um clique em cada ponta é, por si só, um sinal: entrega a qualquer ouvinte o instante exato em que algo foi retirado, que é o contrário do que você veio buscar.

Por isso o bipe começa e termina em zero, e os quatro milissegundos de áudio de cada lado são fundidos nele. Quatro milissegundos é pouco para que o fade seja audível e o bastante para que não haja nada a ouvir na junção: o salto na costura fica uma a duas ordens de magnitude abaixo dos maiores saltos entre amostras consecutivas que já ocorrem naturalmente no mesmo arquivo.

O fade consome uma lasca do áudio que você mantém, nunca do trecho que está sendo coberto. Fundir o lado coberto deixaria escapar os primeiros milissegundos dele em volume baixo. Quatro milissegundos de uma sílaba não são inteligíveis, mas este não é um lugar para acertar aproximadamente.

A duração não muda

A saída tem exatamente o mesmo número de amostras da entrada. Não existe opção de cortar o trecho, e isso é deliberado: encurtar o áudio deixaria fora de sincronia cada quadro de imagem depois daquele ponto.

Justamente porque a duração se mantém, um vídeo continua funcionando. A imagem é copiada sem alteração, o áudio tem a mesma duração de sempre e o movimento dos lábios continua caindo onde caía. Em limpar o áudio de um vídeo está como imagem e som são tratados.

No arquivo completo, no seu navegador

O bipe é aplicado enquanto o arquivo passa em fluxo: lê um bloco, limpa um bloco, escreve um bloco. Então não há limite de duração para contornar: uma entrevista de quarenta minutos é tratada como uma de dois, e o seu arquivo não é enviado a lugar nenhum. Em remover ruído de fundo está como a limpeza funciona e o que ela consegue e não consegue fazer.

Uma consequência dessa forma vale saber: os trechos são marcados antes de o processo começar, ouvindo o seu próprio arquivo original. Não há uma etapa em que você ouve o resultado pronto e depois aponta algo dentro dele — nessa altura a saída já foi escrita.

O que isto não faz