Limpia un archivo de audio
Notas de voz, entrevistas, grabaciones de clase: cualquier archivo con una persona hablando y el sonido de una sala de fondo. Aquí encontrarás las especificaciones: qué archivos se admiten, cómo se procesan, qué obtienes y dónde encaja este paso en tu flujo de trabajo.
Qué archivos entran
mp3, wav, m4a, aac, flac y ogg, además de la pista de audio de la mayoría de los vídeos. Esta lista es orientativa, no una garantía: identificamos el formato leyendo el inicio del archivo en vez de confiar en su extensión, por lo que un archivo renombrado se procesa según su formato real.
Si tu navegador no puede decodificar un archivo concreto, verás un mensaje de error. Convertirlo primero a mp3 o wav casi siempre resuelve el problema. Es una alternativa real: en esos casos falta un demultiplexor para el contenedor, no la función de eliminación de ruido.
Qué leemos y qué nos saltamos
En archivos mp4, m4a, aac o mp3 independientes, extraemos solo el fragmento necesario mediante el índice del propio archivo y leemos únicamente esos bytes. Así, una grabación larga no tiene que caber entera en la memoria. En una prueba con un archivo grande, este método utilizó unas 103 veces menos memoria que decodificar el archivo completo.
Los formatos abiertos y sin pérdida —wav, flac, ogg y webm— todavía no disponen de esa vía, por lo que se decodifican por completo. Esto funciona bien con duraciones normales, pero un archivo muy largo puede agotar la memoria del navegador. En ese caso, un mp3 o m4a de la misma grabación permite usar la ruta que consume menos memoria.
A cada archivo le pasan dos cosas antes de que el modelo lo vea, y las dos conviene saberlas:
- Todo se suma a un solo canal a 48 kHz. El modelo es monocanal, así que esto no es una preferencia. Si tu grabación es estéreo, o tiene dos micrófonos en canales separados, se mezclan primero — mira la página de pódcast para cuándo eso importa y qué hacer en su lugar.
- Seleccionamos los 30 segundos con mayor volumen, no los 30 primeros. Al principio de una grabación suele oírse una silla, un carraspeo o un «¿está grabando?». Evaluar el resultado con ese fragmento podría hacerlo parecer peor de lo que es. La tarjeta de resultado indica qué tramo se utilizó.
Qué vuelve
Un WAV mono de 16 bits a 48 kHz, de unos 2,9 MB para 30 segundos. Usamos WAV porque los navegadores no incluyen un codificador de audio de uso general. Generar un mp3 exigiría descargar otro codificador además de los 9 MB del motor, un costo desproporcionado para la descarga.
No igualamos el volumen de las dos versiones. En la muestra de la página principal, el original mide −11,6 LUFS y la versión limpia, −13,7 LUFS: unos 2 LU menos. No es un error; eliminar ruido reduce energía y ocurrirá lo mismo con tu archivo. Igualar los niveles favorecería artificialmente la comparación y ocultaría un dato que necesitas antes de ajustar el volumen.
Dónde va esto en tu cadena
- Limpia primero, ajusta los niveles después y masteriza al final. Como no normalizamos, la salida tiene menos volumen que la entrada. Por eso, todo proceso que determine el volumen de entrega debe ir después de este paso. Si nivelas primero un archivo con ruido, tomarás como referencia un piso de ruido que está a punto de cambiar.
- Hazlo antes de la música y los efectos. El modelo conserva lo que reconoce como voz y atenúa el resto, así que una base musical debajo de la voz es precisamente el tipo de sonido que intentará eliminar. Limpia la voz y añade la música después.
- No es un ecualizador. No elimina sibilancias, no modifica el timbre ni repara audio saturado o distorsionado. Un solo trabajo.