Audio a texto

Convierte audio y vídeo en texto

Transcribe grabaciones gratis, escucha y corrige cada fragmento, y descarga texto o subtítulos. Sin registro.

Transcripción local o en la nube El vídeo queda en tu dispositivo
Audio a texto
  1. 1Añadir archivo
  2. 2Transcribir
  3. 3Revisar y exportar

El audio se queda aquí. La primera vez se descargan unos 100 MB, que se guardan en caché si es posible. Para grabaciones largas, usa un ordenador.

Modelo aún sin caché completa

Elige el idioma hablado. La detección automática está disponible en la nube.

Las pistas de vocabulario son para la nube. Puedes corregir el texto local después.

Añade una grabación

Elige un audio o vídeo de hasta dos horas.

Suelta aquí un audio o vídeo

MP4 · MOV · M4A · MP3 · WAV · AAC · FLAC · WebM · Hasta 2 horas / 2 GB

Modo local: no se sube el audio

Whisper base reconoce la voz en el navegador. Los modelos se descargan de este sitio. Solo se envía audio si eliges el modo nube e inicias la transcripción.

Si hay almacenamiento disponible, el último borrador se guarda en este dispositivo durante 7 días. Tras recargar, elige el mismo archivo para continuar.

Cómo pasar audio a texto online

  1. Elige una grabación

    Selecciona audio o vídeo de tu dispositivo, o prueba el ejemplo preparado. Elige el modo local o nube y el idioma hablado. En modo nube, puedes indicar la escritura correcta de nombres o términos especializados.

  2. Escucha y corrige

    Inicia la transcripción y pulsa una marca de tiempo para escuchar el fragmento. Ajusta la velocidad, busca palabras y corrige nombres, cifras o frases directamente en el editor.

  3. Copia o exporta

    Copia todo el texto o descarga TXT, SRT, VTT o JSON. La exportación incluye tus cambios. La búsqueda filtra el editor, pero no elimina fragmentos del archivo descargado.

Elegir audio o vídeo

Elige entre TXT, SRT, VTT y JSON

Entrada: MP3, M4A, WAV, AAC, FLAC, MP4, MOV y WebM, según el códec. Hasta 2 horas y 2 GB por archivo; la memoria y el almacenamiento del navegador pueden imponer límites menores. Se reconoce el habla del vídeo, no el texto de la imagen.

FormatoCuándo usarlo
TXTTexto sin marcas de tiempo para notas, citas de entrevistas o documentos.
SRTSubtítulos numerados con inicio y fin para editores y reproductores compatibles con SubRip.
VTTSubtítulos WebVTT para reproductores web compatibles. Es un archivo separado, no un vídeo con subtítulos incrustados.
JSONTexto, idioma y tiempos estructurados. Incluye tiempos por palabra cuando existen; al editar un fragmento se eliminan sus tiempos por palabra desactualizados.

Mejora la utilidad de tu transcripción

Indica el idioma y los términos
En modo nube, escribe correctamente los nombres y el vocabulario especializado. Las pistas ayudan al reconocimiento, pero no garantizan cada palabra ni recuperan habla inaudible.
Comprueba los pasajes difíciles
Revisa nombres, fechas, cantidades y voces superpuestas. Los párrafos largos se dividen por pausas y puntuación cuando hay tiempos reales por palabra.
Recupera el trabajo completado
El reconocimiento en la nube reintenta una vez los fallos temporales de conexión. Puedes descargar el texto completado o reintentar los fragmentos pendientes. Si hay almacenamiento local, el último borrador dura siete días; vuelve a elegir el mismo archivo tras recargar.

Preguntas sobre audio a texto

¿El conversor de audio a texto es gratis?

Sí, actualmente no requiere cuenta ni pago. El límite es de 2 horas y 2 GB por archivo, y el procesamiento depende del servicio y los recursos del navegador. No es un servicio de capacidad ilimitada.

¿Puedo transcribir un MP3 o una nota de voz del iPhone?

Sí, elige un archivo MP3 o M4A compatible. Si hace falta, guarda primero la nota de voz en Archivos. La herramienta no accede a tu grabadora ni a tu cuenta de mensajería.

¿Puedo convertir un vídeo en texto o subtítulos SRT?

Sí, si contiene una pista de voz que se pueda leer. Selecciona MP4, MOV u otro formato compatible y exporta SRT o VTT tras revisar. Esta página no lee texto de las imágenes ni incrusta subtítulos en el vídeo.

¿Qué idiomas de transcripción puedo seleccionar?

Detección automática en la nube, o inglés, chino, español, portugués, japonés, coreano o francés. La selección ayuda a reconocer el idioma original; no traduce la grabación.

¿Identifica hablantes, resume reuniones o dicta en directo?

Genera una transcripción con tiempos. No ofrece etiquetas automáticas de hablante, resúmenes de reuniones ni dictado de micrófono en directo. Revisa el audio cuando varias personas hablan a la vez.

¿Dónde se envían o guardan mis datos?

En modo local, el audio se queda en tu dispositivo. En modo nube, el audio y las pistas de vocabulario se envían a Cloudflare Whisper. Las imágenes permanecen en tu dispositivo. Si el navegador lo permite, el último texto, los cambios y los ajustes se guardan localmente siete días. Reinicia el trabajo o borra los datos del sitio para eliminar el borrador; no incluye copias del audio o vídeo.

¿Por qué faltan palabras o se detiene la transcripción?

El ruido, el volumen bajo, los términos poco comunes y las voces superpuestas pueden afectar al resultado. Un códec incompatible o poca memoria pueden impedir la preparación. Prueba un archivo más corto u otro formato, reintenta y compara con el audio.

¿Puedo transcribir sin subir el audio?

Sí. Elige En este dispositivo y el idioma hablado. La primera vez se descargan unos 100 MB de modelos y bibliotecas. El reconocimiento se ejecuta en el navegador y la caché depende del almacenamiento. La nube es una opción separada que envía audio y términos a Cloudflare. No se cambia a ella automáticamente.