Áudio para texto

Converta áudio e vídeo em texto

Transcreva gravações grátis, ouça e corrija cada trecho, e baixe o texto ou as legendas. Sem cadastro.

Transcrição local ou na nuvem O vídeo fica no dispositivo
Áudio para texto
  1. 1Adicionar arquivo
  2. 2Transcrever
  3. 3Revisar e exportar

O áudio fica aqui. O primeiro uso baixa cerca de 100 MB, com cache quando possível. Para gravações longas, prefira um computador.

Modelo ainda sem cache completo

Escolha o idioma falado. A detecção automática está disponível na nuvem.

Dicas de vocabulário são para a nuvem. Você pode corrigir o texto local depois.

Adicione uma gravação

Escolha áudio ou vídeo de até duas horas.

Solte áudio ou vídeo aqui

MP4 · MOV · M4A · MP3 · WAV · AAC · FLAC · WebM · Até 2 horas / 2 GB

Modo local: o áudio não é enviado

O Whisper base reconhece a fala no navegador. Os modelos são baixados deste site. O áudio só é enviado se você escolher a nuvem e iniciar a transcrição.

Com armazenamento disponível, o último rascunho fica neste dispositivo por 7 dias. Após recarregar, escolha o mesmo arquivo para continuar.

Como transformar áudio em texto online

  1. Escolha uma gravação

    Selecione áudio ou vídeo do dispositivo ou experimente o exemplo pronto. Escolha o modo local ou nuvem e o idioma falado. No modo nuvem, informe a grafia correta de nomes ou termos especializados.

  2. Ouça e revise

    Inicie a transcrição e clique no tempo para ouvir o trecho. Ajuste a velocidade, busque palavras e corrija nomes, números ou frases diretamente no editor.

  3. Copie ou exporte

    Copie o texto completo ou baixe TXT, SRT, VTT ou JSON. A exportação inclui suas alterações. A busca filtra o editor, mas não remove trechos do arquivo baixado.

Escolher áudio ou vídeo

Escolha TXT, SRT, VTT ou JSON

Entrada: MP3, M4A, WAV, AAC, FLAC, MP4, MOV e WebM, conforme o codec. Até 2 horas e 2 GB por arquivo; memória e armazenamento do navegador podem impor limites menores. A transcrição reconhece a fala do vídeo, não o texto na imagem.

FormatoQuando usar
TXTTexto sem marcações de tempo para anotações, citações de entrevistas ou documentos.
SRTLegendas numeradas com início e fim para editores e reprodutores compatíveis com SubRip.
VTTLegendas WebVTT para reprodutores web compatíveis. É um arquivo separado, não um vídeo com legendas gravadas na imagem.
JSONTexto, idioma e tempos estruturados. Inclui tempos por palavra quando disponíveis; ao editar um trecho, os tempos por palavra desatualizados são removidos.

Torne a transcrição mais útil

Defina idioma e vocabulário
No modo nuvem, informe a grafia correta de nomes e termos especializados. As dicas ajudam no reconhecimento, mas não garantem cada palavra nem recuperam fala inaudível.
Confira os trechos difíceis
Revise nomes, datas, valores e vozes sobrepostas. Parágrafos longos são divididos por pausas e pontuação quando há tempos reais por palavra.
Retome o trabalho concluído
Na nuvem, falhas temporárias de conexão têm uma nova tentativa automática. Baixe o texto concluído ou tente os trechos pendentes novamente. Com armazenamento local disponível, o último rascunho fica sete dias no dispositivo; escolha o mesmo arquivo após recarregar.

Dúvidas sobre áudio para texto

O conversor de áudio para texto é grátis?

Sim, atualmente não exige conta nem pagamento. O limite é de 2 horas e 2 GB por arquivo, e o processamento depende do serviço e dos recursos do navegador. A capacidade não é ilimitada.

Posso transcrever MP3 ou uma gravação do iPhone?

Sim, escolha um arquivo MP3 ou M4A compatível. Se necessário, salve a gravação em Arquivos primeiro. A ferramenta não acessa seu gravador nem sua conta de mensagens.

Posso converter vídeo em texto ou legendas SRT?

Sim, se houver uma faixa de voz que possa ser lida. Selecione MP4, MOV ou outro formato compatível e exporte SRT ou VTT após revisar. Esta página não lê texto das imagens nem grava legendas no vídeo.

Quais idiomas posso selecionar?

Detecção automática na nuvem, ou inglês, chinês, espanhol, português, japonês, coreano ou francês. A seleção orienta o reconhecimento do idioma original; não traduz a gravação.

Identifica falantes, resume reuniões ou faz ditado ao vivo?

O resultado é uma transcrição com tempos. Não há identificação automática de falantes, resumo de reuniões nem ditado ao vivo pelo microfone. Confira o áudio quando várias pessoas falam ao mesmo tempo.

Onde meus dados são enviados ou salvos?

No modo local, o áudio é processado no navegador e não é enviado. No modo nuvem, trechos de áudio e dicas de vocabulário são enviados ao Cloudflare Whisper. As imagens ficam no dispositivo. Quando possível, o navegador salva localmente o último texto, as edições e os ajustes por sete dias. Recomece ou limpe os dados do site para apagar o rascunho; ele não contém cópias do áudio ou vídeo.

Por que faltam palavras ou a transcrição para?

Ruído, volume baixo, termos incomuns e vozes sobrepostas podem prejudicar o resultado. Codec incompatível ou pouca memória podem impedir a preparação. Tente um arquivo mais curto ou outro formato e compare o texto com o áudio.

Posso transcrever sem enviar o áudio?

Sim. Escolha Neste dispositivo e o idioma falado. O primeiro uso baixa cerca de 100 MB de modelos e bibliotecas. O reconhecimento roda no navegador e o cache depende do armazenamento. A nuvem é uma opção separada que envia áudio e termos ao Cloudflare. Não há troca automática para a nuvem.