오디오를 텍스트로

음성과 영상을 무료로 텍스트로 변환

녹음을 편집 가능한 텍스트로 바꾸세요. 원음을 듣고 수정한 뒤 문서나 자막 파일로 저장할 수 있습니다. 가입이 필요 없습니다.

기기 또는 클라우드 변환 영상은 기기에 유지
오디오를 텍스트로
  1. 1파일 추가
  2. 2음성 인식
  3. 3검토 및 저장

오디오는 기기에 남습니다. 처음 약 100 MB를 다운로드하며 저장 공간이 있으면 캐시합니다. 긴 녹음에는 컴퓨터를 권장합니다.

모델이 아직 완전히 캐시되지 않음

녹음 언어를 선택하세요. 자동 감지는 클라우드에서만 제공됩니다.

용어 힌트는 클라우드 전용입니다. 기기에서 인식한 텍스트는 나중에 수정할 수 있습니다.

녹음 추가

최대 2시간의 오디오 또는 영상을 선택하세요.

오디오 또는 영상을 여기에 놓으세요

MP4 · MOV · M4A · MP3 · WAV · AAC · FLAC · WebM · 최대 2시간 / 2 GB

기기 모드: 오디오를 업로드하지 않습니다

Whisper base가 브라우저에서 인식하며 모델은 이 사이트에서 다운로드합니다. 직접 클라우드를 선택하고 시작해야 오디오가 전송됩니다.

기기에 저장할 수 있으면 최근 초안을 7일 동안 유지합니다. 새로고침 후 같은 파일을 선택하면 이어서 작업할 수 있습니다.

온라인에서 음성을 텍스트로 바꾸는 방법

  1. 녹음이나 영상 선택

    기기의 파일을 선택하거나 준비된 예제를 사용하세요. 기기 또는 클라우드 모드와 음성 언어를 선택하세요. 클라우드 모드에서는 이름이나 전문 용어를 입력할 수 있습니다.

  2. 듣고 수정하기

    받아쓰기 후 시간을 누르면 해당 구간을 들을 수 있습니다. 재생 속도를 조절하고 단어를 검색해 이름, 숫자, 불명확한 문장을 직접 수정하세요.

  3. 복사 또는 저장

    전체 텍스트를 복사하거나 TXT, SRT, VTT, JSON으로 저장하세요. 수정 내용이 반영됩니다. 검색으로 숨겨진 구간도 다운로드 파일에는 포함됩니다.

오디오나 영상 선택

TXT·SRT·VTT·JSON 중 어떤 형식을 선택할까요?

MP3, M4A, WAV, AAC, FLAC, MP4, MOV, WebM 등을 지원하며 실제 호환성은 코덱에 따라 다릅니다. 파일당 최대 2시간, 2 GB이며 브라우저 메모리와 저장 공간에 따라 더 작은 제한이 생길 수 있습니다. 영상의 말소리를 인식하며 화면 속 글자는 읽지 않습니다.

형식사용 목적
TXT시간 정보가 없는 일반 텍스트입니다. 녹음 메모, 인터뷰 인용, 문서에 붙여 넣을 때 적합합니다.
SRT번호와 시작·종료 시간이 있는 자막입니다. SubRip을 지원하는 편집기와 플레이어에서 사용할 수 있습니다.
VTT지원되는 웹 플레이어용 WebVTT 자막입니다. 화면에 자막을 입힌 영상이 아닌 별도 자막 파일입니다.
JSON텍스트, 언어, 구간 시간을 구조화해 저장합니다. 가능한 경우 단어별 시간도 포함되며, 직접 수정한 구간의 오래된 단어별 시간은 제거됩니다.

더 유용한 받아쓰기를 위한 팁

언어와 용어 지정
클라우드 모드에서는 이름, 브랜드, 전문 용어의 정확한 표기를 입력하세요. 인식에 도움이 되지만 모든 단어의 정확성이나 들리지 않는 음성의 복원을 보장하지는 않습니다.
어려운 구간 확인
이름, 날짜, 금액과 여러 목소리가 겹치는 구간을 원음과 비교하세요. 유효한 단어별 시간이 있으면 긴 문단을 쉼과 문장 부호에 따라 나눕니다.
완료된 작업 이어가기
클라우드 인식의 일시적인 연결 오류는 한 번 자동으로 재시도합니다. 완료된 텍스트를 저장하거나 남은 구간을 다시 시도할 수 있습니다. 저장 공간이 있으면 최근 초안을 기기에 7일간 보관하며 새로고침 후 같은 파일을 선택하면 복원됩니다.

음성 텍스트 변환 자주 묻는 질문

음성을 텍스트로 무료 변환할 수 있나요?

현재 계정이나 결제 없이 사용할 수 있습니다. 파일당 최대 2시간, 2 GB이며 모델 서비스와 브라우저 자원에 따라 처리 가능 여부가 달라집니다. 무제한 처리 용량을 제공하는 서비스는 아닙니다.

MP3나 iPhone 음성 메모도 변환할 수 있나요?

지원되는 MP3 또는 M4A 파일을 선택할 수 있습니다. 필요한 경우 음성 메모를 파일 앱에 저장한 뒤 선택하세요. 녹음 앱이나 메시지 계정에 접근하지 않습니다.

영상을 텍스트나 SRT 자막으로 바꿀 수 있나요?

읽을 수 있는 음성 트랙에 말소리가 있으면 가능합니다. MP4, MOV 등 지원 파일을 선택하고 검토한 뒤 SRT나 VTT로 저장하세요. 이 페이지는 화면 속 글자를 인식하거나 영상에 자막을 입히지 않습니다.

어떤 음성 언어를 선택할 수 있나요?

클라우드 자동 감지 또는 영어, 중국어, 스페인어, 포르투갈어, 일본어, 한국어, 프랑스어를 선택할 수 있습니다. 원래 언어의 인식을 돕는 설정이며 번역 기능이 아닙니다.

화자 구분, 회의 요약, 실시간 받아쓰기도 되나요?

시간 정보가 있는 받아쓰기 텍스트를 제공합니다. 화자 자동 표시, 회의 요약, 마이크 실시간 받아쓰기는 제공하지 않습니다. 여러 사람이 동시에 말하면 원음과 비교해 확인하세요.

오디오와 텍스트는 어디로 전송되거나 저장되나요?

기기 모드에서는 오디오를 전송하지 않습니다. 클라우드 모드에서는 오디오 구간과 입력한 용어를 Cloudflare Whisper로 전송합니다. 영상 화면은 기기에 남습니다. 저장이 가능하면 최근 텍스트, 수정 내용, 설정을 브라우저에 7일간 보관합니다. 새 작업을 시작하거나 사이트 저장 데이터를 지워 삭제할 수 있으며, 초안에 원본 미디어 사본은 저장하지 않습니다.

단어가 빠지거나 처리가 멈추는 이유는 무엇인가요?

작은 음량, 잡음, 낯선 용어, 겹치는 목소리는 인식에 영향을 줍니다. 지원하지 않는 코덱이나 메모리 부족으로 준비가 중단될 수도 있습니다. 짧은 파일이나 다른 지원 형식으로 다시 시도하고 원음과 비교하세요.

오디오를 업로드하지 않고 변환할 수 있나요?

네. 기기에서 변환과 녹음 언어를 선택하세요. 처음에 모델과 실행 라이브러리 약 100 MB를 다운로드한 뒤 브라우저에서 인식합니다. 캐시 재사용은 저장 공간에 따라 다릅니다. 클라우드는 별도 옵션으로 오디오와 용어를 Cloudflare에 보냅니다. 자동으로 클라우드로 전환하지 않습니다.