音声からテキスト

音声・動画を無料で文字起こし

録音を編集できるテキストに変換。原音を聞きながら確認し、文章や字幕ファイルとして保存できます。登録不要。

端末またはクラウドで文字起こし 動画は端末内に保持
音声からテキスト
  1. 1ファイルを追加
  2. 2文字起こし
  3. 3確認・保存

音声は端末内に残ります。初回に約100 MBをダウンロードし、保存可能ならキャッシュします。長い録音にはパソコンをおすすめします。

モデルは未キャッシュ

録音の言語を選んでください。自動検出はクラウドのみです。

用語のヒントはクラウド専用です。端末で認識した文章は後から編集できます。

録音を追加

2 時間以内の音声または動画を選択してください。

音声または動画をここにドロップ

MP4 · MOV · M4A · MP3 · WAV · AAC · FLAC · WebM · 最長2時間 / 最大2 GB

端末モード:音声をアップロードしません

Whisper baseがブラウザー内で認識します。モデルはこのサイトからダウンロードします。クラウドを選んで開始するまで、音声は送信されません。

端末に保存できる場合、最新の下書きを7日間保持します。再読み込み後は同じファイルを選ぶと再開できます。

音声をオンラインで文字起こしする方法

  1. 録音や動画を選ぶ

    端末内のファイルを選ぶか、用意されたサンプルを試します。端末内またはクラウド処理と音声の言語を選びます。クラウド処理では人名や専門用語を任意で入力できます。

  2. 原音を聞いて編集する

    文字起こし後、時刻を押すとその位置から再生できます。速度を調整し、語句を検索して、人名や数字、聞き取りにくい箇所を直接修正します。

  3. コピー・保存する

    全文をコピーするか、TXT・SRT・VTT・JSONで保存します。編集内容は出力に反映されます。検索で非表示になった区間も、出力ファイルには含まれます。

音声・動画を選んで開始

TXT・SRT・VTT・JSONの選び方

入力はMP3・M4A・WAV・AAC・FLAC・MP4・MOV・WebMなど。実際の対応はコーデックによります。1ファイル最長2時間・最大2 GBで、ブラウザーのメモリや保存容量によってさらに制限される場合があります。動画の音声を認識し、映像中の文字は読み取りません。

形式用途
TXT時刻を含まないプレーンテキスト。録音メモや取材の引用、文書への貼り付けに適しています。
SRT連番と開始・終了時刻を含む字幕。SubRipに対応した動画編集ソフトやプレーヤーで使えます。
VTT対応するウェブプレーヤー向けのWebVTT字幕。映像に字幕を焼き込んだ動画ではなく、独立した字幕ファイルです。
JSON言語・文章・区間の時刻を構造化して保存します。利用可能な場合は単語の時刻も含みますが、手動で編集した区間では古い単語時刻を削除します。

文字起こしを使いやすくするコツ

言語と用語を指定する
クラウド処理では人名や製品名、専門用語の正しい表記を入力できます。認識の手掛かりになりますが、すべての単語の正しさや聞こえない音声の復元は保証できません。
数字や会話を重点的に確認する
人名・日付・金額や声が重なる部分は原音と照合します。有効な単語時刻がある場合、長い段落を間や句読点に合わせて分けます。
中断しても完了分を活用する
クラウド認識の一時的な通信障害は一度自動で再試行します。完了した文章を保存するか、未完了分を再試行できます。端末に保存できる場合、最新の下書きを7日間保持し、再読み込み後に同じファイルを選ぶと復元できます。

音声文字起こしのよくある質問

文字起こしは無料ですか?

現在、登録や支払いなしで利用できます。1ファイル最長2時間・最大2 GBで、処理はモデルサービスとブラウザーのリソースに依存します。無制限の処理能力を提供するものではありません。

MP3やiPhoneのボイスメモを文字にできますか?

対応するMP3やM4Aを選択できます。必要に応じてボイスメモを「ファイル」に保存してから選んでください。録音アプリやメッセージのアカウントにアクセスする機能はありません。

動画から文章やSRT字幕を作れますか?

読み取れる音声トラックに発話があれば可能です。MP4・MOVなどを選び、確認後にSRTやVTTを保存します。画面上の文字の認識や、映像への字幕の焼き込みはこのページでは行いません。

どの言語を指定できますか?

クラウドでは自動検出も利用できます。端末内処理では言語を指定します。英語・中国語・スペイン語・ポルトガル語・日本語・韓国語・フランス語を指定できます。元の言語の認識を助ける設定で、録音を翻訳する設定ではありません。

話者の識別、議事録の要約、リアルタイム入力はできますか?

時刻付きの文字起こしを作成するツールです。話者の自動ラベル、会議の要約、マイクによるリアルタイム入力には対応していません。複数人が同時に話す部分は原音を確認してください。

音声や文章はどこに送信・保存されますか?

端末内処理では音声を送信しません。クラウド処理では音声区間と入力した用語をCloudflare Whisperに送信します。映像は端末に残ります。保存可能な場合、最新の文章・編集・設定をブラウザー内に7日間保持します。最初からやり直すかサイトデータを消去すると削除できます。下書きに音声や動画のコピーは保存しません。

単語が抜けたり、処理が止まったりするのはなぜですか?

小さな音量、雑音、珍しい用語、声の重なりは認識に影響します。非対応コーデックやメモリ不足では準備が止まる場合もあります。短いファイルや別の対応形式で再試行し、原音と比較してください。

音声をアップロードせずに文字起こしできますか?

はい。端末で文字起こしと録音の言語を選びます。初回にモデルと実行ライブラリー約100 MBをダウンロードし、ブラウザー内で認識します。キャッシュは保存容量によります。クラウドは別の選択肢で、音声と用語をCloudflareに送信します。自動でクラウドには切り替わりません。