音频转文字

音频转文字,在线转写录音与视频

免费把录音变成可编辑文字,边听边校对,再下载文稿或字幕文件。无需注册。

本地或云端转写 视频留在你的设备
音频转文字
  1. 1添加文件
  2. 2识别语音
  3. 3校对与导出

音频留在本机。首次下载约 100 MB 模型和运行库,存储可用时会缓存。长录音建议使用电脑。

模型尚未完整缓存

请选择录音中使用的语言。自动识别仅在云端模式提供。

词汇提示仅用于云端转写。本地识别后可直接校对和修改文字。

添加一段录音

选择最长两小时的音频或视频文件。

把音频或视频拖到这里

MP4 · MOV · M4A · MP3 · WAV · AAC · FLAC · WebM · 最长 2 小时 / 最大 2 GB

本地模式:音频不上传

Whisper base 在浏览器内识别,模型文件从本站下载。只有你选择云端模式并开始转写后,音频才会发送到云端。

本地存储可用时,最近一次草稿在本机保留 7 天;刷新后重新选择同一文件即可恢复。

如何在线把音频转成文字

  1. 选择录音或视频

    选择本机文件,也可以先用已准备好的示例体验。选择本地或云端模式,并指定录音语言;云端模式可在人名与专业词汇中填写正确写法,帮助识别专有名词。

  2. 对照原声校对

    开始转写后,点击结果中的时间回听对应位置。调整播放速度、搜索关键词,直接修改人名、数字或听不清的内容。

  3. 复制全文或导出

    复制完整文字,或下载 TXT、SRT、VTT、JSON。导出会包含你的修改;搜索只筛选编辑区,不会删掉下载文稿中的其他片段。

选择音频或视频开始转写

转写结果选 TXT、SRT、VTT 还是 JSON

支持 MP3、M4A、WAV、AAC、FLAC、MP4、MOV、WebM 等格式,能否读取取决于具体编码。单个文件最长 2 小时、最大 2 GB,实际处理还受浏览器内存和存储空间影响。视频转写识别的是音轨中的讲话,不是画面上的文字。

格式适合的用途
TXT不含时间码的纯文字,适合整理录音笔记、引用采访内容,或粘贴到文档。
SRT带序号和起止时间的字幕文件,适合导入支持 SubRip 的剪辑软件或播放器。
VTT适合兼容网页播放器的 WebVTT 字幕。与 SRT 一样,它是独立字幕文件,不是带字幕的视频。
JSON包含语言、文字和分段时间,便于程序处理。模型提供时包含逐词时间;手动修改某段后会移除该段已不匹配的逐词时间。

怎样提高录音转文字的可用性

指定语言,补充术语
选择录音中的语言;云端模式还可填写陌生人名、品牌或专业词汇的正确写法。词汇提示可以辅助识别,但不保证全部识别正确,也无法补回听不清的声音。
重点检查人名、数字和多人对话
回听日期、金额、否定词以及多人同时讲话的片段。模型给出有效逐词时间时,长段落会按停顿和标点拆分,方便校对和导出字幕。
中断后保留已完成的文字
云端识别临时连接失败时会自动重试一次。处理停止后,可先下载已完成文字,再重试未完成部分。本地存储可用时,最近一次草稿在本机保留 7 天;刷新后重新选择同一文件即可恢复。

音频转文字常见问题

音频转文字可以免费使用吗?

可以,目前无需注册或付费。单个文件限制为 2 小时、2 GB,处理还取决于模型服务和浏览器资源;这不代表无限容量或无限并发。

支持 MP3 转文字和 iPhone 录音转文字吗?

支持可读取的 MP3、M4A 等文件。iPhone 语音备忘录可先保存到“文件”,再在这里选择录音。工具不会读取你的录音应用或聊天账号。

可以把视频转成文字或 SRT 字幕吗?

可以,前提是视频中有可读取的讲话音轨。选择 MP4、MOV 等支持文件,校对后导出 SRT 或 VTT。本页不会识别画面字幕,也不会把字幕压进视频画面。

可以选择哪些识别语言?

云端可自动识别;本地需指定语言,可选英语、中文、西班牙语、葡萄牙语、日语、韩语、法语。语言选项用于帮助识别原话,不会把录音翻译成该语言。

能区分说话人、生成会议纪要或实时听写吗?

本页输出带时间的语音转写稿,目前不自动标注说话人、不生成会议摘要,也不提供实时麦克风听写。多人对话尤其是重叠讲话,需要对照原声核对。

音频、词汇提示和转写稿会发送或保存在哪里?

本地模式下,音频在本机识别;云端模式才会将音频片段和词汇提示发送给 Cloudflare Whisper。视频画面始终留在本地。浏览器存储可用时,最近一次文字、修改和设置在本机保留 7 天;开始新任务或清除本站存储可删除本地草稿。草稿不保存原始音视频副本。

为什么出现漏字,或转写中途停止?

音量过低、背景噪音、陌生词和重叠讲话都可能影响识别。编码不受支持或内存不足也可能导致准备失败。可尝试更短文件或其他支持格式,重试失败片段,并回听检查结果。

音频转文字可以不上传录音吗?

可以。选择“本地转写”和录音语言,首次下载约 100 MB 的模型与运行库后,在浏览器内识别。缓存能否复用取决于本机存储。云端转写是单独的选项,会将音频和词汇提示发送给 Cloudflare;本地模式不会自动切换到云端。