给录音配音
还没做 届时需要上传文件
这个东西还不存在,而且和这里其它所有东西不一样,它没法在你自己的设备上跑。 这两件事在你往下读之前都值得知道。今天真正能用的那一个是 降噪,它在你的浏览器里跑,什么都不上传。
它打算做什么
拿一段一种语言的录音,还给你同一段录音的另一种语言版本 —— 是说出来的,不是配字幕。 三个模型串在一起:
- 转写语音,并且把不同说话人分开。
- 翻译转写稿,保持每个说话人各自的发言段落不混。
- 重新配音,并且对好时间,让结果仍然能和画面对上。
给多人访谈、播客和课程用 —— 光有字幕不够的那些素材。
这一个会上传你的文件
**它是这个站上唯一会这么做的东西。**我们把这句话放在这里、靠上的位置, 而不是放在底部的小字里,因为这个站其余部分说的是相反的话、而且说的是真话: 降噪没有上传这一步,讲降噪的那些页面也都直说了。那些说法针对的是那个工具。 这一个不一样,而如果你只读了首页,你不会猜到。
原因是尺寸,不是偏好。降噪是以大约 9 MB 的 WebAssembly 发到你这边、在你设备上跑的。 而语音识别、翻译、语音合成是三个各自独立的模型,每一个都明显比那大得多, 没有哪一个是我们能重做得小到塞进浏览器的。跑它们就意味着在服务器上跑, 而在服务器上跑就意味着你的录音要去那里。
所以如果这件事对你的素材是个问题 —— 而对于有保密协议的采访、 或者一个答应和你谈、但没答应和我们谈的信息源来说,它就该是个问题 —— 那么诚实的回答是:这个工具不适合那种素材, 而匿名化才是冲着那种情况去的那一个。
缺的是什么
三个模型串在一起 —— 转写、翻译、语音合成,没有一个塞得进浏览器。它需要一个我们还没有的后端。
那是一个真实的缺口,不是排期问题。这个站上到目前为止的一切,都建立在 「我们从不持有你的文件」这个前提上,那也正是这里没有账号体系、不存储文件, 也不产生服务器账单的原因。配音则需要账号、存储和计费机制。要把它做对,意味着在动手实现之前 就要定下:一个文件保留多久、谁能取到它、任务跑到一半失败了会怎样、 以及这东西每分钟成本多少。
没有上线日期,这一页也不收集邮箱地址。我们的支持邮箱只收信不发信, 所以放一个表单在这儿只会拿走你的地址然后什么都不做。
如果你现在就需要
有好几家商业服务今天就在做配音,而它们同样都会上传你的文件 —— 那一步不是我们会走的捷径,它们也不会绕过。如果你的录音敏感, 要问它们任何一家的问题是:保留多久、以及会不会拿去训练什么。 如果不敏感,它们今天做出来的东西会比一个还不存在的工具好。