如何为 YouTube 视频和播客制作 AI 配音
浏览器自带的文本转语音,用来起草脚本、估算时长确实很有用。但要把它变成一个可以发布的配音文件,就是另一回事了。在围绕它安排工作流程之前,最好先弄清楚其中的原因。
被叫作“文本转语音”的,其实是两种东西
这个说法涵盖了两种听起来完全不同的技术,关于合成配音的大部分误解,正是从这里开始的。
第一种是操作系统内置的语音合成器,网页通过 Web Speech API 调用它。当前的各款浏览器都提供这个接口。它免费、即开即用、无需下载,音质从尚可到一听就是合成音不等,取决于您的电脑上恰好装了哪些语音。
第二种是神经网络模型,它根据文本预测出波形。人们说“AI 语音”时,指的就是这种。它听起来像一个会呼吸的真人,要么运行在别人的服务器上,通过付费 API 调用;要么以模型文件的形式运行,而这个文件大到下载它必然是有意为之,而不是一不小心。
本站工具的播放功能属于第一种。语音列表不是我们提供的,而是您的操作系统自带的。所以同一个页面在 Windows、macOS、Android 和 iOS 上听起来各不相同,同事推荐的某个语音也可能根本不会出现在您的下拉列表里。语速和音调滑块调整的是这个系统语音,并不会切换引擎。
决定一切的限制:无法录制
介绍浏览器配音的文章往往会跳过这一点。Web Speech API 没有给网页提供任何捕获自身音频的途径。
网页调用 speechSynthesis.speak() 时,浏览器会把音频直接送到系统的输出设备。这个 API 不返回媒体流,不返回 Web Audio 节点,也不返回采样缓冲区。没有东西可以接到录音器上,也没有东西可以编码。网页可以开始朗读、暂停和停止,但无法保存。
这带来一个很直接的后果:任何提供 Web Speech 语音下载的浏览器工具,给您的都不是您刚才听到的那个声音。它是用别的方式生成了音频,再把那段音频交给您。
本站的下载按钮也不例外。与其让您照着生成的音频剪完视频才发现,我们宁愿在这里先说清楚。预览播放的是您操作系统的语音。下载则由页面内运行的一个小型共振峰合成器写出 WAV 文件:声门声源经过共振滤波器,再逐个字母拼接而成。这是实打实的信号处理,但不是神经网络语音。请把预览和下载看作两个毫不相干的输出,在围绕它做任何计划之前,先把文件听一遍。
如果您需要的正是预览里听到的那个声音,唯一的办法是在浏览器之外录制。在 Windows 上,通常要在声音设置中启用“立体声混音”这类回环输入。在 macOS 上,则需要安装虚拟音频设备,把系统输出导入录音软件。两种方法录下的都是扬声器本该播放的声音,而这也是任何人能接触到这些语音的唯一途径。
授权实际上允许您发布什么
录下音频是技术问题,发布它则是法律问题,而这两者经常被混为一谈。
这些语音属于 Microsoft、Apple、Google 或您的 Android 设备厂商。它们作为操作系统的一部分授权给您使用,而这份授权针对的是使用您的电脑。它并不自动赋予您录下输出、放进获利视频的权利。条款因厂商而异,往往还因具体语音而异;有些语音带有仅限个人使用的限制,界面上却从不提及。在把一段合成朗读用于任何商业用途之前,请查清您所用的那个语音的具体条款。付费文本转语音服务之所以收费,部分原因就在于它们的授权以书面形式回答了这个问题。
YouTube 自己的规则是另一回事,而且常被误读。获利政策针对的是批量生产、重复性强、缺乏原创贡献的内容,而不是合成配音本身。一个制作精良的视频,不会因为用了合成配音就失去获利资格。一个不停地把机器朗读的文章配上素材库画面的频道才有问题,而且请真人配音也解决不了。审核人员关心的是视频有没有带来新东西,而不是谁念了这些词。
浏览器语音真正派得上用场的地方
不再把它当作最终配音,它就成了一个相当好用的工具。下面这些事它做得很好。
- 给脚本计时。按字数估算朗读时长并不可靠。把脚本粘贴进去,把语速调到接近您自己说话的节奏,然后听一遍。在预订录音棚或坐下来录音之前,您就能知道真实时长。
- 找出念不顺的句子。合成器卡壳的地方,真人也会卡壳。冗长的从句、没有标点的列举,以及读音随意思变化的多音字,几秒钟内就会暴露出来。
- 制作临时音轨。把合成朗读放进剪辑时间线,照着它剪视频,之后再换成正式录音。因为节奏早已定好,剪辑点依然对得上。
- 校对自己写的东西。把一段文字听一遍,就能发现重复的词和漏掉的词,而用眼睛看时,往往会不知不觉地把它们自动补全。
- 粗略检查无障碍体验。如果一段文字由合成语音读出来让人困惑,那么对依赖这类语音的人来说,它同样令人困惑。
如果您需要可以发布的配音
自己录。在挂着窗帘、铺着地毯、摆着软体家具的房间里,一支普通的 USB 麦克风,只要内容需要个性,就胜过任何合成语音,而且这套设备的花费比大多数订阅服务一年的费用还低。业余录音听起来业余,主要是房间的问题,不是麦克风的问题。
或者付费使用文本转语音服务。您会得到可以下载的文件、戴耳机细听也站得住的声音,以及书面的商业授权。如果要大量制作长篇旁白,这是明智的选择。
或者在自己的电脑上运行神经网络模型。有好几种模型能在普通电脑上运行并生成音频文件,不按字数收费,也没有任何东西离开您的桌面。代价是要花时间配置,还要占用磁盘空间。
本站这个工具的位置在这一切之前,而不是取代它们。想听听一份脚本念出来是否顺畅,这是最快的办法。之后录什么,是另一个决定,值得想清楚再做。