在线人声分离

mp3 → wav × 2

消除立体声歌曲中居中的人声,制作卡拉 OK 伴奏,或将其提取出来。中间声道抵消运算通过浏览器中的 Web Audio API 完成。

设置
工作区不会上传任何文件
将歌曲或音频文件拖放到此处
支持 MP3、WAV、FLAC、M4A 和 OGG

关于这款人声分离工具

本工具使用 Web Audio API 以 44.1 kHz 解码您的歌曲,然后对左右声道取平均值,找出混音的中间部分,也就是大多数混音里左右声道都相同的那部分。系统会对这部分中间信号施加一个零相位高通滤波器,作用于 120 Hz 以上,这样滤波就不会让剩下的声音在时间上发生偏移。源文件必须是立体声:单声道文件没有可供比较的左右声道,因此工具会拒绝处理,而不是随意猜测。这是纯粹的算术运算,不是机器学习模型,运行时除了页面本身不会下载任何东西。

分离模式决定输出哪些文件:两条音轨、仅伴奏,或仅提取的人声。消除强度只影响伴奏音轨,从每个声道中减去经过滤波的中间信号的 20% 到 100%。这个滑块不会影响提取出的人声文件:它始终是 120 Hz 以上的完整中间信号,因此也会包含混在中间的其他内容,例如居中的军鼓或一段独奏。120 Hz 以下的内容特意保持不变,让底鼓和贝斯留在伴奏音轨里。两个输出文件都以 16 位、44.1 kHz 的 WAV 格式写出,与您使用的源文件采样率无关。

使用方法

01

添加一首歌曲

将立体声的 MP3、WAV、FLAC、M4A 或 OGG 文件拖放到工作区,或点击选择音频文件。每次只处理一个文件。

02

设置分离模式和强度

在分离模式中选择两条音轨、仅伴奏或仅人声,并将消除强度设置在 20% 到 100% 之间。强度只会改变伴奏音轨。

03

点击分离人声与伴奏

浏览器会解码文件,抵消 120 Hz 以上的居中信号,并将结果写为 WAV 文件。

04

试听并下载

用内置的音频播放器试听每条音轨,然后根据所选模式下载伴奏、人声,或两者。

工具的功能

  • 中间声道抵消运算完全依靠 Web Audio API 完成,不需要下载任何库。
  • 零相位高通滤波器让 120 Hz 以下的内容不参与抵消,因此底鼓和贝斯会保留在伴奏音轨中。
  • 消除强度只调整伴奏音轨,范围是减去中间信号的 20% 到 100%。
  • 提取出的人声文件始终是 120 Hz 以上的完整中间信号,不会因强度滑块而减弱。
  • 两个输出文件都以 16 位、44.1 kHz 的 WAV 格式写出,无论源文件的采样率是多少。
  • 分离模式可以生成两个文件、仅伴奏,或仅提取的人声。

规格

规格 详情
接受格式 浏览器能解码的立体声 MP3、WAV、FLAC、M4A 或 OGG
要求 立体声文件。单声道文件会被拒绝并提示错误,因为没有左右声道可供比较
低频保护 120 Hz。以下的内容不参与抵消,让底鼓和贝斯得以保留
消除强度 20% 到 100%,仅作用于伴奏音轨
输出格式 两条音轨均为 16 位 PCM WAV,44.1 kHz,与源文件采样率无关
输出文件 在源文件名后加上 _instrumental.wav 或 _vocals.wav,取决于分离模式
文件数量限制 一次一个文件。没有固定的大小限制,但较长的歌曲会占用设备更多内存
所用的库 没有,只使用浏览器内置的 Web Audio API
需要了解的情况

这款人声分离工具做不到的事

这是中间声道抵消运算,不是源分离模型,依赖它之前值得了解它真实的局限。

需要居中且较干的人声

它在老歌或混音简单的录音上效果最好。如果现代混音把主唱人声加宽、做了双轨叠加,或加了很重的混响,就无法干净地抵消,留下的只是一层更弱的人声残影,而不是完全消失。

被抵消的不只是人声

这项技术并不知道什么是人声。任何放在正中间的内容,例如军鼓或居中的主奏乐器,都会跟人声一起被减掉。只有 120 Hz 以下的内容会被保护。

提取出的人声不是干净的干音

提取出的人声文件其实是 120 Hz 以上的混音中间部分,其中既包含人声,也包含其他居中的内容。它适合用来跟唱歌词或旋律,但不能当作干净的人声轨道使用。

单声道播放会削弱效果

手机扬声器或单声道音箱会把左右声道重新叠加在一起,这会让被抵消的内容重新出现,并削弱伴奏音轨,在强度较高时尤其明显。

不是源分离模型

经过训练的源分离模型能更好地处理现代、混响较重的混音,还能生成真正按乐器分离的音轨。这类模型所需的算力远超一个浏览器标签页,而且大多数网页版本会把您的音频上传到服务器处理。

相关工具

常见问题

是的。工具会抵消左右声道共有的信号,因此单声道文件没有可比较的两个声道,会直接提示错误,而不是悄悄处理。

不会。消除强度只改变从伴奏音轨中减去多少中间信号。提取出的人声文件始终是 120 Hz 以上的完整中间信号,无论滑块设在哪里。

不是。它是中间声道抵消运算,依靠 Web Audio API 完成的算术运算,没有模型、没有训练数据,除了页面本身也不需要下载任何东西。

通常只能部分有效。它在老歌或混音简单、人声居中且较干的录音上效果最好。如果混音把主唱人声加宽、做了叠加,或加了很多混响,留下的会是一层人声残影,而不是完全消失。

因为 120 Hz 以上所有居中的内容都会被去掉,不只是人声。居中的军鼓或主奏乐器也会跟着一起消失。调低强度会保留更多原始混音,但代价是也会保留更多人声。

不会。解码、中间声道运算和 WAV 编码全部在这个标签页内通过 Web Audio API 完成,不需要下载任何库。

文件始终留在您的设备上

浏览器会在这个标签页内解码歌曲并完成中间声道运算,不会上传任何内容,也不需要下载任何库:分离过程只使用浏览器内置的 Web Audio API。