我们以前只有一个分离工具,每次都会同时给你一段人声轨和一段伴奏轨——不管你需不需要两个都要。后来我们把它拆分成了三个更专注的工具,这样你就只需要下载自己真正想要的那个文件。下面说说它们的区别,以及该怎么选。
三款工具一览
- 人声消除——去除人声,只给你伴奏音轨。不包含人声文件。
- 人声提取——只给你分离出来的人声轨(也就是"acapella")。不包含伴奏文件。
- 音频分离——一次上传,同时给你两个音轨:分离出的人声和伴奏。如果你想同时保留两者,或者还没确定最终会用哪一个,就用这个。
这三款工具底层跑的是完全相同的AI分离模型——唯一的区别只在于最终你能拿到哪些输出文件。把它们拆成独立的工具,意味着当你只需要一个音轨时,下载的文件更小、更简洁,而不用每次都多拿一个你根本用不上、最后只会删掉的文件。
什么时候用人声消除(只要伴奏)
如果你在制作卡拉OK伴奏、需要给视频配一段干净的背景音乐,或者想在一首现成的歌曲上录自己的人声,人声消除只会给你那一个文件——下载文件夹里不会多出一个占地方的人声音轨。
什么时候用人声提取(只要人声)
如果你只想要分离出来的纯人声——用于remix、串烧、练声,或者转录歌词——人声提取会跳过生成一个你永远不会下载的伴奏文件。DJ和制作人想把一段acapella铺到另一段节拍上时,是这个工具最常见的使用场景。
什么时候用音频分离(两个都要)
当你的项目确实同时需要两种输出时就选它——比如你现在需要伴奏来办一场卡拉OK之夜,同时之后可能还想拿这段acapella做串烧。如果你只是在做实验,还没想好最终会用哪个音轨,这也是正确的选择。
三者的分离质量有区别吗?
没有区别。因为这三款工具在同一份上传音频上运行的是同一个分离模型,人声提取给你的人声轨,和音频分离给你的人声轨,质量是完全一样的——底层计算过程完全相同,只是在下载前把你不需要的那个文件过滤掉了。选择单一输出的工具不会让你在质量上有任何损失,只会让你拿到一个更精简、更聚焦的结果。
三款工具对比一览
| 工具 | 输出文件 | 最适合 |
|---|---|---|
| 人声消除 | 仅伴奏 | 卡拉OK伴奏、视频背景音乐、跟唱 |
| 人声提取 | 仅人声 | remix和串烧用的acapella、练声、歌词转录 |
| 音频分离 | 两个音轨都要 | 同时需要两种分离音轨的项目,或者还没确定用哪个的时候 |
一个具体的例子:同一首歌,三种不同需求
假设三个人上传了完全相同的一首歌:
- 一位卡拉OK主持人今晚的聚会需要一段干净的伴奏——他用人声消除,正好拿到自己需要的那一个文件,用完不用再删多余的东西。
- 一位DJ想把原曲人声铺到另一段节拍上做串烧——他用人声提取,只拿到acapella,省得下载一个自己根本不会打开的完整伴奏文件。
- 一位音乐专业的学生正在转录这首歌,想把人声旋律和伴奏编曲分开来对照学习——她用音频分离,一次上传同时拿到两个音轨。
三个人得到的分离效果都来自同一份文件上运行的同一个底层模型——唯一变化的只是最终实际生成、交到他们手上的是哪个(或哪些)文件。
不管选哪个工具,让分离效果更干净的技巧
- 尽量从能找到的最高质量素材开始——压缩程度较高、码率较低的MP3能给模型提供的信息,远不如FLAC、WAV或高码率MP3那么充分。
- 主唱干声(混响少)、混音层次清晰的歌曲,比那些混响很重、人声多轨叠录,或者人声被埋在密集混音里的歌曲分离得更干净。
- 密集的管弦乐编曲和频率大量重叠的重金属混音,本身就比较简单的流行、R&B或民谣编曲更难干净地分离——这是音乐本身的特性所决定的,任何工具都没法完全绕过去。
- 如果某次分离结果的串音比预期严重,可以试试同一首歌的不同版本(重制版、不同的数字来源)——同一首歌不同母带之间,分离质量可能有明显差异。
常见问题
如果我用了人声消除,之后还能不重新上传就拿到人声轨吗?
选音频分离会不会因为要生成两个文件而更慢?
影响很小——生成并编码第二个输出文件确实会比单一输出的工具多花一点时间,但差距只是几秒钟,实际使用中基本感觉不到。
如果我还不确定该用哪个,该选哪一个?
音频分离——提前拿到两个文件并不会多花你任何成本,用不上的那个直接忽略就行。