如果你在音乐制作、DJ或remix圈子里待过一段时间,一定听过"分离音轨"(stems)这个说法。但分离音轨到底是什么,音轨分离又是怎么运作的?这篇指南会讲清楚你需要了解的一切——从基础概念,到现代AI音轨分离工具的工作原理。

什么是音频分离音轨?

在音乐制作里,一条分离音轨(stem)指的是一个子混音——把一组相关的音轨混合成单独一个立体声(或单声道)音频文件。分离音轨的层级比单独录制的音轨高一层,但低于最终混音完成的母带。

一首典型的歌曲,交付时可能会带有这些分离音轨:

把所有分离音轨重新叠加在一起,你就得到最终混音完成的歌曲。如果把人声分离音轨静音,剩下的就是伴奏(卡拉OK)版本。

为什么分离音轨这么重要?

分离音轨是音乐创作协作中的"通用货币"。以下是人们为什么需要它:

对DJ和remix制作人来说

DJ和remix制作人用分离音轨来制作串烧和remix。有了一首歌的人声分离音轨,再配上另一首歌的伴奏分离音轨,就可以创造出听起来经过专业混音的全新组合——而不是把两首歌生硬地叠在一起。

对音乐制作人来说

当制作人想在一段现成的录音基础上进行二次创作时,分离音轨让他们可以单独处理某个元素,而不影响整体混音。他们可以保留原始的鼓组分离音轨、替换贝斯,或者保留人声分离音轨、重新搭建整个编曲。

对现场演出者来说

乐队和独唱歌手在现场演出中会用到伴奏分离音轨。比如说,一位独唱歌手可以一边弹吉他现场演奏,一边配合鼓和贝斯的分离音轨伴奏演唱。

对影视行业来说

音乐监制在需要为特定场景改编一首歌时会用到分离音轨——比如为背景场景去除人声、调整各声部电平,或者让某件乐器的片段循环播放。

问题所在:大多数歌曲并不自带分离音轨

难点在于:分离音轨通常只能从原始制作人或唱片公司那里直接获得——而它们几乎从不公开发布。你可能会在参加remix比赛、购买制作人素材包,或者直接与音乐人合作时拿到分离音轨。但对绝大多数商业发行的音乐来说,分离音轨根本没有公开渠道可以获取。

这正是AI音轨分离派上用场的地方。

AI音轨分离是怎么工作的

AI音轨分离工具会分析已经混好的音频文件,尝试用数学方法把各个组成部分分离出来——全程都不需要接触原始的多轨工程文件。

现代AI音轨分离工具使用深度神经网络,这些网络是在大量经过专业录制的多轨歌曲数据集上训练出来的。在训练过程中,模型学会了人声、鼓组、贝斯和其他乐器在声学上"听起来是什么样子"——它们的频率模式、时间特征和音色特质。

当你上传一首歌时,AI会:

  1. 把音频转换成频率表示形式(声谱图)
  2. 运用训练好的神经网络来识别并分离出每一个声源
  3. 从分离出的各个成分中重建音频
  4. 把每条分离音轨作为独立的音频文件输出

如今AI音轨分离的效果有多好?

过去这几年,AI音轨分离的效果有了大幅提升。现代深度学习模型如今达到的人声分离质量,是3~4年前根本不可能实现的。

对于二分离(人声+伴奏)来说——也就是制作伴奏所提供的功能——效果已经足够好,可以真正用于remix制作、卡拉OK和音乐分析。四分离(再加上鼓组和贝斯)难度会更高一些,但在先进的AI工具中也越来越普及。

分离音轨(Stems)与录音轨道(Tracks):区别是什么?

现在就把你的歌曲拆分成分离音轨

免费,无需注册,即时出结果。

免费试用人声消除 →