我们的 AI 人声消除工具是如何运作的

从上传到下载,全程不到两分钟。这是支撑制作伴奏运作的技术与流程。

三个简单步骤

上传歌曲或视频

拖放文件,或点击浏览。支持 MP3、WAV、FLAC、M4A、AAC、OGG、AIFF、WMA、Opus 等格式(最大 100 MB),也支持 MP4、MOV、MKV、AVI、WebM、FLV、WMV、MPG、3GP 等视频文件(最大 1 GB)——我们会自动提取音轨。

AI 分离音频

我们的 GPU 加速 AI 模型会分析频率模式,将人声层从音乐中分离出来。

下载分离音轨

下载高品质 256 kbps MP3 格式的人声音轨和伴奏音轨。

核心技术:AI 音源分离

制作伴奏 采用最先进的深度学习模型来实现音乐音源分离,它使用一种混合架构,结合了以下几个部分:

  • 波形域处理 —— 直接分析原始音频信号
  • 频谱域处理 —— 分析音频的频率表示
  • 编码器-解码器架构 —— 采用图像分割中常用的 U-Net 结构,并将其应用于音频处理

该模型基于成千上万首经过专业混音的多轨录音训练而成,能够识别并分离出各种曲风、各种制作风格中的人声特征。

为什么 AI 优于传统方法

相位抵消法(旧方法)

旧方法的原理是:将伴奏音轨的相位反转,再与原曲混合抵消。但这只有在拥有完全一致的官方伴奏时才有效——而这种伴奏几乎不可能获得。

AI 音源分离(新方法)

现代 AI 技术只需要一份混音后的音频文件即可运作,不需要伴奏音轨。神经网络凭借学习到的音频特征来分离人声——无需任何参考音轨。

幕后揭秘:处理流程

1. 格式转换

上传的文件会被解码为标准化的音频流,确保无论输入格式如何,都能保持一致的音质。

2. GPU 处理

音频会被发送到运行 AI 模型的 GPU 服务器上。借助 GPU 加速,处理一首 3 分钟的歌曲大约只需要 30 到 60 秒。

3. 输出编码

分离出的音轨会被编码为 256 kbps 的 MP3 格式,以获得最佳的兼容性和音质。人声音轨和伴奏音轨都会准备好供您下载。

4. 安全交付

下载链接会附带限时访问令牌生成。处理完成后,您可以立即访问自己的文件。

分离质量与局限性

AI 人声分离的效果已经相当出色,但它并非魔法。以下是您可以预期的效果:

以下情况效果最佳

  • 人声与乐器区分明显
  • 常见的流行、摇滚、R&B、嘻哈编曲
  • 干声或轻微混响的人声
  • 高品质源文件(WAV 或高码率 MP3)

以下情况处理难度较大

  • 编曲极其密集的管弦乐
  • 经过大量效果处理的人声(强混响/合唱效果)
  • 人声与主奏乐器频率重叠的情况
  • 码率极低的源录音

技术常见问题

你们会保留我上传的文件吗?
我们会将您的文件保留在服务器上,直到您下载完处理结果为止。文件会在下载完成或超过保留期限后被标记删除。详情请参阅我们的隐私政策
最大文件大小是多少?
音频文件单次上传上限为 100 MB——即使是无损格式,大多数时长在 10 分钟以内的歌曲也都在这个范围内。视频文件上限为 1 GB;我们会在处理前自动提取音轨。
为什么处理需要 30 到 90 秒?
我们的 AI 模型计算量很大。即使有 GPU 加速,处理一整首歌曲仍需要让神经网络对大量重叠的音频片段进行运算。我们会以硬件允许的最快速度进行处理。
为什么输出是 256 kbps 的 MP3?
256 kbps 处于 MP3 格式码率区间的较高水平——对绝大多数听众而言几乎无损可辨,在标准听音测试中与无损音频难以区分,同时文件体积也比该格式 320 kbps 的上限更小。

准备好试试了吗?

免费消除人声 →