muzka.ai
连接中
RESEARCH NOTES / 2026.09.13

用对模型,才能听见细节.

音乐分轨不是按频率切几刀。人声、吉他和弦乐共享频段,要从混音中恢复声部,需要识别声音的结构。我们选择专用音源分离模型作为主流程,再用可提示音频模型补充弦乐提取。

当前路线:Demucs 多轨分离 + SAM Audio 弦乐提取

通过 fal.ai 的异步任务接口运行。基础 4 轨与完整 6 轨使用 Demucs;弦乐模式独立调用 SAM Audio,输出弦乐目标与剩余声音。它们是两种分离任务,不能把输出随意相加为“无重叠七轨”。

传统方法,还是相关大模型?

技术方向代表方案适用判断
传统信号处理EQ、中心消除、HPSS、NMF适合作为辅助处理或基线。频率、声像重叠时不能可靠对应人声、Bass 与弦乐。
专用深度学习模型Demucs / BS-RoFormer主流程推荐。学习音色与时频结构,面向固定声部;结果边界取决于具体模型和权重。
可提示音频模型SAM Audio用于弦乐等定向提取。按描述输出目标与剩余声音,需要试听验证,不保证完全消除串音。
商业音乐分离 APIMusic AI官方 Musical Stems 模块明确支持 strings、wind 等;可作为完整乐器分轨的对比候选。

HPSS 实际分解的是谐波与打击成分,并不等于完整的乐器识别。人声也可能同时包含这两类成分。librosa 官方说明 ↗

Demucs:固定声部,清晰边界

4 轨为 vocals、drums、bass、other。6 轨新增 guitar、piano,没有 strings 输出。官方将六轨模型标为实验模型,特别指出钢琴存在串音和伪影。因此界面保留“其他乐器”,不将它改名为弦乐。

模型说明 ↗ · fal.ai 接口 ↗

SAM Audio:指定你想听的声音

通过文字描述提取目标声源。本站固定描述弓弦乐器,以减少把吉他误当作“弦乐”的歧义;结果仍需试听验证。接口支持长音频分块,单次默认 60 秒并保留 5 秒重叠,以平滑衔接。

Meta 官方介绍 ↗ · 接口参数 ↗

BS-RoFormer:后续音质对比候选

基于频带拆分和 Transformer 的音乐分离架构,适合纳入人声与伴奏效果评测。它是专用音频模型,不是聊天大语言模型。具体可分哪些轨,仍要核对选用的训练权重,不能由架构名称推断。

原始研究论文 ↗

Music AI:细分乐器的另一条路线

Musical Stems 模块列出 vocals、bass、drums、guitars、strings、piano、keys、wind 和 other。若弦乐是核心需求,建议用同一批音乐片段和 SAM Audio 做盲听对比,再决定是否切换主服务。

官方声部分离模块 ↗

成本与效果,如何验收

fal.ai 的 SAM Audio 页面标示基础价格为每 30 秒输出音频 $0.05;额外候选另收费。若按单个输出时长计,3 分钟的一次目标提取基础估算为 $0.30,具体取整、计费口径与最终金额以 fal.ai 账单为准。Demucs 本次未取得可靠固定单价,不填猜测数字。当前价格说明 ↗

  1. 选取人声流行、密集摇滚、弦乐编制和电子音乐等不同片段,用相同输入比较。
  2. 分别听目标声部的完整度、其他声部泄漏、混响损失和处理伪影;不要只比较响度。
  3. 有真实独立声部时再计算 SDR / SI-SDR;同时记录处理时长、失败率和单分钟实际成本。
  4. 网站的 Night Drive 是原创合成多轨,用来演示播放和混音;它不是音源分离质量测试。

当前网站的实现边界

音频最长 5 分钟、最大 25 MB。原始音频和结果保存在私有文件存储中,任务状态保存在数据库中,按登录用户隔离。密钥仅留在服务端;后台持续处理并保存结果,页面按实际状态刷新,页面不显示虚构的模型处理百分比。点击每轨下载原始结果;导出伴奏时合并除人声外的全部声部,混音导出为 44.1 kHz / 16-bit WAV。WAV 容器不代表分离效果无损。

回到分轨工作室