Baseline 覆盖充分:涵盖了 effect-specific(Fx-Encoder++, AFx-Rep)和 general-purpose(VGGish, CLAP)两类方法,且使用官方模型和标准协议。绝对指标方面,Ld 值的绝对水平在该领域中具有可比性(与 Fx-Encoder++ 的 1.601 和 AFx-Rep 的 1.517 相比,1.388 是显著改善)。Oracle 条件(1.316)提供了上界参考。论文诚实报告了所有配置的结果,包括 MoisesDB-only 的较弱配置。
缺失:缺少与 ST-ITO (Steinmetz et al., 2024) 和 StemFX (2026-07) 的直接比较。ST-ITO 是 inference-time optimization 的代表性工作,但其评测设置不同,不完全可比。StemFX 是同期工作(2个月内),按规则不作为扣分依据。
架构层面是已有组件的组合(Siamese CNN + cross-attention + gated fusion + 对比学习),消融证明了部分组件的必要性(cross-segment sampling 关键,single-branch 退化),但 cross-attention 的必要性未被证实(去除后 Ld 不变甚至略好)。
主要风险:训练数据中包含 licensed internal collection(6,447 mixed tracks),这部分不可获取,可能影响完全复现。但 MoisesDB 是公开的,且论文报告了仅用 MoisesDB 训练的结果(Ld=1.449),仍优于 baselines。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ✅ | 9 | 1.0 | 9.0 |
| 二 识别公理 | ⚠️ | 5 | 1.5 | 7.5 |
| 三 独立性公理 | ⚠️ | 7 | 1.0 | 7.0 |
| 四 压缩公理 | ⚠️ | 5 | 1.0 | 5.0 |
| 五 效用公理 | ✅ | 9 | 2.0 | 18.0 |
| 六 新颖性公理 | ⚠️ | 6 | 2.0 | 12.0 |
| 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 |
加权总分: 6.95/10(加权分之和 66.5 / 权重之和 9.5) 最终建议: Weak Accept