我已阅读全文并收集了相关研究资料。现在开始输出最终评审。
本文提出一个新的评测数据集 MulTTiPop,填补商业流行音乐多轨 AMT 评测的空白,并附带对 SOTA 模型的基线评测。主要按数据型 + benchmark 型尺度审查。
Table 1 的数据集对比清晰展示了 MulTTiPop 占据的空白位置:商业音频 + 多轨 MIDI + 真实流行音乐。问题可操作化定义清楚(多轨 onset F1 with 50ms tolerance)。论文明确声明数据集仅用于评测而非训练,claim 外延与实验验证范围一致。问题有广泛的社区价值——AMT 是 MIR 领域核心任务,真实场景评测是模型发展的必要基础设施。
轻微不足:标注员的 control set 由作者标注,存在一定的标注一致性循环可能,但这是标准做法且影响有限。
论文没有提出新的对齐方法或新的数据构建范式,而是将已有方法组装成一个 pipeline。不过,对于数据集论文,压缩公理的标准应适当调整——数据集的价值在于数据本身而非构建方法的创新。关键问题在于:49.1% 的成功率意味着 pipeline 效率较低,近一半投入被浪费,这暗示方法可能有更优的压缩空间(如更好的自动对齐方法减少人工负担)。论文没有探索是否能用更简单的方法达到更高成功率。
总体而言,数据集在揭示真实场景下的模型不足方面效用显著,但 baseline 覆盖度可以更全。
作为数据集论文,新颖性主要来自数据位置而非方法创新,这是可接受的,但不应过高评价。
轻微不足:pipeline 代码未明确开源;YouTube 依赖引入长期可用性风险。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ✅ | 9 | 1.0 | 9.0 |
| 二 识别公理 | ⚠️ | 6 | 1.5 | 9.0 |
| 三 独立性公理 | ✅ | 8 | 1.0 | 8.0 |
| 四 压缩公理 | ⚠️ | 6 | 1.0 | 6.0 |
| 五 效用公理 | ✅ | 8 | 2.0 | 16.0 |
| 六 新颖性公理 | ⚠️ | 7 | 2.0 | 14.0 |
| 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 |
加权总分: 7.26/10(加权分之和 70.0 / 权重之和 9.5) 最终建议: Weak Accept (6.5-8)