Paper Review: Automatic Transcription of Microtonal Free-Rhythm Vocal Music: A Case Study in Iranian Classical Music

论文类型: 系统型

本文提出一个端到端微音阶、自由节奏人声转录工作流:pYIN 提取单声部音高 → 多级音高直方图识别主音与装饰音 → 时值/力度估计 → music21/TinyNotation 生成 MusicXML 与 MIDI → DTW 对齐音频与 MIDI 的可视化,并配套一个人工专家在环的可视化编辑器(Program B)。方法采用规则驱动(阈值、直方图峰值、斜率检测),不含机器学习模型。论文以伊朗古典音乐 Karimi 的 radif 为案例(145 首来自 IRMA 数据集,20 首来自 Tsuge 录音),但只给出一个示例(Example 1)的详细说明,全部量化结果集中在该示例上。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

论文选题真实且重要,明确瞄准 AMT 领域覆盖不足的微音阶、自由节奏人声转录,案例(Karimi 的 radif + Masoudieh 的专业转录)文化学理上扎实,工作流组件(多级直方图、装饰音记谱、DTW 对齐可视化、专家在环编辑器)设计清晰、可解释,系统整体比端到端黑箱方案更符合”压缩”公理,且承诺开源(仓库已建,参数级复现信息齐全)。

主要问题在于:全文没有任何量化评估——自动转录没有与 Masoudieh ground truth 做音符级比对,没有准确率/召回率/F1,没有与任何基线(包括作者前期 SMC 2025 方法论、Benetos & Holzapfel、Jain & Arthur)对比,165 首的规模声明只在 Example 1 上展示细节且无逐曲结果;评测集与调参样本重叠(Example 1 既是演示也是全部量化依据),独立性缺失;效用全部停留在定性目视层面,论文自己把”正式定量评测”推给未来工作。代码仓库截至审查日仅含 README,核心代码未发布。当前形态是一篇有清晰方法与愿景的系统论文,但其核心主张(”自动转录微音阶自由节奏人声”)缺少实证支撑,适合作为研究计划或 Demo 简报,距离完整 AMT 研究结论尚有明确缺口。

日报摘要

打分

公理 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 2 1.5 3.0
三 独立性公理 2 1.0 2.0
四 压缩公理 8 1.0 8.0
五 效用公理 2 2.0 4.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 5.32/10

最终建议: Borderline 5-6.5