我已经确立了强有力的事实锚点。研究阶段的关键发现如下:
- Legato 1 (arXiv 2506.19065, 2025年6月) 是直接的前身和 SOTA。
- Transcoda (arXiv 2605.10835, 2026年5月) — 同样是基于合成数据训练的端到端 OMR,仅有 59M 参数。发表于 Legato 2 之前约 2 个月 — 属于同期/近期工作。
- Sheet Music Transformer (Ríos-Vila 等人, ICDAR 2024) — 端到端但仅限单系统。
- Mayer 等人 (ICDAR 2024) — 钢琴谱的端到端方法。
- Ríos-Vila 等人 2025 — 全页端到端方法 (arXiv 2405.12105)。
- MusiXQA (arXiv 2506.23009) 和 SSMR-Bench (arXiv 2509.04059) 是两个下游基准测试。
- 目前没有任何先前的 OMR 工作采用带有上下文条件的逐系统自回归处理方式。
- 此前没有神经 OMR 模型能够识别嵌入的文本。
现在我将输出最终的评审意见。
论文评审: LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding
论文类型: 系统型
本文提出 Legato 2,一个包含三个模块(YOLO 系统分割 → 自回归 VLM 识别 → 基于规则的 ABC 转换)的 OMR 流水线,并在两个下游基准测试上评估了其作为前沿 VLM 上下文提供者的能力。其核心贡献在于工程集成和结构化重构,而非单一的新架构或新训练算法,因此最适宜将其视为系统型论文。
公理审查结果
公理一:对象公理
- 判定: ✅
- 依据: OMR 是一个真实且定义明确的任务,拥有既定的基准测试(SMB, OMR-NED)以及活跃的社区(ISMIR, ICDAR)。其研究范围涵盖了具有实际重要性的下游任务:乐谱理解(MusiXQA, SSMR-Bench),在这些任务中前沿 VLM 表现不佳(据 Chen 等人 2025;Wang 等人 2025 报告,准确率低于 10%)。乐谱是西方古典音乐、爵士乐、礼拜音乐和戏剧音乐的主要载体;将其计算化是一个真实的且具有文化意义的工程问题。对象定义清晰:逐系统识别、嵌入文本识别和乐谱理解是可操作化定义的,并通过精确的指标(OMR-NED, CER, Unordered-CER, accuracy)进行衡量。
- Wiki 证据: OMC Wiki 未返回匹配记录。free-search 确认该任务领域活跃:arXiv 显示 2024-2026 年间有多项 OMR 论文(Ríos-Vila 等人 2024; Mayer 等人 2024; Yang 等人 2025; Dratschkin & Swoboda 2026),ICDAR 设有专门的 OMR 会议,且存在既定的基准测试(SMB, MusiXQA, SSMR-Bench)。该对象是真实且具有重要社区价值的。
公理二:识别公理
- 判定: ⚠️
- 依据: 消融实验(表 4)系统地将两个关键变量——系统分割(SS)和字节回退(BF)——隔离在 Legato 1 基线上,这是正确的做法。词汇表大小消融实验(2048 → 4096 → 8192)基于验证误差进行模型选择,而非测试误差,这在认识论上是正确的。然而,存在明显的缺口:
- YOLO 分割作为必要组件缺乏消融实验。 论文仅测试了损坏的边界框(附录 C.2),但未与无分割的基线(即 Legato 1 逐页方法在相同数据上以相同有效分辨率处理每个系统)进行比较。系统级增益可能很大程度上来自更高的有效分辨率,而非自回归上下文。论文承认了这一点(”operates at a higher effective resolution”),但未将分辨率效应与上下文条件效应分离开来。
- 自回归上下文条件(以 a<i 为条件)未与无上下文的系统级识别进行消融对比。 该上下文是否真的有帮助,还是说仅靠系统分割就能获得大部分增益?表 4 的 SS 列似乎包含了上下文条件,但未明确测试无上下文变体。
- **架构缩放消融实验(表 5)表明,深度解码器主要对 PDMX-Synth 有帮助(拟合合成分布),而 Quwen 架构表现不佳——但论文并未分析为什么以 Llama-3.2-11B-Vision 作为视觉编码器是必要的,而非其他选择。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认 Legato 1 (2506.19065) 是直接的前身和适当的基线。Transcoda (2605.10835, 59M 参数, 2026 年 5 月) 是一个未被纳入比较的同期模型——尽管作为同期工作(2个月内),它不是强烈的扣分项,但其存在表明端到端的小型模型可以达到竞争性的表现,这引发了关于该流水线中哪个组件真正推动了增益的问题。
公理三:独立性公理
- 判定: ⚠️
- 依据:
- 训练数据与评估数据: VLM 完全在 PDMX-Synth(合成数据)上训练,并在真实数据集(OpenScore, IMSLP)上评估。这存在跨域评估,有利于独立性——评估数据不是训练数据。
- 验证集构建: 作者手动编译了一个来自 OpenScore String Quartets 和 Lieder 的 130 页验证集,并严格排除了所有测试集页面(第 3.4 节)。模型选择使用此独立验证集。这是良好的实践。
- MusiXQA 的评判模型: G-Acc 指标使用 GPT-5 作为评判(替换了不可用的 GPT-4O)。被评估的模型是 GPT-5 和 Gemini 3.1 Pro。使用 GPT-5 评估 GPT-5 的答案会造成部分评判-被评判重叠。然而,任务是音乐领域的语义正确性判断,而非一般的文本生成,且该评判有严格的、特定领域的规则。这是一个主要问题,而非致命问题:评判可能倾向于 GPT-5 生成的模式,但音乐语义判断限制了这种偏差。
- SSMR-Bench 评估使用标准的多项选择准确率——无评判模型,完全独立。这加强了整体独立性评估。
- OMR-NED 指标(Martinez-Sevilla 等人 2025)是一个独立的、基于渲染的指标,不依赖于任何模型输出。核心 OMR 结果完全独立。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认 OMR-NED 来自 Martinez-Sevilla 等人 2025 (arXiv 2506.10488)——一个与 Legato 2 作者独立的基准测试。MusiXQA 来自 Chen 等人 2025 (arXiv 2506.23009)——独立基准测试。
公理四:压缩公理
- 判定: ⚠️
- 依据: 该流水线包含三个组件:(1) YOLO 分割(现成模型,微调于 1024 页),(2) 自回归 VLM(Legato 1 架构,以逐系统条件重新训练),(3) 基于规则的 ABC 转换器。这种模块化设计比单一端到端模型更复杂。核心问题是:这种复杂性是否换来了真实的能力?
- 逐系统处理是一种真实的结构洞察——乐谱具有自然的水平结构,尊重这种结构可以带来更好的扩展性和有效分辨率。这是一个问题重构,而不仅仅是模块堆叠。
- 系统级 ABC 是一种新的中间表示,它将识别与文档的物理阅读顺序对齐。基于规则的转换器在训练期间可逆地桥接标准 ABC 和系统级 ABC。这是针对领域结构的良好设计。
- 字节回退分词器是标准的 NLP 技术(SentencePiece 字节回退),应用于 ABC——迁移正确但并非新颖。
- 命名膨胀: “Legato 2” 虽然合理,但论文标题声称的 “Multimodal Sheet Music Recognition and Understanding” 略显夸大——”理解”部分仅将 OMR 输出作为上下文喂给现成的前沿 VLM,这更接近于 RAG 式的上下文增强,而非模型中真正的多模态理解。
- 架构消融实验(表 5)显示缩放带来的收益微乎其微,这表明 113.7M 参数的解码器接近此数据的容量极限——这是压缩领域的一个积极信号。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认逐系统自回归处理在 OMR 中是新颖的——没有先前的神经 OMR 工作以这种方式操作。Sheet Music Transformer (Ríos-Vila 等人 2024) 进行单系统识别,但没有自回归上下文条件。Ríos-Vila 等人 2025 进行全页处理,没有系统级分解。
公理五:效用公理
- 判定: ✅
- 依据:
- OMR-NED(表 1): Legato 2 在所有 6 个数据集上均优于 Legato 1、Audiveris 和 Gemini 3.1 Pro。在 PDMX-Synth 上的提升为 28.6 → 23.5(−18%),在 Camera OpenScore String Quartets 上为 58.2 → 31.6(−46%),在 Camera OpenScore Lieder 上为 44.9 → 43.6(−3%)。最微弱的提升在于 Camera OpenScore Lieder(真实世界、扫描质量差),这表明仍有改进空间,但提升是一致的。
- 多页识别(图 3): Legato 2 在所有长宽比区间均优于 Legato 1,且退化较慢。这是逐系统处理的一个结构性优势。
- 文本识别(表 2): 总 CER 73.8 → 24.8(对比 Audiveris),85.5 → 25.1 Unordered-CER(对比 PaddleOCR)。这是一个巨大的提升,也是第一个具备文本能力的神经 OMR 系统。
- 乐谱理解(表 3): Legato 2 上下文将 MusiXQA G-Acc 从 8.4 提升至 25.3(Gemini 3 Flash),从 71.4 提升至 92.7(SSMR-Bench 上的 Gemini 3.1 Pro)。SSMR-Bench 上的绝对值(92.7%)处于高度可用范围。
- 基线覆盖度: Legato 1(直接前身,SOTA)、Audiveris(基于规则,唯一具备文本能力的先前系统)、Gemini 3.1 Pro 和 GPT-5(前沿 VLM)。这涵盖了关键基线。Transcoda (2026 年 5 月) 是一个未被比较的同期工作——作为同期工作是可以接受的。
- 鲁棒性: 附录 C.2 显示,即使在 YOLO 损坏的情况下,Legato 2 仍能达到 47.4 OMR-NED,优于 Audiveris 和 Gemini。这很好地缓解了对流水线脆弱性的担忧。
- 绝对水平: 真实世界数据集上的 OMR-NED 分数仍为 27-44%,这并非完美,但相较于先前的工作是实质性进步,且文本识别和乐谱理解的绝对增益在各自基准测试中均处于可用范围。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认 Legato 1 是适当的 SOTA 基线。Sheet Music Benchmark (Martinez-Sevilla 等人 2025) 提供了独立的评估框架。Transcoda (2026 年 5 月) 是唯一未比较的潜在强基线,作为同期工作是可以接受的。
公理六:新颖性公理
- 判定: ⚠️
- 依据:
- 逐系统自回归处理: 真正新颖。没有先前的神经 OMR 模型按系统顺序处理乐谱并以上下文为条件。Sheet Music Transformer 进行单系统处理;Legato 1 和 Ríos-Vila 等人 2025 进行全页处理。这是一个真实的结构创新。
- 系统级 ABC 表示: 新颖的中间表示,受 SMT-ABC Notation 启发(Qu 等人 2025, ICLR),但适配于 OMR。基于规则的转换器是一个实用的工程贡献。然而,系统级 ABC 本质上是沿行换符号顺序——一个正确的但增量式的重构。
- 文本感知分词器与字节回退: 字节回退 BPE 是标准的 NLP 技术(SentencePiece 自 2018 年起)。在 OMR 中的应用是新的,但迁移是直接的,并非概念上的创新。
- 作为 VLM 上下文的 OMR: Legato 1 (Yang 等人 2025) 已经提出了这个方向(论文引用了 [27] 展示了前沿 VLM 在乐谱识别上的失败)。Legato 2 的贡献在于展示更好的 OMR 带来更好的下游性能——这是预期的,并且在某种意义上是对 Legato 1 洞察的确认,而非新的洞察。
- 整体流水线: YOLO(现成)+ VLM(Legato 1 架构重新训练)+ 基于规则的转换器。这些组件没有一个是单独新颖的。创新在于结构重构(逐系统处理)及其组合方式。这是一个真实但适度的创新增量。
- “首个”声明: “首个按系统逐个处理的大型神经 OMR 模型”——在 free-search 证据支持下似乎成立。”首个能够生成包含嵌入文本的符号转录的 OMR 模型”——Audiveris 可以输出文本元数据(MusicXML),但通过神经符号转录实现是新颖的。两个声明均成立。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认在 OMR 中没有先前的逐系统自回归处理。Transcoda (2026 年 5 月) 是端到端但进行整页处理,无系统分解。系统级 ABC 的概念来源于 SMT-ABC (Qu 等人 ICLR 2025),该工作是针对符号音乐生成而非 OMR——正确的跨领域改编。
公理七:可复现公理
- 判定: ⚠️
- 依据:
- 代码/数据发布声明: “我们将在发表时发布数据和代码”(第 1 节末)。Legato 1 的代码和模型是公开的(github.com/guang-yng/legato, HuggingFace guangyangmusic/legato),这为 Legato 2 的发布声明提供了可信度。
- 训练细节: 广泛。附录 A.2 提供了 YOLO(分辨率、批次大小、轮次、优化器、学习率、调度)和 VLM(架构、可训练参数 113.7M、学习率、批次大小、轮次、调度器、GPU 小时:180 L40 小时)的完整超参数。上下文管理机制在 A.1 中明确指定(左截断 1024 tokens,最大 2048)。
- 数据: PDMX-Synth 训练分割是公开的(源自 PDMX, Long 等人 2025)。YOLO 微调数据(1024 页,512 PDMX-Synth + 512 IMSLP)描述足够复现,但未发布。手动标注的 1024 页未公开。
- 评估数据集: 全部公开可访问(PDMX-Synth, OpenScore String Quartets, OpenScore Lieder, IMSLP Piano Scores, MusiXQA, SSMR-Bench)。
- 依赖闭源模型: 依赖 GPT-5 和 Gemini 3.1 Pro 进行乐谱理解实验。这些是闭源且可能随时变更。然而,核心 OMR 结果(该论文的主要贡献)不依赖于任何闭源模型。下游理解结果确实依赖闭源 VLM,但这是该子领域的标准做法,且提示词在附录 D 中已完整记录。
- 评估指标脚本: OMR-NED 来自独立工作 (Martinez-Sevilla 等人 2025)。CER/Unordered-CER 指标在附录 E.2 中描述足够实现。
- 推理提示词: 在附录 D 中完全公开。
- Wiki 证据: OMC Wiki 未返回记录。free-search 确认 Legato 1 的代码和模型已公开(GitHub, HuggingFace),这为复现承诺提供了可信度。
总评
- 科学价值: 中 — 该论文提供了一个正确的结构洞察(逐系统处理尊重乐谱的阅读顺序)并验证了其有效性。然而,它并未隔离该洞察的两个机制(分辨率提升 vs. 自回归上下文)以确定哪个是驱动因素,且”理解”贡献主要是对 Legato 1 洞察的确认。
- 方法价值: 中高 — 逐系统自回归处理和系统级 ABC 是有效的领域适配设计选择。消融实验(表 4)正确地隔离了 SS 和 BF 变量。多页可扩展性和对 YOLO 错误的鲁棒性得到了很好的表征。
- 社区价值: 高 — Legato 2 在所有 OMR 基准测试上设定了新的 SOTA,引入了首个具备文本能力的神经 OMR,并在乐谱理解上展示了实质性进展。该流水线可在发表后复现。OMR 社区规模小但活跃(ISMIR, ICDAR),此工作代表了明确的进步。
日报摘要
- Strength: Legato 2 在所有六个 OMR 数据集上均优于先前 SOTA (Legato 1)(OMR-NED 提升高达 46%),通过逐系统自回归处理实现自然多页扩展,并引入了首个神经 OMR 文本识别(总 CER 24.8 对比 Audiveris 73.8),在 SSMR-Bench 上达到 92.7% 的准确率。
- Weakness: 消融实验未将系统分割的两个机制(有效分辨率提升 vs. 自回归上下文条件)分离开来,也未在相同系统级分辨率下与无上下文基线进行比较,这使得性能提升的实际原因尚不明确。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
9 |
1.0 |
9.0 |
| 二 识别公理 |
⚠️ |
6 |
1.5 |
9.0 |
| 三 独立性公理 |
⚠️ |
7 |
1.0 |
7.0 |
| 四 压缩公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 五 效用公理 |
✅ |
9 |
2.0 |
18.0 |
| 六 新颖性公理 |
⚠️ |
6 |
2.0 |
12.0 |
| 七 可复现公理 |
⚠️ |
7 |
1.0 |
7.0 |
加权总分: 7.2/10(加权分之和 68.0 / 权重之和 9.5)
最终建议: Weak Accept