我现在有足够的事实依据了。关键发现:

  1. 存在 JEPA 用于符号音乐的前身研究:“Using a Joint-Embedding Predictive Architecture for Symbolic Music Understanding” (OpenReview lieErtGZb6) —— 这直接挑战了本文中关于“首个基于分层 JEPA 的方法”的声明。论文中提到“据我们所知,此前没有研究将 JEPA 风格的 SSL 应用于符号音乐表示”,但这篇 OpenReview 论文明确应用了 JEPA 进行符号音乐理解。

  2. 缺少强基线:未与 MusicBERT、MidiBERT-Piano、MUPT (ICLR 2025) 或 Aria (ISMIR 2025) 进行比较 —— 这些都是符号音乐表示学习的强基线。论文仅与 Haar scattering(弱基线)和 DINOv2(视觉 SSL,非音乐专用)进行了比较。

  3. EMOPIA 4 类分类:论文的最佳结果为 0.488(4 类准确率,随机猜测为 0.29)。我们需要结合基线上下文来看待这一点。

  4. 单一作者,消费级硬件,单个数据集 (POP909) —— 范围有限。

现在我来撰写完整的评审意见。

Paper Review: MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music

论文类型: 方法型

本文提出一个完整的 pipeline:Swin V2 分层 encoder + 等变 SSL 目标 + LeJEPA SIGReg 防 collapse + 冻结 encoder 训练 decoder + flow matching 条件生成,在符号音乐(piano roll)上验证表示质量、重构和生成。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 ⚠️ 5 1.0 5
二 识别公理 2 1.5 3
三 独立性公理 ⚠️ 4 1.0 4
四 压缩公理 ⚠️ 4 1.0 4
五 效用公理 2 2.0 4
六 新颖性公理 3 2.0 6
七 可复现公理 8 1.0 8

加权总分: 3.16/10(加权分之和 34 / 权重之和 9.5) 最终建议: Reject <3.5>