我已经获得了所需的所有事实锚点。现在开始撰写完整的评审意见。
论文提出 MuseCritic,一种半标量奖励模型(semi-scalar reward model),用于完整歌曲的五维美学评估。核心方法是通过自然语言美学评论(critique)作为中间表示,再预测连续奖励分数。采用两阶段训练:先用 Gemini-3-Pro 生成的评论做 SFT,再用模型自生成评论做奖励学习。属于方法型论文——提出新架构+训练流程,并在 in-domain / OOD / 下游 GRPO 三个层面评估。
依据: 论文的消融实验设计较好,隔离了三个关键变量:(1) 评论 vs 无评论,(2) 自生成评论 vs 外部教师评论,(3) SFT 初始化 vs 无 SFT。Table 4 的消融结果清晰支持论文主张。但存在以下问题:
Baseline 不公平: MuseCritic 使用 MOSS-Audio-8B-Instruct(8B 参数的音频语言模型)作为骨干,而 in-domain 主要 baseline SongEval(UTMOS) 是一个判别式回归模型,参数量和架构能力差异巨大。论文将性能提升归因于评论机制,但未控制骨干网络能力差异。一个 8B 的音频 LLM 即使不加评论,也可能因为更强的音频理解能力而优于 UTMOS 判别器。
评论对排序贡献有限: 消融显示 “w/o critique” 变体在多个维度的 LCC、SRCC、KTAU 上与完整模型相当甚至更好(如 Coherence: LCC 0.9173 vs 0.9147, SRCC 0.8954 vs 0.8894)。评论仅在 MSE(绝对分数校准)上有明显优势。论文诚实讨论了这一点(Figure 2 分析无评论时预测聚集在窄范围),但对于用于 RL 的奖励模型,排序能力可能比绝对分数校准更重要。
OOD 提升不显著: Music Arena 上 71.35% vs SongEval 70.80%,仅提升 0.55 个百分点(733 对中多正确约 4 对),在统计噪声范围内,论文未报告置信区间或显著性检验。
依据: 存在以下独立性关注点:
评论生成分数条件化: Gemini-3-Pro 生成评论时看到了专家评分(prompt 中包含 {coherence}, {memorability} 等变量),即评论是 score-conditioned 的。这意味着 SFT 数据中的评论并非独立于评估目标生成,而是被评分引导的。虽然论文说明这是为了让评论的”评估极性”与评分一致,但这种方式生成的评论本质上是评分的事后合理化,而非独立的美学判断。
GRPO 下游评估的循环性: GRPO 的下游评估使用 SongEval 和 Audiobox Aesthetics 作为评估器。MuseCritic 的训练数据来自 SongEval,因此 MuseCritic 的奖励信号与 SongEval 评估器共享同一评分体系。用 SongEval 评估 GRPO 效果存在训练-评测循环——模型优化的就是 SongEval 评分,再用 SongEval 评估提升,这不是独立的证据。Audiobox Aesthetics 提供了部分独立性,但其提升也很小(0.01-0.15)。
积极因素: 8 位音乐专家对 Gemini 生成的评论进行了人工验证(Appendix A),确认评论基于可听的音乐证据。OOD 评估使用 Music Arena(不同数据集、不同评估格式——偏好对 vs 绝对评分)提供了部分独立证据。论文使用 seed 42 固定数据划分,测试集 200 首歌不参与训练。
总体而言,in-domain 评估和 GRPO 评估的循环性是 major 问题,OOD 评估和人工验证提供了部分缓解。
依据: MuseCritic 的方法设计相对简洁:两阶段训练(SFT → 奖励学习),评论作为中间变量,奖励头是简单的线性投影 + sigmoid。不复杂装饰。但方法的压缩价值有限:
方法本质是 Critic-RM 的领域迁移: Critic-RM(Yu et al., NAACL 2025)提出了完全相同的范式:先用教师模型生成评论做 SFT,再用自生成评论做奖励学习,以缓解训练-推理分布偏移。MuseCritic 的两阶段流程与 Critic-RM 高度对应。CLoud(Ankner et al., 2024)提出了评论再评分的半标量奖励模型。MuseCritic 将这两个已有 idea 迁移到音频/音乐领域。
五维 rubric 直接采用: 五个评估维度直接来自 SongEval,论文未对维度定义做任何重构或压缩。
奖励头是标准设计: 线性投影 + sigmoid 范围变换是奖励模型的标配,无新设计。
GRPO 应用是标准做法: 使用奖励模型做 GRPO 是 RLHF 的标准流程,论文在此处无方法创新。
方法的简洁性是优点,但缺乏超越 prior work 的压缩性贡献。论文没有发现可迁移的经验规律或新的 trade-off。
依据: 效果分析如下:
In-domain(Table 1): MSE 从 0.2875 降至 0.2316(~19% 相对降低),LCC 从 0.8793 升至 0.9068(~3% 相对提升),SRCC 从 0.8531 升至 0.8838,KTAU 从 0.6766 升至 0.7178。提升是真实的但幅度有限。绝对性能水平(LCC ~0.91)在领域内是可用的。
OOD(Table 2): 71.35% vs SongEval 70.80%——仅 0.55pp 提升,在 733 对的统计噪声范围内。论文未报告置信区间或显著性检验。这一结果不能有力支持 OOD 泛化的主张。vs Audiobox 68.49% 和 Qwen3-Omni 53.75% 的差距较大,但这两个 baseline 本身不是为歌曲美学偏好设计的。
GRPO 下游(Table 3): 全部 9 个指标均有提升,但幅度很小——SongEval 五维各提升 0.05-0.06(5 分制),Audiobox 四维提升 0.01-0.15。无显著性检验。Table 5 的多窗口鲁棒性检查显示 GRPO 在所有窗口均优于 baseline,这是积极的信号。
缺失 baseline: HEAR(arXiv 2511.18869, 2025-11)是一个层次化多维音乐美学评估模型,未被比较。ICASSP 2026 Song Aesthetics Evaluation Challenge 的参与者结果未被引用。MusicRL(arXiv 2402.04229)是音乐领域 RL 对齐的先前工作,未在 baseline 中比较。
公平性: MuseCritic(8B 音频 LLM + 评论)vs SongEval(UTMOS)(判别式回归器)的对比不公平——骨干网络能力差异可能贡献了大部分提升。
效果在多个设置上一致提升是积极的,但提升幅度有限、缺少关键 baseline、无显著性检验、OOD 提升在噪声范围内,综合来看效用证据不够强。
依据: 新颖性分析:
核心方法来自 prior work: 两阶段训练(教师 SFT → 自生成评论 → 奖励学习)直接来自 Critic-RM(Yu et al., NAACL 2025)。评论作为中间变量再评分的范式来自 CLoud(Ankner et al., 2024)。MuseCritic 的贡献是将这两个 idea 迁移到长篇歌曲音频领域。
领域迁移的非平凡性: 迁移到音频领域确实需要工程努力——使用音频语言模型(MOSS-Audio-8B)作为骨干、设计五维 rubric 的评论格式、用 Gemini-3-Pro 做音频评论的 cold-start。但论文未证明迁移后解决了本领域的新问题——评论机制在文本 RM 中已被证明有效,在音频中也被证明有效并不意外。
组件必要性有消融支持: Table 4 的消融确实证明了评论、自生成评论、SFT 初始化各自的贡献。w/o SFT 变体性能大幅下降(MSE 0.7541 vs 0.2316),说明 SFT 是必要的。这是积极信号。
无新机制解释: 论文未提出新的机制解释、问题重构或经验压缩。Figure 2 的分析(无评论时预测分布收窄)是一个有趣的观察,但这是已知现象(regression to mean)在特定设置下的体现,非反直觉发现。
命名膨胀: “semi-scalar reward model” 这一术语是 CLoud 已有概念的换名——CLoud 也是先生成评论再预测标量分数。
综合来看,这是一个 A+B 的领域迁移工作,每个组件都有明确的 prior work,消融支持了组件必要性,但概念新颖性有限。
依据: 可复现性良好:
主要关注: SFT 数据构建依赖 Gemini-3-Pro(闭源 API),这影响 SFT 数据的精确复现。但 SFT checkpoint 和自生成评论理论上可以共享,部分缓解此问题。此外,Gemini-3-Pro 和 Gemini-3.1-Pro 的模型版本在 Appendix B 中注明了具体标识符。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ⚠️ | 7 | 1.0 | 7.0 |
| 二 识别公理 | ⚠️ | 5 | 1.5 | 7.5 |
| 三 独立性公理 | ⚠️ | 5 | 1.0 | 5.0 |
| 四 压缩公理 | ⚠️ | 5 | 1.0 | 5.0 |
| 五 效用公理 | ⚠️ | 5 | 2.0 | 10.0 |
| 六 新颖性公理 | ⚠️ | 4 | 2.0 | 8.0 |
| 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 |
加权总分: 5.3/10(加权分之和 50.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5