Paper Review: MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

论文类型: 数据型 + Benchmark 型

该论文核心贡献是一个大规模音乐美学数据集(MADB)及其评测框架,属于数据型与 benchmark 型的混合。审稿尺子侧重:数据是否有独立质量锚点、是否带来训练价值、是否可泛化,以及 benchmark 的 scenario validity、数据来源、judge 独立性、指标可信度、baseline 覆盖度。


公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理


总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 ⚠️ 5 1.0 5.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 ⚠️ 5 2.0 10.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 8 1.0 8.0

加权总分: 6.3/10(加权分之和 57.0 / 权重之和 9.5) 最终建议: Borderline (5-6.5)

总结: MADB 是一个执行良好的数据集工作,标注质量控制到位,可复现性良好。但作为 benchmark 论文,其效用存在缺口:30% 音频不可获取、缺少与最接近竞品(SongEval/MusicEval)专用评估模型的直接对比、评分动态范围有限导致低性能的归因不清。标注信息与评测目标的部分循环(评论→训练信号,评分→评测目标)削弱了 CLAP 语义适应实验结论的认识论效力。新颖性主要在数据规模层面,方法和框架层面无新贡献。建议接收前补充与 SongEval/MusicEval 评估模型的直接对比实验,并讨论评分分布集中对性能归因的影响。