Paper Review: Dissonance Spectrum explicitly models perceptual frequency interactions for better music understanding

论文类型: 方法型

本文提出了一种新的时间-频率表示(Dissonance Spectrum, DS),将音程-调谐距离(Tenney harmonic distance + Stolzenburg 容差理性近似)以核卷积形式作用到幅度 CQT 上,把两两频率交互归因回各个频率 bin,再以零初始化的门控残差适配器作为插件分支注入 MU-LLaMA 与 Music2Emo 两个宿主模型。论文同时包含一套受控乐理验证(音程/和弦/连接/调式序数相关性)与两族模型上的下游评测。它属于「表示方法 + 插件集成」的方法型工作,附带一条可解释性论证,但缺少新的数据集、评测协议或感知实验。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

这篇论文的优点集中在问题定位、实验纪律与自我约束的诚实上。把不协和关系从标量分数升级为保留时间-频率定位的 K×T 表示,并用频轴相关把 O(K²T) 的 pair 张量压成可批量的一维相关,是干净且有实际意义的工程贡献;受控乐理验证(音程 ρ=.951、功能连接 ρ=.794、教会调式 ρ=.893,n=13/7/7)加上 6 个配对种子、参数匹配 Gaussian 控制与架构匹配 CQT 控制,构成了一个在同类工作中较严谨的评测骨架;作者反复声明「无听感实验」「乐理序是理论假设」「CQT 对照不能完全隔离变换本身」,这些边界声明在 arXiv 论文中属于高水准的自我审查。机制分析(随机核、时序打乱均降点)也为「有序关系结构」提供了方向性证据。

主要问题在于:DS 相对「架构匹配的第二个音高分辨通路」CQT 分支的增益太小且不显著——MusicQA BERTScore-R 仅 +.0028、Music2Emo R̄²_VA 仅 +.0047,而精确符号检验 Holm 调整后 p=.09375,作者只能以「方向一致 + 效应量」自证。这直接动摇了效用公理的核心主张:既然增益的主要部分来自「多给一条音高分辨的 CQT 通路」这一廉价替代,DS 独有的 pairwise 组织价值只对应其中很小一部分。同时,感知承诺与证据不对称——标题和摘要反复用「perceptual」,但全篇没有一个听感实验,受控序数参照多为乐理推导;MusicQA 自动参考度量的是文本相似度而非音乐理解力。新颖性上各组件(Stolzenburg 2015、Tenney 1984、Sethares 聚合、零初始门控适配器)均为既有技术,整合虽有新角度但整体属增量。可复现性上代码明确打包但未给公开链接,GitHub 检索零命中,现阶段无法外部核验。综合来看,这是一个设计诚实、评测用力的增量方法,作为「可解释的补充表示」具有潜在价值,但作为「perceptually motivated」的强主张,证据强度明显不足。

日报摘要

打分

公理 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 8 1.0 8.0
四 压缩公理 ⚠️ 7 1.0 7.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 6.63/10