本文定义了一个评估协议分类体系(split design × input availability 的 2×4 grid),并通过控制性因子消融实验在两个厅堂上量化了协议选择对报告精度的影响。核心贡献是揭示了一个领域内广泛存在的评估错误模式,而非提出新模型或新数据。按分析型论文的尺子审查。
依据: 效用评估需区分两类 claim:(A) 协议批评的效用,(B) deployment-consistent 协议下模型的实用效用。
(A) 协议批评的效用:强。Table 2 的因子消融直接量化了协议选择导致的 R² 差异(C80: 0.879→0.134, D50: 0.804→0.160, EDT: 0.779→0.091),效应量大且跨参数一致。cross-model spread(~0.1)vs cross-protocol spread(up to 0.75)的对比是一个可靠的、可迁移的经验规律。reporting checklist 有直接的操作价值。
(B) deployment-consistent 协议下的模型效用:弱,但作者诚实报告。honest cell 下 G 的 R² = 0.57、T30 = 0.26、clarity 类 0.09–0.22,绝对水平低。inverse-distance weighting 在 clarity 类上匹配或超过学习模型。仅 sound strength 和 T30 显示了学习模型的 genuine advantage。density 实验显示 clarity 类在任何密度下都不可用(最佳 0.31 at n=60 for Ts)。这意味着在 deployment-consistent 协议下,现有模型对 6 个核心参数中的 4 个几乎无实用价值。作者明确承认 “no density of the kind studied here substitutes for direct measurement” 并将此定性为 representational limit 而非 task verdict。
扣分原因:证据基础限于两个厅堂、单 campaign。作者自身在 Section 5.4 承认 “effect sizes are venue-specific and await cross-venue replication”。ten-position 厅堂的 fold variance 极大(std 0.03–1.3),使得该厅堂的部分定量结论不可靠。虽然作者将此不确定性本身视为 finding(”below some position count, spatial-prediction claims cannot be evaluated meaningfully at all”),但这限制了结论的可迁移性。两个厅堂不足以支撑强外推 claim。绝对指标在 honest 协议下大多低于工程可用阈值,虽然这是诚实的报告但限制了论文对 “模型是否真正有用” 这一问题的正面回答。
依据: 新颖性是真实的领域增量,非换名或拼装。具体而言:
(1) 协议分类体系:将 ML 方法学中已有的 grouped CV 和 data leakage 概念系统化迁移到房间声学领域,并做了领域特定扩展——I1–I4 四类 input availability 分类基于 “omnidirectional 参数均来自同一 impulse response” 这一领域结构事实,这是非平凡的领域 reframing 而非简单迁移。Table 1 的协议网格在房间声学文献中是新的。
(2) Position fingerprint 发现:K3 在 75-position 厅堂增益 +0.11 但在 10-position 厅堂下降 -0.23 的 sign reversal 是一个反直觉的经验发现,且作者给出了合理的机制解释(few positions → spectral branch learns position identity而非 transferable acoustics)。这一发现是新的。
(3) Privileged information 的 null result:K2 vs K1 的零增益在两个厅堂上一致,这是一个有价值的负面结果,且首次在房间声学 LUPI 设置下报告。
(4) Density curves under deployment-consistent protocol:将 companion study [15] 的 density 分析在 honest 协议下重新推导,per-parameter class 的 guidance(G sparsity-robust, T30 scales with density, clarity requires measurement)是新的操作结论。
不构成严重新颖性缺陷的问题:companion study [15] 共享数据和 RF pipeline,但本文的分析框架和结论是独立的。LUPI 概念本身非新(Vapnik 2009 [22]),但其在房间声学中的 null result 是新贡献。grouped CV 在 ML 方法学中非新,但在房间声学文献中的系统应用是新的。
依据: 部分可复现,有明确缺口。
正面:作者承诺 “evaluation scripts, split definitions, random seeds, and per-fold results” 将在 acceptance 后公开,review 期间可从作者获取。三个模型族中两个(RF 和 spatial baselines)是标准实现,hybrid CNN 架构在 Figure 1 中描述充分(22 几何特征, 128 mel bands × 257 frames, learnable weighted sum fusion, modality dropout p=0.5)。数据采集协议(swept-sine, ISO 3382-1, ten temperature conditions, occupancy 0–100%)在 Section 2 中描述详细。measurement data quality 已通过独立审计框架 [19] 筛查。
缺口:(1) 数据本身 “available from the author upon reasonable request”——非完全开源,依赖作者个人响应,存在单点失败风险。(2) 混合 CNN 的训练超参数(学习率, batch size, epochs, optimizer, early stopping criteria)未在正文中报告,仅在 Figure 1 中给出架构。fold-to-fold 标准差 “released with the evaluation code” 但未在论文中完整给出。(3) 两个厅堂的完整 measurement data(IR 和参数表)是否可在独立审计下公开尚不明确。(4) Companion study [15] under review,其数据与本文共享但尚未公开。(5) 专利相关的 switchable-inference 架构 (TR 2026/001430) 的实现细节是否完全在论文中披露存在不确定性。
这些缺口不直接否定结论——核心协议批评的逻辑不依赖训练超参数的精确值(RF 和 IDW 的结果足以支撑主结论)——但限制了独立验证网络相关结果(Table 3, Figure 3)的能力。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ✅ | 9 | 1.0 | 9.0 |
| 二 识别公理 | ✅ | 9 | 1.5 | 13.5 |
| 三 独立性公理 | ✅ | 9 | 1.0 | 9.0 |
| 四 压缩公理 | ✅ | 8 | 1.0 | 8.0 |
| 五 效用公理 | ⚠️ | 6 | 2.0 | 12.0 |
| 六 新颖性公理 | ✅ | 8 | 2.0 | 16.0 |
| 七 可复现公理 | ⚠️ | 6 | 1.0 | 6.0 |
加权总分: 7.7/10(加权分之和 73.5 / 权重之和 9.5) 最终建议: Weak Accept (6.5-8)
核心理由: 论文在识别公理和独立性公理上表现突出——因子消融设计干净、因果归因明确、自我批评诚实。协议网格和 position fingerprint 发现是真实的领域增量,reporting checklist 有直接操作价值。主要扣分来自效用公理(单 campaign、honest 协议下多数参数不可用)和可复现公理(数据非完全开源、CNN 超参数未报告)。建议接收的条件是:(1) 补充第三个厅堂的 grouped-position replication(作者已在 [19] 中预注册);(2) 论文发表时同步公开代码、splits、seeds 和 per-fold results;(3) 补充 hybrid CNN 的训练超参数表。