我现在已经获取了所有必要的事实锚点。以下是汇总的研究发现:

全文已获取:通过 arXiv HTML 和 PDF 获取(共 8 页,所有章节均已阅读)。

关键先验工作锚点

  1. Ochiai 等人 (2024), arXiv 2404.14860 — “Rethinking Processing Distortions: Disentangling the Impact of SE Errors on ASR” (被引 24 次) — 将 SE 错误分解为干扰/噪声/伪影,并控制其比例。这是最接近的诊断先验工作。该论文正确引用了此项工作 [14,21],并将其定位为互补(输出级与掩码级)。
  2. Iwamoto 等人 (2022), arXiv 2201.06685 — “How Bad Are Artifacts?” — 将伪影分析为最具危害性的组件。已引用 [13]。
  3. Narayanan 等人 (2022), arXiv 2204.12092 — “Mask Scalar Prediction” — 学习带有 ASR 监督的自适应掩码标量。已引用 [19]。这本质上是 α 控制的训练版本。
  4. Power Exponent Weighting (Cui & Bao, 2021) — DNN 掩码近似中的幂指数。概念上与 A^α 相关,但在训练损失而非推理时使用。论文提到了指数控制 [20,34]。
  5. Williamson 等人 (2015/2016) — 复数比掩码 (cIRM) 及极坐标表示。基础工作,已引用 [40]。
  6. Cui 等人 (2025), arXiv 2501.02452 — 用于 OA 系数预测的桥接模块。已引用 [32]。
  7. 复杂比掩码的极坐标分解 — 标准信号处理;论文中使用的极坐标形式 M=Ae^{jφ} 是既有的。

现在我将撰写完整的评审。

论文评审:Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis

论文类型: 分析型

本文提出一种推理时极投影(polar projection)诊断方法,将 STFT 域复数掩码 $M=Ae^{j\phi}$ 分解为幅度强度控制 $\alpha$ 和相位校正控制 $\gamma$,通过在冻结的 SE 和 ASR 模型上扫描这两个参数,将定性解释(如”过度抑制”)转化为可测量的 WER 影响。论文核心贡献是诊断结论而非新模型,属于分析型论文。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 9 1.0 9.0
四 压缩公理 ⚠️ 7 1.0 7.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 8 1.0 8.0

加权总分: 6.74/10(加权分之和 68.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8