我已获取所有所需的研究数据。以下是我收集到的关键事实:

  1. 论文全文: 15 页,已完整阅读。这是一篇方法型论文,提出了一个用于多方言 ASR 的三阶段框架(CPT → SFT → OPSD),并基于 Qwen3-ASR-1.7B 构建。
  2. OPSD 来源: [37] = “Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models” (Zhao et al., arXiv 2601.18734, 2026 年 1 月)。此外 [1] = Agarwal et al. 的 “On-Policy Distillation of Language Models” (ICLR 2024)。OPSD 是从 LLM 领域向 ASR 的跨领域迁移。
  3. 基模型: Qwen3-ASR-1.7B (arXiv 2601.21337),已在 paper-wiki 中记录,具备强大的普通话能力和部分方言能力。
  4. 基线: GLM-ASR-Nano-2512, Fun-ASR-Nano-2512, Qwen3-ASR-1.7B — 均为开源。消融实验:包含/不包含 CPT,对比 OPSD 与 Continued SFT(数据/调度相同)。
  5. 数据集: ~100k 小时训练数据,13 个公开/共享测试集 + 18 个内部方言测试集。
  6. 关键结果: OPSD 将普通话平均 CER 从 3.40→3.27,方言平均 CER 从 13.16→12.79,内部平均 CER 从 13.30→12.42。而 Continued SFT 会增加普通话 CER (3.40→4.43)。
  7. OMC Wiki: 无相关记录(所有查询均返回空)。
  8. paper-wiki: 仅找到 Qwen3-ASR (2601.21337)。没有其他相关工作。

现在我将撰写完整的审稿报告。

论文审稿:On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

论文类型: 方法型

本文提出一种三阶段框架(CPT → 方言 SFT → OPSD 精炼),用于在保持普通话能力的前提下改进中文多方言 ASR。核心方法贡献是将 on-policy self-distillation 从 LLM 领域迁移到自回归 ASR 精炼,使用 reference transcript 作为 teacher 的 privileged context。


公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理


总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 8 1.0 8.0

加权总分: 6.95/10(加权分之和 65.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8