关键事实:OmniVoice (2026年4月1日,早于 DELTA-TTS 2026年7月5日约3个月) 使用了“diffusion language model-style discrete NAR”架构,并采用“从预训练 LLM 初始化”——这很接近,但并非明确意义上的 AR-to-dLLM 转换。这是并发相关工作,并非严格的先验工作,但在时间线上非常接近(刚好在2个月的宽限期之外,因此可以视为相关工作,而非并发工作)。DELTA-TTS 的核心创新点——“AR-to-dLLM 转换”、基于置信度排序的解码以及用于语音的 Conformer 卷积——依然具有其独特性。

我现在有足够的事实锚点。根据追溯日期:arXiv ID 2607.04140v1 → 提交于2026年7月5日。论文内注明“arXiv:2607.04140v1 [eess.AS] 5 Jul 2026”。以下为最终评审。


Paper Review: DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

论文类型: 方法型(轻量化 AR→dLLM 适配框架,用于 zero-shot TTS)

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 8 1.0 8.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 7.16/10(加权分之和 68.0 / 权重之和 9.5) 最终建议: Weak Accept(6.5–8) — 严格、干净的低资源方法论文,绝对指标和消融都达标;主要短板是 OmniVoice/DiFlow-TTS/2509.20060 等近同期工作未被 Related Work 讨论从而削弱新颖性叙事,以及代码尚未承诺开源。建议作者在 camera-ready 中补充与 OmniVoice 的直接对比并明确 code release。