我已经掌握了足够的依据。通过 free-search 发现的关键点:T-Mimi (2601.20094) 和 Qwen3-TTS 是用于端侧 TTS 的相关并行/近期工作,而 “Efficient Streaming TTS Acoustic Model with Depthwise RVQ Decoding Strategies in a Mamba Framework” (Interspeech 2025) 是另一项直接针对 RVQ 深度解码效率的相关工作。现在我已有足够的信息来撰写评估报告。

评估:具备解耦时间深度扩散变换器的内存高效音频合成技术 (Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers)

论文类型: 系统型 + 方法型 (混合)

这是一篇面向苹果 AMX 协处理器上部署的生产级去标记化器 (detokenizer) 系统论文,其核心方法贡献在于通过 DiT 风格的阶段条件 (stage conditioning) 和滑动窗口 KV 缓存,实现具有常数内存复杂度的统一深度解码器。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 9 1.0 9.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 ⚠️ 5 1.0 5.0
四 压缩公理 8 1.0 8.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 2 1.0 2.0

加权总分: 5.4/10(加权分之和 53.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5

论文解决了一个真实的 on-device 音频合成工程问题,架构压缩相对 Moshi 有清晰增量,21 MB / 16× RTF 的生产数据令人信服。但核心新颖性有限(Moshi 已做时间-深度解耦,本文增量是消除 per-level projections + 标准 sliding window),基线比较不公平(Moshi 不同 bitrate/framerate,未给 Moshi scaling 数据),生产 MOS 提升无法归因到 detokenizer,且全闭源使结果不可独立验证。作为 Apple 生产系统参考有价值,但作为可验证的科学贡献处于 borderline。