好的,我已经掌握了充分的背景信息。现在让我输出最终评审。
依据: 绝对指标方面,SemBridge (0.8B, 120K h) 在 Seed-TTS-Eval 上达到 CER 0.95 (ZH), WER 1.81 (EN), CER 9.79 (ZH-Hard),在 CV3-EVAL 上达到 CER 3.34, WER 4.22, CER 10.58, WER 6.35。这些绝对值在领域中处于可用水平。但关键问题是:
(1) 与强 baseline 的公平性:SemBridge 0.8B/120K h 与 VoxCPM 0.6B/1.8M h (CER 0.93, WER 1.85)、VoxCPM2 2B/2M h (CER 0.97, WER 1.84) 在 Seed-TTS-Eval ZH/EN 上相当或略优,但 VoxCPM 用了 15 倍数据量。CosyVoice3-1.5B/1M h (CER 1.12, WER 2.22) 模型更大、数据更多但 CER 更高。然而,SemBridge 的 ZH-Hard CER 9.79 并不突出——VoxCPM2 达到 8.13, VoxCPM 达到 8.87。
(2) 说话人相似度有差距:SemBridge SIM 在多数子集上低于 VoxCPM (0.758 vs 0.772 ZH, 0.699 vs 0.729 EN) 和 VoxCPM2 (0.795, 0.753, 0.753)。论文承认这一点。
(3) 消融实验内部矛盾:Table 2 中 “+Align,-Anchor” (即仅 SA-VAE 替换) 在 ZH 上 CER 从 1.58 升到 1.51,但对比 Table 1 中 VoxCPM baseline (1.52) 和 “+SA-VAE” (1.63),SA-VAE 在 ZH 上反而变差。论文没有充分解释这一不一致。
(4) SVS 增益有限:Table 4 中 SemBridge vs. w/o Anchoring 的 CER 从 9.18→8.32 (Mandarin), WER 16.29→14.77 (English),但与 SoulX-Singer (CER 6.90) 相比仍有明显差距。SVS 上的增益相对较小。
整体效果是 content accuracy 有真实提升,但 speaker similarity 存在 trade-off,且部分指标并非最优。论文诚实地讨论了 trade-off。
依据: 核心创新点是”用离散语义 token 标签(分类目标)监督 AR LM 隐状态”,区别于已有工作的”连续特征对齐”(SemaVoice 对齐 VAE latents,MELA-TTS 对齐 ASR features)。Table 11 验证了这一区别的有效性:离散分类 (CER 1.47) 显著优于连续回归 (CER 1.90 at λsem=1.0)。
但新颖性有限:
真正的增量在于:(1) 将离散分类目标应用于连续隐空间 AR 的隐状态监督(而非 target 对齐),(2) 系统验证了离散分类 > 连续回归 for this purpose,(3) training-only 设计使得推理无额外开销。这是一个有价值的工程改进和经验发现,但机制层面的创新是增量性的。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ✅ | 8 | 1.0 | 8.0 |
| 二 识别公理 | ✅ | 8 | 1.5 | 12.0 |
| 三 独立性公理 | ⚠️ | 7 | 1.0 | 7.0 |
| 四 压缩公理 | ✅ | 8 | 1.0 | 8.0 |
| 五 效用公理 | ⚠️ | 6 | 2.0 | 12.0 |
| 六 新颖性公理 | ⚠️ | 6 | 2.0 | 12.0 |
| 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 |
加权总分: 6.3/10(加权分之和 67.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8