我已经获取了所有必要的信息。现在开始输出结构化审稿意见。
Paper Review: WanSong v1.0 Technical Report
论文类型: 系统型
本论文是阿里巴巴 Wan 团队的技术报告,提出一个端到端纯扩散音乐生成系统 WanSong v1.0,涵盖 VAE、混合 MMDiT 主干、双音轨建模、RLHF 对齐、多阶段训练及内部 benchmark 评测。属于完整系统/工程集成型论文。
公理审查结果
公理一:对象公理
- 判定: ✅
- 分数: 8
- 依据: 论文研究的对象——长时长(≤5 分钟)、多语言、商用级歌曲生成——是真实、清晰、有广泛工业需求的问题。Suno、Mureka 等闭源系统已验证该任务的商业价值。论文进一步将”端到端纯扩散 vs AR 主导级联”作为子问题,该对比在 2025-2026 年音乐生成社区是真实讨论焦点(ACE-Step、DiffRhythm 2 同期探索扩散路线)。双音轨输出(vocals + BGM 分离)是后期制作中真实需求,不是人造概念。多语言(中英日韩)覆盖也有真实社区价值。核心概念均可操作化:VAE 压缩比、PER、SongEval、Muq 均有明确定义。
- Wiki 证据: OMC wiki 无记录。paper-wiki 返回 UniMoE-Audio (2510.13344) 和 InstructAudio (2511.18487) 均关注统一语音/音乐生成,确认该任务方向活跃。free-search 找到 ACE-Step (2506.00045)、DiffRhythm 2 (2510.22950)、LeVo (2506.07520)、YuE (2503.08638) 等同期工作,确认长时长歌曲生成是真实研究前沿。
公理二:识别公理
- 判定: ⚠️
- 分数: 5
- 依据: 论文同时改变 VAE 压缩比(2048→1024)、主干架构(hybrid-MMDiT + AdaLN)、训练策略(3 阶段 PT + SFT)、双音轨方案、RLHF(DPO + ReFL),却将最终性能归因于”纯扩散 + 双音轨”。消融实验仅覆盖压缩比(Table 5,仅 PT-90s 阶段),未隔离双音轨 vs 单音轨混叠的消融,未隔离 RLHF 各维度(musicality / lyric accuracy / prompt alignment)的独立贡献,未隔离 hybrid-MMDiT vs 标准 MMDiT 的差异。Table 1 的 “Ours 2048” vs “Ours 1024” 设计较好地隔离了压缩比效应,但主实验(Table 3/4)的 WanSong vs 闭源 baseline 比较无法归因到具体组件——因为同时变更了架构、数据、训练步数和 RLHF。此外,闭源 baseline(Suno V5、Mureka V7.6、LeVo)的训练数据和模型规模均不透明,公平性存疑。
- Wiki 证据: OMC wiki 无记录。paper-wiki 无相关消融记录。free-search 确认 ACE-Step 使用 DCAE + linear transformer + REPA 对齐,架构路径不同但同样追求扩散端到端,论文未与 ACE-Step 做同 backbone / 同数据比较。
公理三:独立性公理
- 判定: ❌
- 分数: 3
- 依据: 存在多个严重的循环论证问题:
- Table 4 的 musicality 评测模型是自训练的:论文明确写道 “our own musicality evaluation model… trained on 80k songs annotated by human”。该评测模型由 WanSong 团队自建,训练数据来源和标注流程未独立验证。用自建 judge 评测自己的模型,且 WanSong 在该指标上大幅领先(5.49 vs Suno 4.18 vs Mureka 3.83),存在严重的 self-reward bias。
- RLHF reward model 与评测维度重叠:RLHF 的三个维度(musicality、lyric accuracy、prompt alignment)与评测指标高度重叠。reward model 同样是自训练的,训练数据闭环。
- WanSong Bench 是自建 benchmark:200 样本覆盖 4 语言 10+ 流派,但数据来源、标注标准、样本选取规则均未公开。评测用的 PER、SongEval、Muq 是外部工具,但 Table 4 的核心优势指标(musicality 5.49)完全依赖自建 judge。
- 训练数据 6M 小时 vs 评测数据:评测集是否严格隔离于训练集未明确说明。WanSong Bench 的 200 样本”collected”,与训练数据的 collection pipeline 可能共享来源。
- Wiki 证据: OMC wiki 无记录。paper-wiki 无相关 judge 独立性记录。free-search 确认 SongEval (yao2025songeval) 和 Muq (zhu2025muq) 是外部评测工具,论文也使用了它们(Table 3),但 Table 3 的分数差异极小(SongEval 4.47 vs 4.44 vs 4.38),统计意义存疑,而差距明显的 Table 4 恰好用的是自建 judge。
公理四:压缩公理
- 判定: ⚠️
- 分数: 5
- 依据: 论文声称 “simple yet effective” 和 “No gimmicky tricks are needed”,但实际系统复杂度不低:hybrid-MMDiT + fully-shared AdaLN + dual-stem token scheme + joint-learning-in-layer + 3-stage PT + SFT + DPO + ReFL + step-distillation + LLM text captioner。每个组件单独看都是已有技术的组合或变体:
- MMDiT 来自 Esser et al. (2024),AdaLN 来自 Wan2.1,hybrid 设计灵感来自 Flux。
- Flow matching / Rectified Flows 来自 Lipman et al. 和 Esser et al.。
- DPO 来自 Wallace et al.,ReFL 来自 Xu et al.。
- VAE + 多尺度判别器是标准音频生成做法(Stable Audio、EnCodec 等)。
压缩价值主要体现在两点:(1) 将 AR 主导的多阶段 pipeline 压缩为单阶段纯扩散;(2) 双音轨联合学习方案(在同一 block 内作为不同通道学习,输出独立)是一个清晰的问题重构。但论文未证明为什么 dual-stem 优于简单的 two-model 或 conditional generation,未给出 dual-stem 的理论或经验边界分析。”simple” 的叙事与实际系统复杂度存在落差。
- Wiki 证据: OMC wiki 无记录。paper-wiki 中 InstructAudio (2511.18487) 也使用 “multimodal diffusion transformer” 做统一语音/音乐生成,确认 MMDiT 用于音频生成不是新做法。ACE-Step 同样用扩散 + DCAE 做端到端音乐生成,且开源。
公理五:效用公理
- 判定: ⚠️
- 分数: 5
- 依据:
- Table 3(外部评测):WanSong 在 PER (7.43%) 上大幅领先 Suno V5 (22.80%) 和 LeVo (27.11%),与 Mureka (12.7%) 也有差距。SongEval/Muq 分数差异极小(4.47 vs 4.44 vs 4.38),WanSong 略优但在评测工具泛化性存疑的注释下,这些差异可能不具统计显著性。
- Table 4(自建 judge):WanSong musicality 5.49 远超 Suno 4.18 和 Mureka 3.83,但如公理三所述,judge 独立性严重不足。
- 绝对水平:musicality 5.49/10 的绝对值不算高(刚过半),PER 7.43% 仍有改进空间。商用级声称与指标水平之间存在落差。
- Baseline 覆盖:缺少 ACE-Step、DiffRhythm 2、YuE 等开源扩散路线 baseline 的比较。论文只比闭源(Suno、Mureka)和一个 AR baseline(LeVo),未比同期纯扩散工作。
- 指标覆盖:没有人类听感测试(MOS/ABX),没有歌词对齐准确率的独立评测,没有长时长一致性(>3min)的专门评测。
- Wiki 证据: OMC wiki 无记录。free-search 确认 ACE-Step 报告 4 分钟音乐 20 秒生成(15x 快于 LLM baseline),WanSong 未报告推理速度对比。DiffRhythm 2 报告 5Hz VAE frame rate,WanSong 是 43.1Hz,两者效率差异巨大但未对比。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 4
- 依据: 论文的核心 novelty 声称有三点:
- 纯扩散端到端歌曲生成:ACE-Step (2506.00045, 2025-05) 已经做了扩散端到端音乐生成,且明确定位为 “foundation model for music AI”。DiffRhythm 2 (2510.22950, 2025-10) 做了端到端 NAR 扩散歌曲生成 + RLHF。WanSong (2607.14749, 2026-07) 晚于两者超过 2 个月,不构成 concurrent work 豁免。论文 Related Work 提到了 ACE-Step 1.5 和 DiffRhythm 2,但将它们归类为”require more elaborate training pipeline/component design”,未做直接实验对比。
- 双音轨建模:将 vocals 和 BGM 分离建模是一个有价值的工程选择,但 “dual-stem token scheme with joint-learning-in-layer” 的具体设计——在同一 block 中作为不同通道处理、输出独立——在概念上类似于 multi-channel diffusion 或 conditional stem generation,并非全新机制。论文未引用或对比已有的音源分离 + 生成联合方法。
- RLHF for music:DiffRhythm 2 已经做了 RLHF(cross-pair preference optimization),LeVo 做了 multi-preference alignment。WanSong 的 DPO + ReFL 组合策略是已有方法的直接应用,且论文明确说 “loss function details… are not the core of this paper”。
综合来看,WanSong 的主要增量在于:在更大规模(25B 参数、6M 小时数据)上验证纯扩散路线 + 双音轨工程选择。这是一个有价值的系统级验证,但不是方法级新颖性。
- Wiki 证据: OMC wiki 无记录。paper-wiki 中 UniMoE-Audio 和 InstructAudio 确认统一音频生成已有多种架构探索。free-search 确认 ACE-Step (开源、含代码权重)、DiffRhythm 2 (含 RLHF)、LeVo (multi-preference alignment) 均已发表,WanSong 的技术路线与它们的重叠度较高。
公理七:可复现公理
- 判定: ❌
- 分数: 2
- 依据:
- 代码/模型未开源:论文提到 \modelcard 但未提供 GitHub 链接或开源承诺。作为阿里巴巴技术报告,大概率不会开源。
- 数据不可获取:6M 小时内部数据,五阶段 pipeline 的具体规则(filtering 阈值、captioning 标注标准、sampling 平衡策略)均未公开。
- 评测不可复现:WanSong Bench 的 200 样本未公开。自建 musicality judge model(80k songs 训练)未开源。RLHF reward model 未开源。
- 训练细节不足:25B 模型的 3 阶段训练(90s → 300s → SFT)每阶段的步数、数据配比、学习率调度未完整给出。RLHF 的 prompt 收集规则、标注人数、标注一致性未报告。
- 闭源依赖:baseline 中的 Suno V5 和 Mureka V7.6 是闭源 API,无法独立验证其版本和配置。
这是一篇几乎完全不可独立复现的技术报告。
- Wiki 证据: OMC wiki 无记录。free-search 确认 ACE-Step 已开源代码和模型权重(”code, model weights and demo available”),形成鲜明对比。
总评
- 科学价值: 低 — 核心结论(纯扩散可做长时长歌曲生成)已被 ACE-Step 和 DiffRhythm 2 验证,本文增量主要在工程规模而非科学发现。消融实验不足以支撑因果归因。
- 方法价值: 中 — 双音轨 joint-learning-in-layer 是有价值的工程设计,解决了 CFG 无法同时平衡 vocals/BGM 的真实问题。但缺乏与替代方案的对比和理论分析。
- 社区价值: 低 — 不开源代码/模型/数据/benchmark,作为闭源技术报告对社区的可用贡献有限。WanSong Bench 和 musicality judge 未公开,无法成为社区基础设施。
日报摘要
- Strength: 在 25B 参数 / 6M 小时数据规模上验证了纯扩散端到端歌曲生成路线,PER 7.43% 显著优于 Suno V5 (22.80%) 和 LeVo (27.11%),双音轨设计解决了 CFG 下 vocals/BGM 平衡问题。
- Weakness: 核心优势指标(musicality 5.49)依赖自训练 judge 模型,存在循环论证;缺少 ACE-Step/DiffRhythm 2 等同期扩散 baseline 对比;消融实验不足以隔离各组件贡献;代码/模型/数据/benchmark 均未开源,几乎完全不可复现。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
8 |
1.0 |
8.0 |
| 二 识别公理 |
⚠️ |
5 |
1.5 |
7.5 |
| 三 独立性公理 |
❌ |
3 |
1.0 |
3.0 |
| 四 压缩公理 |
⚠️ |
5 |
1.0 |
5.0 |
| 五 效用公理 |
⚠️ |
5 |
2.0 |
10.0 |
| 六 新颖性公理 |
⚠️ |
4 |
2.0 |
8.0 |
| 七 可复现公理 |
❌ |
2 |
1.0 |
2.0 |
加权总分: 4.37/10(加权分之和 43.5 / 权重之和 9.5)
最终建议: Weak Reject
核心判定理由:WanSong 是一个工程完成度高的闭源系统,但在科学审查标准下存在三个致命问题:(1) 核心优势指标依赖自训练 judge,构成循环论证(公理三);(2) 消融实验无法支撑因果归因,多组件同时变更(公理二);(3) 代码/模型/数据/benchmark 全部未开源,不可独立复现(公理七)。新颖性方面,纯扩散歌曲生成路线已被 ACE-Step 和 DiffRhythm 2 验证,本文增量主要在规模和工程集成。双音轨设计是有价值的工程贡献,但缺乏与替代方案的对比和理论分析。作为技术报告,它展示了工业实力;作为科研论文,它不满足独立验证和因果识别的基本要求。