Paper Review: DAVSS: Distilled Audio-Visual State Space Models
论文类型: 方法型
本文把 Transformer→SSM 知识蒸馏框架(DASS)扩展到多模态视听设置,提出 DAVSS(Distilled Audio-visual State-Space)模型。核心贡献有三:以 CAV-MAE 为 teacher 蒸馏出 14/47/84M 三种规模的 SSM student;用更细 patch(更长的输入序列)补偿小模型容量;把联合建模参数占比从 CAV-MAE 的 <5% 提高到 30%。评测任务是 AudioSet(mAP)与 VGGSound(accuracy)上的视听音频事件分类。
公理审查结果
公理一:对象公理
- 判定: ✅
- 分数: 8
- 依据: 对象真实且界定清晰。视听音频事件分类是明确任务,模型规模给出具体数字(DAVSS-Tiny/Small/Medium = 14.4/46.9/84.4M 参数),与 CAV-MAE(165M)的对比关系明确。摘要称”14M 参数、12 倍小于 CAV-MAE”,正文又称”3.5 倍小于”,分别对应 Tiny(165/14.4≈11.5)与 Small(165/46.9≈3.5),两处表述可自洽但正文未指明具体型号,存在表述模糊。scope 完整(两种数据集、三种规模、融合深度消融)。
- Wiki 证据: arXiv API 检索 “audio-visual + state space” 确认任务领域真实存在但此前 SSM 仅用于分割/问答/取证等任务(AVS-Mamba、SHMamba、UniSkip-Mamba),视听事件分类的 SSM 尚缺。free-search 无返回(记录为失败);OpenAlex 确认 DASS(2407.04082,同组前作,被引 5)与 CAV-MAE(2022,被引 17)。
公理二:识别公理
- 判定: ⚠️
- 分数: 6
- 依据: 覆盖了主要强基线:CAV-MAE(50.5/65.4)、CAV-MAE-scale+(51.2/65.5)、Audiovisual MAE(51.8/65.0)、MAViL(53.3/67.1)、EquiAV(54.6/67.1),全部为公开 SOTA 级 transformer 模型。缺失最小对照与等资源对照:未与同参数规模的 transformer 在相同 patch/分辨率下对比,未做等计算量(FLOPs)对比;由于”更细分辨率”正是论文声称的补偿机制,patch 作为混淆变量未被单独隔离。也未与 2025-2026 更新的视听模型或 DASS 单模态版本的视听化变体比较。
- Wiki 证据: GitHub 确认 CAV-MAE 开源(YuanGongND/cav-mae,291 stars);arXiv API 检索确认 MAViL、EquiAV 均为真实被引用的对照;本仓库历史 review 2607.04498v1(UniSkip-Mamba)为相关视听 SSM 先例。
公理三:独立性公理
- 判定: ✅
- 分数: 8
- 依据: 评测在标准 held-out 测试集上进行(AudioSet 22k eval、VGGSound 15k test),与所有基线的微调协议一致(都基于 AudioSet train fine-tune),teacher CAV-MAE 的预训练与 student 训练共用 AudioSet 训练集属于该领域标准做法,不构成测试集泄漏。推理采用 10 帧平均的 frame-ensemble 标准协议。Table 2 的随机初始化+无 KD 基线(28.2 mAP)说明评测能区分训练信号贡献,KD 带来的 47.6→52.2 增益被独立量化。
- Wiki 证据: AudioSet(Gemmeke 2017)与 VGGSound(Chen 2020)为公开标准基准;CAV-MAE 论文同协议在 openalex/GitHub 均可查证,评测独立性无异常信号。
公理四:压缩公理
- 判定: ✅
- 分数: 8
- 依据: 参数压缩真实:DAVSS-Tiny 14.4M 对 CAV-MAE 165M,约 12 倍;DAVSS-Medium 84.4M 仍小 2 倍且 AudioSet 52.7 vs 50.5 反超 teacher。Figure 1(b) 报告推理速度随 patch 增大而提升(5000 对视听样本实测),可换取 2 倍于 CAV-MAE 的吞吐。压缩机制存在补偿(更细 patch 增加序列长度),但 Figure 1(b) 显示即便 patch 6 也”显著快于 CAV-MAE 且仍超越它”,效率增益是净的。
- Wiki 证据: 论文未提供精确吞吐数字表格(仅图),此为量化上的小缺口;DASS 前作(2407.04082)同样以”更小模型超越 transformer”为叙事,压缩路径延续但首次用于视听多模态。
公理五:效用公理
- 判定: ⚠️
- 分数: 6
- 依据: 效用量化充分但领先性受限。DAVSS-Tiny(14M)AudioSet 51.6 超过 CAV-MAE(50.5)、VGGSound 持平(65.4);DAVSS-Medium(84M)52.7/67.5 超过 CAV-MAE、AV-MAE、CAV-MAE-scale+,接近 MAViL(53.3/67.1),但 EquiAV(54.6/67.1)在两项上仍高出 DAVSS-Medium 1.9 mAP / 0.4 acc。论文摘要称”outperforms the existing audio-visual models”,与 EquiAV 数据不符。效用主要体现在效率轴(更小更快),准确率轴尚未达 SOTA。
- Wiki 证据: OpenAlex/GitHub 查证 EquiAV(2024,arXiv 2403.09502)为真实公开模型,其 54.6 mAP 为论文 Table 4 自报数据,故 SOTA 领先性缺口成立。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 6
- 依据: 首次把 Transformer→SSM 蒸馏与”更高联合参数占比”引入视听音频事件分类,检索未发现同任务的视听 SSM 先例,方向性增量成立。但组件全部已知:SSM 编码器(S4/Mamba)、patch merging 下采样、KD loss(0.5 BCE + 0.5 KL)均沿用 DASS 设计,30% 联合参数与细 patch 是工程调优而非新机制。新颖性为”方法迁移 + 两个架构洞察(融合深度 3 最优、patch 越细越好)”,属中等增量。
- Wiki 证据: arXiv API 检索确认既有视听 SSM 均在分割/问答/取证任务(AVS-Mamba、SHMamba、UniSkip-Mamba),无事件分类同构先例;本仓库 2607.04498v1 已评审 UniSkip-Mamba,佐证该小领域已被部分占据。
公理七:可复现公理
- 判定: ⚠️
- 分数: 5
- 依据: 数据公开(AudioSet、VGGSound),teacher CAV-MAE 开源(291 stars),训练细节较完整(10 epoch、lr 1e-4、batch 36、mixup 0.5、LR 每 epoch 减半)。但论文正文与 HTML 中未提供任何 DAVSS 代码链接或 checkpoint 地址,前作 DASS 明确开源而本文未跟进,student 权重与训练脚本缺失使复现需重写全部管线。
- Wiki 证据: GitHub code/name 搜索 “DAVSS” 未发现官方仓库(记录 rate-limit 部分失败);论文 HTML 全文 grep 无 github 链接(除 arXiv/LaTeXML 反馈页)。
总评
优点:(1) 压缩证据扎实,14M 参数的 DAVSS-Tiny 在 AudioSet 反超 165M 的 CAV-MAE teacher,参数效率故事清晰;(2) 消融完整,Table 1(融合深度 2/3/4 → 49.6/50.6/50.0)、Table 2(初始化+KD 的 28.2→52.2 分解)、Table 3(更强 teacher 的增益)三组实验覆盖了架构与训练信号的主变量;(3) 速度-精度权衡通过 patch 尺寸可调,对部署友好;(4) 基线覆盖了 CAV-MAE/AV-MAE/MAViL/EquiAV 等主要公开模型。
主要问题在于:其一,效用声明过度,EquiAV(54.6 mAP)仍显著高于 DAVSS-Medium(52.7),”outperforms existing audio-visual models”的表述与自报数据矛盾;其二,识别对比缺少等资源隔离——更细 patch 既是卖点也是混淆变量,无同参数 transformer 或等 FLOPs 对照,压缩净收益的归因不完整;其三,方法新颖性中等,属 DASS 的视听迁移加架构调优,机制层面无新贡献;其四,未发布代码与 checkpoint,可复现性打折;其五,正文”3.5x smaller”与摘要”12x smaller”两处表述未指明对应模型,易误导读者。
日报摘要
- Strength: DAVSS-Tiny 以 14.4M 参数(CAV-MAE 的约 1/12)在 AudioSet 上达到 51.6 mAP 反超 teacher CAV-MAE 的 50.5,且推理更快。
- Weakness: 缺少同规模/等 FLOPs 的 transformer 对照来隔离 patch 分辨率混淆,且 EquiAV(54.6 mAP)仍高出 DAVSS-Medium(52.7)1.9 mAP,SOTA 领先性证据不足。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
8 |
1.0 |
8.0 |
| 二 识别公理 |
⚠️ |
6 |
1.5 |
9.0 |
| 三 独立性公理 |
✅ |
8 |
1.0 |
8.0 |
| 四 压缩公理 |
✅ |
8 |
1.0 |
8.0 |
| 五 效用公理 |
⚠️ |
6 |
2.0 |
12.0 |
| 六 新颖性公理 |
⚠️ |
6 |
2.0 |
12.0 |
| 七 可复现公理 |
⚠️ |
5 |
1.0 |
5.0 |
加权总分: 6.53/10(加权分之和 62.0 / 权重之和 9.5)
最终建议: Weak Accept (6.5-8) — 压缩与效率故事扎实、消融完整,但被 EquiAV 数据戳穿的 SOTA 声明、缺失的等资源对照与未发布代码限制了上限。若作者补上同参数规模 transformer 对照并发布代码,可上调至 Accept。