Paper Review: DAVSS: Distilled Audio-Visual State Space Models

论文类型: 方法型

本文把 Transformer→SSM 知识蒸馏框架(DASS)扩展到多模态视听设置,提出 DAVSS(Distilled Audio-visual State-Space)模型。核心贡献有三:以 CAV-MAE 为 teacher 蒸馏出 14/47/84M 三种规模的 SSM student;用更细 patch(更长的输入序列)补偿小模型容量;把联合建模参数占比从 CAV-MAE 的 <5% 提高到 30%。评测任务是 AudioSet(mAP)与 VGGSound(accuracy)上的视听音频事件分类。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

优点:(1) 压缩证据扎实,14M 参数的 DAVSS-Tiny 在 AudioSet 反超 165M 的 CAV-MAE teacher,参数效率故事清晰;(2) 消融完整,Table 1(融合深度 2/3/4 → 49.6/50.6/50.0)、Table 2(初始化+KD 的 28.2→52.2 分解)、Table 3(更强 teacher 的增益)三组实验覆盖了架构与训练信号的主变量;(3) 速度-精度权衡通过 patch 尺寸可调,对部署友好;(4) 基线覆盖了 CAV-MAE/AV-MAE/MAViL/EquiAV 等主要公开模型。

主要问题在于:其一,效用声明过度,EquiAV(54.6 mAP)仍显著高于 DAVSS-Medium(52.7),”outperforms existing audio-visual models”的表述与自报数据矛盾;其二,识别对比缺少等资源隔离——更细 patch 既是卖点也是混淆变量,无同参数 transformer 或等 FLOPs 对照,压缩净收益的归因不完整;其三,方法新颖性中等,属 DASS 的视听迁移加架构调优,机制层面无新贡献;其四,未发布代码与 checkpoint,可复现性打折;其五,正文”3.5x smaller”与摘要”12x smaller”两处表述未指明对应模型,易误导读者。

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 8 1.0 8.0
四 压缩公理 8 1.0 8.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 6.53/10(加权分之和 62.0 / 权重之和 9.5) 最终建议: Weak Accept (6.5-8) — 压缩与效率故事扎实、消融完整,但被 EquiAV 数据戳穿的 SOTA 声明、缺失的等资源对照与未发布代码限制了上限。若作者补上同参数规模 transformer 对照并发布代码,可上调至 Accept。