Paper Review: AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

论文类型: 数据集型

AT-ADD 是挂在 ACM Multimedia 2026 Grand Challenge 上的双轨基准与挑战赛总结:Track 1 做鲁棒语音深度伪造检测,Track 2 做类型不可知的「全类型」(语音/环境声/歌声/音乐)真伪判别。核心产出是两个 HuggingFace 数据集(Track 1 共 245,655 段、Track 2 共 467,223 段)、可复现基线仓库与挑战赛排名结果的分析。论文定位属于「数据集/评测型」而非方法型:它本身不提出新的检测模型,方法贡献主要在评测协议、榜单统计分析和失败模式剖析上。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

AT-ADD 是本年度值得引用的全类型音频深伪检测基准:数据规模与类型跨度在同类中领先,评测协议封闭且清楚,最出色的部分是发布后分析——生成器级难度定位、bootstrap 榜单稳定性、语言资源分组和误差互补性分析都提供了超越「给个榜单」的证据质量。基线与获奖系统的差距(76.73→90.71、79.47→96.10)也把「鲁棒性不能靠表示规模硬堆」这一结论用数字钉死。

主要问题在于:其一,作为 challenge 总结报告,其「新」主要来自组合与规模,既有全类型基准(Xie et al. 的 SSL 全类型 + WPT)和 ESDD 2 的协议差异边界未被充分论证;其二,评测数据混入私有采集与 inhouse 合成源,第三方无法完全复现,真实语音与合成源的来源不平衡(如 KiSing 291 段)也限制了类型内统计强度;其三,基线体系以 AASIST+XLSR 为单一骨架且未做代价对比,ALLM 基线投入大而表现弱,与论文自己的结论形成反差的解释不足;其四,评测集生成器对 2026 年最新生成范式覆盖偏保守。综合七条公理,这仍是一份高质量的数据集型工作,给出「弱接收偏上」的结论。

日报摘要

打分

公理 权重 得分 加权
一 对象公理 1.0 9 9.0
二 识别公理 1.5 8 12.0
三 独立性公理 1.0 8 8.0
四 压缩公理 1.0 6 6.0
五 效用公理 2.0 9 18.0
六 新颖性公理 2.0 7 14.0
七 可复现公理 1.0 8 8.0

加权总分: 7.9/10 最终建议: Weak Accept(6.5-8 区间)