Paper Review: Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

论文类型: 评测型(多模态条件音视频生成安全基准)

论文属于评测型——构建覆盖全部 11 种非单元 T/I/A/V 条件组合、11,024 条攻击实例的安全基准,并用 4 个代表性安全护栏(guard)做系统性评测,提出”组合式风险感知(compositional risk perception)”这一能力缺口。

事实锚点(评分前核实)

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

优点:

  1. 覆盖完备性是真实贡献:首个把 11 种非单元 T/I/A/V 条件组合全部纳入的 AV 生成安全基准,11,024 条实例在 4 攻击机制 × 5 危害类别上分布均衡,”first”主张经 OpenAlex/GitHub 检索暂无反例。
  2. 概念框架简洁有力:e=(C, k, ρ) 的危害证据参数化把 Composed Harm 与 Diluted Harm 分开度量,实验结论随之清晰——Composed(k=0)下全模态护栏 recall 不足一半(39.2%/46.2%),Diluted 下 k=1 时 recall 最低(58.0%)、k=4 时升至 96%,”危害信号稀疏度”成为可操作的预测变量。
  3. 核心发现量化扎实:ASR 恒定在 ~90% 而 RHR 随模态数单调上升(32.8%→38.5%→40.4%),把”组合式风险感知”定位为 moderation 之后的残余风险,诊断角度有说服力。
  4. 局限性声明诚实:主动承认无图像/视频侧对抗扰动、无视频载体越狱、保守处理 5 个未配对输出、recall 不代表整体审核准确率。

缺点: 主要问题在于 (a) 基准本体(数据、标注、代码)截至评审日完全未发布,GitHub 检索 0 结果,10 月发布还附访问限制条款,短期社区效用为零;(b) guard 覆盖太窄——全模态仅 2 个模型、无任何与现成多模态安全基准的 head-to-head 对比,”组合式风险是新缺口”与”guard 普遍偏弱”两个解释未被分离;(c) 数据构建重度依赖 Claude Sonnet 4.6/GPT-5/Claude Opus 4.6 并由同族模型质检,论文未报告人工-LLM 标注一致率,真值噪声不可估计;(d) 未测 benign 误杀率,安全-可用性权衡无法校准,工程可用性打折;(e) Semantic Scholar 独立核验因 API 429 失败,引用网络与后续影响无法交叉验证。

日报摘要

打分

公理 判定 分数 权重 加权分
一 对象公理 8    
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 8    
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 8    
七 可复现公理 ⚠️ 4 1.0 4.0
合计     9.5 63.0

加权总分: 6.6/10(63.0 ÷ 9.5 ≈ 6.63)

最终建议: Weak Accept 6.5-8