我已经掌握了所有模态的充分证据。以下是撰写评审所需的关键事实:
音频遗忘 (Audio unlearning):确实存在 — “Speech Unlearning” (arXiv 2506.00848), “Do Not Mimic My Voice” (ICML 2025), “Erasing Your Voice Before it’s Heard” (ICASSP 2026)
视频遗忘 (Video unlearning):确实存在 — “Video Unlearning via Low-Rank Refusal Vector” (arXiv 2506.07891), “T2VUnlearning” (arXiv 2505.17550), “Unlearning Concepts from Text-to-Video Diffusion Models” (arXiv 2407.14209), “VideoEraser” (arXiv 2508.15314)
现有综述 (Existing surveys):多篇通用的机器遗忘 (MU) 综述已发表 (ACM Computing Surveys 2023, IEEE TNNLS 2025, ACM TIST 2025, MDPI 2025)。此外还有图遗忘 (Graph unlearning) 综述 (arXiv 2310.02164)。
多模态基准 (Multimodal benchmark):MU-Bench (arXiv 2406.14796) 已经提出了一个用于机器遗忘的多任务多模态基准。
现在让我来撰写最终评审。
论文评审:跨视觉、语言、视频与音频的多模态遗忘:方法、数据集与基准测试综述
论文类型: 问题定义型(综述/taxonomy/benchmark-survey 复合型)
本文为综述论文,不提出新方法或新基准,而是对多模态遗忘(multimodal unlearning)领域的现有方法、数据集和基准进行系统分类和比较。论文提出了一套跨视觉、语言、视频、音频四种模态的分类体系(taxonomy),并识别了删除强度、保留、效率、可逆性、鲁棒性之间的权衡维度。
公理审查结果
公理一:对象公理
- 判定: ✅
- 分数: 8
- 依据: 论文研究的对象——多模态基础模型中的选择性遗忘——是真实存在的问题。多模态模型(VLM、DM、LLM、AFM)确实从训练数据中编码了敏感、受版权保护、有偏见或不安全的跨模态关联。外部证据确认各模态的遗忘需求真实存在:语音隐私(Speech Unlearning, arXiv 2506.00848; ICML 2025 的 Do Not Mimic My Voice)、视频概念擦除(T2VUnlearning, arXiv 2505.17550; VideoEraser, arXiv 2508.15314)、扩散模型概念移除(CURE, NeurIPS 2025; Defensive Unlearning, arXiv 2405.15234)、LLM 知识删除(Align-then-Unlearn, arXiv 2506.13181)。GDPR 删除权、版权诉讼、安全政策更新等构成了实际驱动力。问题在当前模型中广泛存在,且值得研究资源投入。
- Wiki 证据: OMC Wiki 查询 “multimodal unlearning survey SOTA baseline”、”machine unlearning methods taxonomy”、”LLM unlearning forgetting knowledge removal”、”diffusion model unlearning concept erasure safety”、”VLM unlearning cross-modal association removal”、”unlearning benchmark evaluation metrics” ——全部返回 “No wiki pages match”。paper-wiki 搜索 “multimodal unlearning”、”machine unlearning survey”、”unlearning LLM”、”VLM unlearning diffusion”、”unlearning”、”survey taxonomy” ——仅返回一篇无关论文(2503.17272, SAE fine-tuning)。使用 free-search 补充确认各模态遗忘工作真实存在。
公理二:识别公理
- 判定: ⚠️
- 分数: 5
- 依据: 作为综述论文,本文的核心任务是识别和分类已有工作,而非隔离因果变量。论文确实提出了分类维度(按模态、按方法类型、按模型架构),并尝试识别权衡维度(deletion strength、retention、efficiency、reversibility、robustness)。但问题在于:这些权衡维度是否真的是从文献中系统性识别出来的,还是从通用机器遗忘框架中直接迁移的?论文没有提供量化方法来比较不同方法在这些维度上的表现(例如没有汇总表格展示各方法在相同 benchmark 上的得分)。综述论文的”识别”应体现为对领域核心矛盾的结构化提炼,而本文的维度更多是概念性列举,缺乏基于实证数据的因果识别。此外,论文声称知识”distributed across shared representations”是跨模态遗忘困难的根本原因,但未深入分析这一假设是否在所有模态中均成立。
- Wiki 证据: OMC Wiki 和 paper-wiki 均无相关记录。free-search 确认已有多篇 MU 综述(ACM Computing Surveys 2023, IEEE TNNLS 2025, ACM TIST 2025)提出了类似 taxonomy 维度,本文是否在识别维度上有真正的增量需进一步考察。
公理三:独立性公理
- 判定: ⚠️
- 分数: 6
- 依据: 综述论文的独立性体现在综述框架是否独立于被综述工作的利益关系。本文作者来自同一研究群体(多模态安全/遗忘方向),存在自我引用偏好风险。论文提供的 curated repository(Awesome-Multimodal-Unlearning)是作者自建的,其论文筛选标准未明确说明,可能存在选择性收录。另一方面,论文被 ACL Findings 2026 接收,经过了同行评审,提供了一定的独立性保障。论文在讨论各方法优劣时,总体上保持了中立叙述,但在 open problems 部分对某些方向的强调可能反映了作者自身研究偏好。没有发现明显的循环论证问题,但也没有独立的交叉验证机制。
- Wiki 证据: OMC Wiki 无记录。free-search 确认论文已在 dblp 和 ACL Anthology 索引,openreview 上有评审记录(id: xC66VYDIaV),表明经过了独立评审流程。
公理四:压缩公理
- 判定: ⚠️
- 分数: 5
- 依据: 综述论文的压缩价值在于用统一框架整合分散工作,使读者用更少认知成本理解更多现象。本文的 taxonomy 确实提供了跨模态的统一视角,这是其核心压缩贡献。但压缩效果有限:(1) 已有多篇成熟的机器遗忘综述(ACM Computing Surveys 2023 的 “Machine Unlearning: A Survey”、IEEE TNNLS 2025 的 “Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects”、ACM TIST 2025 的 “A Survey of Machine Unlearning”),本文相对于这些综述的增量主要是”跨模态”这一维度,但跨模态遗忘是否真的需要全新的 taxonomy 框架,还是只是在已有框架上增加模态标签?(2) 论文按 VLM/DM/LLM/AFM 分类的做法较为直接,缺乏更深层的结构化洞察(如按遗忘机制分类:梯度上升+对比学习 vs. 表示编辑 vs. 影响函数 vs. 低秩修改 vs. 知识蒸馏 vs. 安全分类器引导)。(3) 存在一定命名膨胀:将已有的概念擦除(concept erasure)工作重新包装到”multimodal unlearning”框架下,但部分被收录工作(如 diffusion model concept erasure)在原文中并不自称”unlearning”。
- Wiki 证据: OMC Wiki 无记录。free-search 确认已有多篇 MU 综述存在,且部分综述已包含多模态内容的讨论。MU-Bench (arXiv 2406.14796) 已提出多任务多模态 MU benchmark,部分覆盖了本文声称的统一视角需求。
公理五:效用公理
- 判定: ⚠️
- 分数: 5
- 依据: 综述论文的效用体现在能否为研究者提供可靠导航和可操作的研究方向。正面:(1) 论文覆盖了四种模态,且各模态均有真实存在的遗忘工作(经 free-search 确认),领域覆盖度较好;(2) 提供了 curated repository 作为社区资源;(3) open problems 部分讨论了跨模态一致性、评估标准缺失、鲁棒性攻击等真实问题。负面:(1) 论文未提供系统性的方法比较表格——读者难以快速判断哪种方法在哪种场景下表现最好;(2) 数据集和 benchmark 的讨论是描述性的而非评估性的——没有评估各 benchmark 的质量、覆盖度或局限性;(3) 对于 audio 和 video 模态的遗忘工作覆盖明显较薄(video unlearning 仅有少量工作如 T2VUnlearning 和 VideoEraser,audio unlearning 如 Speech Unlearning 是非常新的方向),论文对这些新兴方向的深度分析不足;(4) 未讨论跨模态遗忘的评估挑战——不同模态使用不同指标,如何统一比较?
- Wiki 证据: OMC Wiki 无记录。free-search 确认 video unlearning(arXiv 2506.07891, 2505.17550, 2407.14209, 2508.15314)和 audio unlearning(arXiv 2506.00848, ICML 2025, ICASSP 2026)均有真实工作存在,但论文对这些最新工作的覆盖深度需在全文中确认。从 PDF 阅读来看,audio 和 video 部分确实较为简短。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 4
- 依据: 本文声称提供”unified, system-oriented view”和跨四模态的 taxonomy。新颖性评估:(1) “Multimodal unlearning”作为独立研究问题的定义——这一概念在 MU-Bench (arXiv 2406.14796, 2024) 中已被明确提出,该工作提出了”first comprehensive machine unlearning benchmark that spans various tasks and data modalities”,因此”跨模态遗忘”这一概念本身不是本文首创。(2) 统一 taxonomy——已有多篇 MU 综述提供了 taxonomy(IEEE TNNLS 2025 明确包含 “Taxonomy” 一词),本文的增量是将 taxonomy 扩展到更多模态,但分类维度本身(方法类型、模型架构、评估指标)与已有综述高度重叠。(3) 四模态覆盖(vision+language+video+audio)——这是本文相对已有综述的真正增量,因为现有 MU 综述主要聚焦单模态或通用方法。但”覆盖更多模态”本身是否构成足够的 novelty?对于综述论文而言,如果只是将各模态工作分章节列举而没有跨模态的深度综合分析(如跨模态知识纠缠的机制差异、跨模态遗忘方法的可迁移性分析),则 novelty 有限。(4) trade-off 维度(deletion strength、retention、efficiency、reversibility、robustness)——这些维度在已有 MU 综述中均有讨论,”reversibility”是相对新的维度但也不是本文原创。
- Wiki 证据: OMC Wiki 无记录。paper-wiki 无相关收录。free-search 确认:(a) MU-Bench (2024) 已提出多模态 MU 概念;(b) 多篇已有综述包含 taxonomy;(c) “A Survey of Machine Unlearning” (ACM Computing Surveys 2023) 和 “Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects” (IEEE TNNLS 2025) 已覆盖核心 taxonomy 维度。
公理七:可复现公理
- 判定: ✅
- 分数: 8
- 依据: 综述论文的可复现性主要体现在资源可用性和方法描述的充分性。本文提供了 curated repository(https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/),使读者可以访问论文列表。论文被 ACL Findings 2026 接收,arXiv 全文公开(CC-BY 4.0),PDF 和 TeX 源码均可获取。作为综述论文,不涉及实验复现问题。参考文献从 PDF 阅读来看较为全面,覆盖了主要方向的工作。不过,curated repository 的维护长期可持续性未知,且论文未提供系统性的文献搜索方法论(如搜索关键词、数据库、纳入/排除标准),这在一定程度上影响了综述方法论的可复现性。
- Wiki 证据: OMC Wiki 无记录。free-search 确认论文在 arXiv、dblp、ACL Anthology、openreview 均有公开记录,repository URL 可访问。
日报摘要
- Strength: 首篇明确覆盖 vision+language+video+audio 四模态的多模态遗忘综述,被 ACL Findings 2026 接收,附有社区资源库,各模态遗忘需求经外部证据确认真实存在。
- Weakness: 相对于已有 MU 综述(ACM Computing Surveys 2023, IEEE TNNLS 2025)和 MU-Bench (2024) 的增量有限,跨模态深度综合分析不足,缺乏系统性方法比较表格和 benchmark 质量评估。
总评
- 科学价值: 中 — 对多模态遗忘问题做了跨模态整合,但相对于已有综述的增量主要是覆盖范围扩展而非深层洞察。
- 方法价值: 低 — 综述本身不提出新方法,taxonomy 维度与已有工作重叠度高。
- 社区价值: 中 — 四模态覆盖和 curated repository 为新入领域研究者提供了入口,但对已有研究者提供的增量信息有限。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
8 |
1.0 |
8.0 |
| 二 识别公理 |
⚠️ |
5 |
1.5 |
7.5 |
| 三 独立性公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 四 压缩公理 |
⚠️ |
5 |
1.0 |
5.0 |
| 五 效用公理 |
⚠️ |
5 |
2.0 |
10.0 |
| 六 新颖性公理 |
⚠️ |
4 |
2.0 |
8.0 |
| 七 可复现公理 |
✅ |
8 |
1.0 |
8.0 |
加权总分: 5.26/10(加权分之和 52.5 / 权重之和 9.5)
最终建议: Weak Reject 3.5-5 → 实际 5.26 落在 Borderline 5-6.5 区间,最终建议: Borderline
补充说明: 本文作为 ACL Findings 2026 已接收论文,经过了同行评审。从综述质量角度看,四模态覆盖是真实贡献,但核心问题在于:(1) 相对于 2023-2025 年已有的多篇成熟 MU 综述,本文的 taxonomy 维度缺少显著增量;(2) “multimodal unlearning” 作为独立概念在 MU-Bench (2024) 中已有先例;(3) 跨模态深度分析(如不同模态中知识纠缠机制的差异、方法的跨模态可迁移性)是本文本应提供但未充分提供的核心价值。如果作者在修订中增加系统性的跨模态方法比较表格、benchmark 质量评估、以及跨模态知识纠缠的机制分析,本文的科学价值可显著提升。