我已经掌握了所有模态的充分证据。以下是撰写评审所需的关键事实:

音频遗忘 (Audio unlearning):确实存在 — “Speech Unlearning” (arXiv 2506.00848), “Do Not Mimic My Voice” (ICML 2025), “Erasing Your Voice Before it’s Heard” (ICASSP 2026)

视频遗忘 (Video unlearning):确实存在 — “Video Unlearning via Low-Rank Refusal Vector” (arXiv 2506.07891), “T2VUnlearning” (arXiv 2505.17550), “Unlearning Concepts from Text-to-Video Diffusion Models” (arXiv 2407.14209), “VideoEraser” (arXiv 2508.15314)

现有综述 (Existing surveys):多篇通用的机器遗忘 (MU) 综述已发表 (ACM Computing Surveys 2023, IEEE TNNLS 2025, ACM TIST 2025, MDPI 2025)。此外还有图遗忘 (Graph unlearning) 综述 (arXiv 2310.02164)。

多模态基准 (Multimodal benchmark):MU-Bench (arXiv 2406.14796) 已经提出了一个用于机器遗忘的多任务多模态基准。

现在让我来撰写最终评审。

论文评审:跨视觉、语言、视频与音频的多模态遗忘:方法、数据集与基准测试综述

论文类型: 问题定义型(综述/taxonomy/benchmark-survey 复合型)

本文为综述论文,不提出新方法或新基准,而是对多模态遗忘(multimodal unlearning)领域的现有方法、数据集和基准进行系统分类和比较。论文提出了一套跨视觉、语言、视频、音频四种模态的分类体系(taxonomy),并识别了删除强度、保留、效率、可逆性、鲁棒性之间的权衡维度。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 ⚠️ 5 2.0 10.0
六 新颖性公理 ⚠️ 4 2.0 8.0
七 可复现公理 8 1.0 8.0

加权总分: 5.26/10(加权分之和 52.5 / 权重之和 9.5) 最终建议: Weak Reject 3.5-5 → 实际 5.26 落在 Borderline 5-6.5 区间,最终建议: Borderline


补充说明: 本文作为 ACL Findings 2026 已接收论文,经过了同行评审。从综述质量角度看,四模态覆盖是真实贡献,但核心问题在于:(1) 相对于 2023-2025 年已有的多篇成熟 MU 综述,本文的 taxonomy 维度缺少显著增量;(2) “multimodal unlearning” 作为独立概念在 MU-Bench (2024) 中已有先例;(3) 跨模态深度分析(如不同模态中知识纠缠机制的差异、方法的跨模态可迁移性)是本文本应提供但未充分提供的核心价值。如果作者在修订中增加系统性的跨模态方法比较表格、benchmark 质量评估、以及跨模态知识纠缠的机制分析,本文的科学价值可显著提升。