现在我已经掌握了确凿的基准数据。关键发现如下:

  1. REAL-T (Li et al., Interspeech 2025) — 音频 TSE 的真实对话混合数据,已直接被本文引用。
  2. REAL-TSE Challenge (SLT 2026, arXiv 2607.15198) — 最新挑战赛,发表于 2026 年 7 月。
  3. C²AV-TSE (2504.00750, 2025) — 上下文/置信度感知的 AV-TSE。
  4. AV-GridNet (Pan et al., 2023) — 本论文直接引用的基准模型。
  5. AV-HuMAR (Wu et al., 2024) — AV-HuBERT + 掩码恢复策略。
  6. “Rethinking visual cues in AVSE” (2306.02625) — 探讨了视觉旁路问题。
  7. Unified AV Cues for TSE (Interspeech 2024) — 统一音视觉线索方法。
  8. PS4 (2607.08111, 2026) — 代理监督下的真实 TSE。

本文所探讨的“身份忠实度”(identity-faithfulness)问题(即视觉旁路:分离器忽略了视觉线索)在文献中已有论述,但 QIANGDA 提出在真实混合数据上进行双提示配对测试,确实是一种新颖的评估视角。

现在我已经有足够的信息来撰写评审了。让我汇总一下全文的发现:

全文关键观察:

现在我将撰写评审。

论文评审:基于 QIANGDA 和 VOXBLINK2-AVSE 的身份忠实音视频目标说话人提取

论文类型: 数据型 + Benchmark 型(数据集与 benchmark 联合论文,附带方法消融)

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

Benchmark 部分:QIANGDA 填补了 AV-TSE 缺乏真实混合 benchmark 的空白。现有 AV-TSE 评测主要使用合成混合数据(LibriMix, WSJMix),REAL-T 将真实混合引入 audio-only TSE,QIANGDA 将其扩展到 AV-TSE。benchmark 设计合理:多距离(0.5/1.5/3m)、多视角(30°/45°/60°)、场景内参考、paired identity test。但规模有限(6,038 mixtures, 11.84h)且仅覆盖 Mandarin read speech,不代表真实会议/对话场景。论文承认仅 “read Mandarin speech only, non-verbal vocalizations are excluded”。

方法部分:最佳结果 0.2261 CER 和 82.22% strict correctness 在绝对值上仍有明显差距——17.78% 的输出未能通过 strict identity test,且 this is on read speech only。论文未与外部 SOTA 直接比较。ResNet no-FiLM baseline 的 0% speaker margin 和 84.28% residual overlap 证明了 visual bypass 问题的严重性,也从侧面说明现有方法在真实混合数据上的表现远不如在合成数据上的报告结果。这个发现本身有社区价值。

VOXBLINK2-AVSE 作为训练语料的效用:766h 的 quality-filtered aligned data 是有价值的资源,但论文没有证明它比现有 AVSpeech(4700h)或 LRS3(438h)带来明确的训练增益——VoxBlink2 vs LRS3 的比较将数据质量和领域混在一起。

公理六:新颖性公理

QIANGDA benchmark:真实双人同期录音 + 多视角视频 + paired identity test 在 AV-TSE 领域是新的。REAL-T 做了 audio-only 版本,QIANGDA 是 AV 扩展。paired identity test(同一混合信号用两个视觉提示)是一个真实的新评估视角,不是已有方法的换名。✅

VOXBLINK2-AVSE:从 VoxBlink2 中 curate 训练语料并用 DNSMOS 过滤是工程贡献,但 curation 流程(audio-visual validity + DNSMOS filtering + speaker-disjoint split)是标准做法的组合,没有新的 curation 方法论。⚠️

方法:冻结 AV-HuBERT + TF-GridNet + FiLM + speaker-margin loss 是已有方法的组合,每个组件都有明确来源。AV-HuMAR 已用 AV-HuBERT 做 AV-TSE,AV-GridNet 已用 TF-GridNet 做 AV-TSE,FiLM 是标准条件化方法。本文的组合不是新的机制发明。论文未证明组件间的 synergy 超过各组件单独贡献之和。⚠️

整体新颖性主要来自 benchmark 的评估视角,方法新颖性弱。

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 8 1.0 8
四 压缩公理 ⚠️ 5 1.0 5
五 效用公理 ⚠️ 6 2.0 12
六 新颖性公理 ⚠️ 5 2.0 10
七 可复现公理 ⚠️ 5 1.0 5

加权总分: 5.5/10(加权分之和 55.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5


补充说明:论文的核心价值在于 QIANGDA benchmark 和 paired identity test 评估视角,而非方法创新。如果数据集和评测代码确实开源,且补充与外部 SOTA 的直接比较,论文价值可显著提升。当前方法的消融实验存在控制变量缺陷(最佳 checkpoint CLI 丢失、训练数据混淆、input-only vs FiLM 非受控比较),削弱了方法贡献的可信度。建议作者:(1) 确保数据和代码开源并提供 URL;(2) 重训 speaker-margin loss 的受控实验;(3) 补充与 AV-HuMAR/C²AV-TSE/AV-GridNet 的直接比较;(4) 讨论 QIANGDA 在非 Mandarin、非 read speech 场景下的可扩展性。