Paper Review: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?
论文类型: 分析型 + Benchmark 型(混合)
本文兼具分析型(发现 CoT reasoning 对 social AV-QA 无效、text-only prior 可达可比性能)和 benchmark 型(IntentBench-Prime 清洗版)双重属性。三个核心发现中,发现 1 是 benchmark 清洗,发现 2 和 3 是分析型贡献。
公理审查结果
公理一:对象公理
- 判定: ✅
- 分数: 8
- 依据: 论文研究的对象——social AV-QA 中 CoT reasoning 的有效性、benchmark 质量、以及 MLLM 对视频模态的利用程度——都是真实存在的科学问题。Social-IQ 2.0 / IntentBench 是一个被多篇工作引用的活跃 benchmark(HumanOmniV2, AffectOmni, AVATAR, MODF-SIR 等均基于此),benchmark 质量直接影响社区研究方向。论文提出的”Vanilla SFT 是否是必要 baseline”和”text-only prior 在 cleaned benchmark 中是否依然显著”都是可操作化的具体问题。论文的外延(social domain, Qwen2.5-Omni base model)与实验验证范围一致,作者在 Limitations 中明确承认仅限单一 base model 和 social domain。
- Wiki 证据: OMC Wiki 五次查询均返回空结果(”No wiki pages match”)。paper-wiki 搜索同样无结果。free-search 补充搜索确认 HumanOmniV2 (arXiv:2506.21277) 真实存在,IntentBench 在 HuggingFace 上公开,Social-IQ 2.0 是 ICCV 2023 Challenge 的正式 benchmark。free-search 还发现 AAAI 2026 已有 “Assessing Modality Bias in VideoQA Benchmarks” 和 “VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs” 等同类工作,证明 modality bias / text-only answerability 是社区公认的真实问题。
公理二:识别公理
- 判定: ✅
- 分数: 8
- 依据: 论文的实验设计严格隔离了关键变量。Vanilla SFT 与 HumanOmniV2 使用相同的基础模型(Qwen2.5-Omni-7B)、相同训练数据(OmniInstruct, Video-R1, Social-IQ 2.0 train, EMER),唯一区别是是否使用 CoT reasoning traces。这是一个干净的因果隔离实验。对于 Finding 3(caption vs video),三个条件(Vanilla SFT / Caption SFT / Question SFT)也仅改变输入模态,训练数据来源和训练设置相同。论文还在 Table 3 中使用了 HumanOmniV2 原论文报告的数字(而非复现数字)以做保守比较。复现差异被诚实报告(”slight prompting differences and FPS and maximum allowed frames settings”)。
- Wiki 证据: OMC Wiki 无记录。free-search 发现 “Look Light, Think Heavy: What Multimodal CoT Reasoning Can and Cannot Do”(ACL 2026)、”Attention-guided Fine-tuning of MLLMs Improves CoT”(arXiv:2606.01558)、”Chain-of-Thought Degrades Visual Spatial Reasoning”(arXiv:2604.16060)等近期工作,均质疑 CoT 在多模态场景的有效性,支持本文 finding 2 的因果方向。但本文是唯一在 social AV-QA 领域用相同数据/相同模型做严格隔离对比的工作。
公理三:独立性公理
- 判定: ⚠️
- 分数: 6
- 依据: 评测独立性存在两个层面的关注:(1) IntentBench-Prime 的 text-answerability 检测使用四个 LLM(Gemma-2-9B, Llama-3.1-8B, Mistral-7B, Qwen3.5-9B)的共识判定,这些 LLM 与训练模型 Qwen2.5-Omni 属于不同家族,基本独立。(2) 但 IntentBench-Prime 的 broken question 识别使用了”Claude Haiku 4.5”做 audit,同时使用了”internally finetuned social reasoning models”做辅助排序——这些内部模型基于同一 Qwen2.5-Omni 基座,与最终评测模型同源。虽然仅用于排序辅助而非最终判定(最终判定靠人工审核),但存在轻微的循环风险。(3) Caption SFT 使用 ASID-Captioner 生成 caption,ASID-Captioner 同样以 Qwen2.5-Omni 为基座,这意味着 caption 和 video-based 模型共享基础模型知识。不过这不是致命问题,因为论文的目标是对比信息提取能力而非模型知识。
- Wiki 证据: OMC Wiki 无记录。free-search 发现 “VidLBEval”(arXiv:2502.16602)和 “From Accuracy to Visual Dependence”(arXiv:2606.30220)也讨论了类似的语言偏差评测独立性问题,但未涉及 caption 生成与评测模型同源的特定关注。
公理四:压缩公理
- 判定: ✅
- 分数: 9
- 依据: 论文的核心贡献在于经验压缩,而非增加复杂度。三个发现都是用更少的假设解释更多现象:(1) Vanilla SFT 用最简训练方式(LoRA, 1 epoch, <4.5h on 4×H100)达到 SOTA,揭示 CoT 的复杂训练流水线(SFT + 两阶段 GRPO)在这个领域不必要;(2) 一个 question-independent 的通用 caption 达到与完整视频输入可比的性能,压缩了”MLLM 能从视频提取 question-specific 信息”这一假设;(3) IntentBench-Prime 以纯删除方式构建(无需重新评测),是对现有 benchmark 的最简改进。论文没有发明任何新模块、新术语或新架构,反而减少了方法复杂度。命名”Vanilla SFT”本身即为反命名膨胀——强调其平凡性。
- Wiki 证据: OMC Wiki 无记录。free-search 发现 “The Synergy Dilemma of Long-CoT SFT and RL”(TMLR 2026)讨论了 CoT SFT + RL 的复杂性问题,但未提供类似本文的”最简 baseline 即可超越”这一压缩性结论。
公理五:效用公理
- 判定: ✅
- 分数: 8
- 依据: 绝对指标和相对提升同时成立。Vanilla SFT (LoRA) 在 IntentBench-Prime (Hard) 上达 70.4% avg,超过 HumanOmniV2 (66.9%)、AVATAR (63.9%)、AffectOmni(69.9% on IntentBench 原)。在 WorldSense (48.8 vs 47.1) 和 Daily-Omni (65.2 vs 58.5) 上也超越 HumanOmniV2。计算成本方面:训练 ~11× 更便宜(18 vs ~200 GPU-h),推理延迟 6.7× 更快(1.23s vs 8.31s/question)。baseline 覆盖度合理:比较了 Qwen2.5-Omni base、HumanOmniV2、AVATAR (CVPR 2026)、AffectOmni (IEEE TAC 2026) 四个 reasoning 方法。但有两点不足:(1) Deception 类别所有方法接近随机(~60%, binary task),该类别对结论贡献有限但被计入平均值;(2) 仅用 Qwen2.5-Omni 一个基座模型,未验证 Vanilla SFT 优势是否跨模型存在。
- Wiki 证据: OMC Wiki 无记录。paper-wiki 查询 HumanOmniV2 (2506.21277) 返回 “not found”。free-search 确认 AVATAR (CVPR 2026) 和 AffectOmni (IEEE TAC 2026) 是真实发表的同期工作。未发现比 Vanilla SFT 更强的同基座同数据 reasoning 方法。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 6
- 依据: 三个发现的新颖性层次不同。(1) Benchmark 清洗(发现 1):发现 IntentBench 存在 7% broken + 23% text-answerable 问题是具体的、有量化价值的贡献,但 benchmark noise detection 在 VQA 领域并非全新概念——free-search 发现 “Assessing Modality Bias in VideoQA Benchmarks”(AAAI 2026)、”VidLBEval”(arXiv:2502.16602)、”HERBench”(CVPR 2026)等已在做类似的语言偏差审计。IntentBench-Prime 的具体清洗流程(程序化检查 + Claude Haiku audit + 人工审核)有工程价值但非方法创新。(2) Vanilla SFT 超越 CoT(发现 2):”simple baseline beats complex method”是经典的 negative result,在 CoT 质疑潮中(”Look Light, Think Heavy” ACL 2026, “Chain-of-Thought Degrades Visual Spatial Reasoning” arXiv:2604.16060, “Don’t Overthink It” arXiv:2505.17813)不算完全新颖,但本文是首个在 social AV-QA 领域以同模型同数据做严格对比的工作。(3) Caption ≈ Video(发现 3):这个发现较为新颖且反直觉——question-independent 通用 caption 达到与完整视频输入可比的性能,直接质疑 MLLM 的视频信息提取能力。综合来看,发现 3 最具新颖性,发现 2 在当前 CoT 质疑潮中属于增量贡献,发现 1 在 VQA bias 审计领域已有同类工作。
- Wiki 证据: OMC Wiki 无记录。free-search 确认多个 CoT 质疑工作在 2025-2026 年涌现,以及多个 VQA modality bias 审计工作。但未发现任何已有工作同时做这三件事(benchmark 清洗 + Vanilla SFT baseline + caption-vs-video 对比)。
公理七:可复现公理
- 判定: ✅
- 分数: 8
- 依据: 论文明确声明 “IntentBench-Prime, Vanilla SFT model, and code are publicly available”。训练细节充分:LoRA rank 16, lr 1e-4, 1 epoch, 2 FPS, 32 max frames, 4×H100 80GB, <4.5h training。评测使用三个公开 benchmark(IntentBench-Prime, WorldSense, Daily-Omni)。IntentBench-Prime 以排除列表形式发布,已有 IntentBench 结果的方法无需重新运行。不依赖闭源 API 做核心评测(Claude Haiku 仅用于辅助排序,最终判定靠人工审核)。基座模型 Qwen2.5-Omni-7B 是开源模型。caption 使用 ASID-Captioner (arXiv:2602.13013) 也是可获取的。唯一不足:HumanOmniV2 的复现数字与原文有差异(作者诚实报告了这一点并选择使用原文数字做保守比较)。
- Wiki 证据: OMC Wiki 无记录。free-search 确认 Qwen2.5-Omni 在 HuggingFace 和 GitHub 上公开可用,IntentBench 在 HuggingFace 上公开。
总评
- 科学价值: 高 — 通过严格的控制实验揭示了三个反直觉发现:CoT reasoning 在 social AV-QA 中不比 Vanilla SFT 强、cleaned benchmark 中仍有大量 text-only prior、question-independent caption 可达可比性能。这些发现对理解 MLLM 的真实视频理解能力有直接科学意义。
- 方法价值: 中 — 论文未提出新方法,但提出的 Vanilla SFT baseline 对社区有方法论价值——它为未来的 fine-tuning 方法设立了必要对照组。
- 社区价值: 高 — IntentBench-Prime 的发布(以排除列表形式,无需重跑)、对 HumanOmniV2/AffectOmni/AVATAR 等流行方法的重新审视、以及对 Vanilla SFT 作为必备 baseline 的倡导,直接影响该领域后续研究的评测标准。
本文的最大贡献是诊断性的:它揭示了一个活跃子领域(social AV-QA with CoT reasoning)可能在错误的假设上构建——CoT 并不比简单 SFT 更有效,而且 MLLM 可能并未真正利用视频信息。这种”皇帝的新衣”式的贡献在当前 ML 社区中尤为珍贵。主要局限是仅用单一基座模型(Qwen2.5-Omni-7B),限制了结论的泛化性;以及 benchmark 清洗和 caption 生成环节存在轻微的同源循环风险。
日报摘要
- Strength: Vanilla SFT (LoRA, <4.5h training) 在三个 benchmark 上超越 HumanOmniV2 等 CoT reasoning 方法,推理延迟快 6.7×,训练成本低 11×;且 question-independent caption 达到与完整视频输入可比的性能(68.6% vs 69.5%),直接质疑 MLLM 的视频信息提取能力。
- Weakness: 所有实验仅基于单一基座模型 Qwen2.5-Omni-7B,结论泛化性受限;IntentBench-Prime 清洗和 Caption SFT 均使用同源模型(Qwen2.5-Omni 系列),存在轻微循环依赖。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
✅ |
8 |
1.0 |
8.0 |
| 二 识别公理 |
✅ |
8 |
1.5 |
12.0 |
| 三 独立性公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 四 压缩公理 |
✅ |
9 |
1.0 |
9.0 |
| 五 效用公理 |
✅ |
8 |
2.0 |
16.0 |
| 六 新颖性公理 |
⚠️ |
6 |
2.0 |
12.0 |
| 七 可复现公理 |
✅ |
8 |
1.0 |
8.0 |
加权总分: 7.1/10(加权分之和 71.0 / 权重之和 9.5)
最终建议: Weak Accept (6.5-8)