Paper Review: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

论文类型: 分析型 + Benchmark 型(混合)

本文兼具分析型(发现 CoT reasoning 对 social AV-QA 无效、text-only prior 可达可比性能)和 benchmark 型(IntentBench-Prime 清洗版)双重属性。三个核心发现中,发现 1 是 benchmark 清洗,发现 2 和 3 是分析型贡献。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

本文的最大贡献是诊断性的:它揭示了一个活跃子领域(social AV-QA with CoT reasoning)可能在错误的假设上构建——CoT 并不比简单 SFT 更有效,而且 MLLM 可能并未真正利用视频信息。这种”皇帝的新衣”式的贡献在当前 ML 社区中尤为珍贵。主要局限是仅用单一基座模型(Qwen2.5-Omni-7B),限制了结论的泛化性;以及 benchmark 清洗和 caption 生成环节存在轻微的同源循环风险。

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 9 1.0 9.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 8 1.0 8.0

加权总分: 7.1/10(加权分之和 71.0 / 权重之和 9.5) 最终建议: Weak Accept (6.5-8)