Paper Review: Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

论文类型: Benchmark 型(兼方法型)

本文同时提出 ST-OmniQA benchmark(40K 全景视频 + 400K QA 对,四级能力评估)和 ST-Omni-R1 方法(FOA 语义/轨迹表征 + 课程学习 + 推理树 RL)。benchmark 是核心贡献,方法是其上的配套解决方案。按 benchmark 型标准审查,证据要求更严。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 ⚠️ 4 1.0 4.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 5.47/10(加权分之和 51.5 / 权重之和 9.5) 最终建议: Borderline (5-6.5)


核心判断:本文的 benchmark 贡献(ST-OmniQA 的任务定义、modality-necessity 约束、四级能力设计)是真实且有价值的,问题定义清晰且未被现有工作覆盖。但作为 benchmark 型论文,其证据标准未达到应有水平:关键 baseline 遗漏(SPUR、Spatial-Omni)、LLM judge 缺乏独立校验、通用模型零样本 vs 微调比较不公平、组件消融不充分。方法贡献(ST-Omni-R1)主要是已有模块的组合应用,且音频分支核心 idea 与并发工作 ST-AudioLM 高度重叠。建议作者补充 SPUR/Spatial-Omni baseline 比较、提供 judge 人类一致性校验、公开 judge prompt 和评测脚本、消融 trajectory tokens 的独立贡献。