Paper Review: AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

论文类型: Benchmark 型

(兼有问题定义型特征:明确指出当前 AV 特征评测存在”维度偏差”与”数据耦合”两个被忽视的问题。)

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 8 1.0 8.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 8 2.0 16.0
七 可复现公理 8 1.0 8.0

加权总分: 7.05/10(加权分之和 65.5 / 权重之和 9.5) 最终建议: Weak Accept(6.5–8 区间)

理由概述:解耦动机真实、reframing 干净、新颖性在特征提取器层成立、代码数据开源——构成可接受的 Interspeech benchmark 投稿。主要风险在于 baseline 覆盖偏旧(未评测 motivation 自己点名的新一代模型)、规模偏小、语义任务的”纯语义扰动”假设不严格、缺少人类感知锚点。建议作者在 camera-ready 中补测 Qwen3-Omni / MMAudio feature head、报告标注者一致性、对 0.64s 切分做敏感性分析,并明确 Gemini 3 Flash 首筛的复现替代方案。