Paper Review: EXAM$^2$: Extending Audio Understanding in Multilingual and Multimodal Analysis

论文类型: 评测型 + 方法型(混合)

论文主体由两部分构成:一是构建 EXAM$^2$ 基准(5,667 题、22,614 视觉候选、135,684 多语言实例,覆盖 6 语言 × 4 音频域 × 视觉图像多模态),二是在该基准上用 OmniLoRA 微调 Gemma3n-E4B 得到 Gemma3n-EXAM$^2$ 并报告 +12.4–21.7% 提升。属于”先建 benchmark 再训自家模型刷自家榜”的双重贡献结构。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

优点: (1) 真正补齐了一个 6 语言 × 多模态 × 多音频域的多语言音频 MCQ 基准,规模(22,614 视觉选项 + 135,684 多语言实例)显著大于现有工作;(2) 系统性评测了闭源 + 开源 + cascaded 三类共 10+ 模型,且显式区分原始波形 vs cascaded 转录输入,揭示了”multimodal fusion 在 sound 上优于 speech”、”GPT-4o-audio > GPT-5 text-only > GPT-5.2”等结构性差距;(3) 翻译、图像生成、专家复核三个 pipeline 给出 prompt 与流程,附录完整。

主要问题在于可复现承诺与现状不符——脚注1宣告的全部公开仓库 werywjw/EXAM-2 实测 404,论文最大卖点之一的”开源”无法核实;同时评测独立性不足(生成视觉候选 + LLM 翻译 + 人工复核三阶段都依赖自身产出,且未量化语义保真度),Gemma3n-EXAM$^2$ 在自家 benchmark 上的 +21.65% 提升是循环评测的产物;方法侧 OmniLoRA 与 Gemma3n-EXAM$^2$ 都只是 LoRA + multilingual uniform sampling 的标准实现,缺少与 Phi-4-LoRA、Qwen2.5-omni-LoRA 等”同 LoRA 预算”基线的对比,且闭源 GPT-4o-audio 在所有六语言上仍领先开源模型 10 点以上,效用层面”自训开源模型能打过闭源”的 claim 难以证实。

日报摘要

打分

公理 判定 分数 权重
一 对象公理 8 1.0
二 识别公理 ⚠️ 6 1.5
三 独立性公理 4 1.0
四 压缩公理 ⚠️ 4 1.0
五 效用公理 ⚠️ 5 2.0
六 新颖性公理 ⚠️ 5 2.0
七 可复现公理 4 1.0

加权总分:(8×1.0 + 6×1.5 + 4×1.0 + 4×1.0 + 5×2.0 + 5×2.0 + 4×1.0) / 9.5 = 49/9.5 ≈ 5.16,按四舍五入取 5.2。

加权总分: 5.2/10

最终建议: Borderline 5–6.5