我现在已经建立了全面的事实基础。让我整理一下在阅读完整 32 页 PDF 后的主要发现和先前的工作:

先前工作(通过 free-search 找到):

  1. VoxParadox (arXiv:2605.27772, 2026年5月,约早 2.5 个月) - “Do Audio LLMs Listen or Read?” — 同样的核心问题
  2. Auditing Protocol-Level Shortcuts (arXiv:2607.13477, 2026年7月,同期) - 审计 LALM 评判模型中的捷径
  3. ParaPairAudioBench (arXiv:2606.24648, 2026年6月,同期) - 副语言基准测试
  4. AudioJudge (arXiv:2507.12705, EACL 2026) - 基础性 LALM 评判工作
  5. The Judge Who Never Admits (arXiv:2602.07996, 2026年2月) - LLM 评判中的反事实式探针
  6. Hearing Between the Lines (Chandra, Miller, Saligrama — 相同作者! — EACL 2026 Findings)
  7. SpeechLLM-as-Judges (arXiv:2510.14664, ACL 2026)

现在开始撰写完整综述:


Paper Review: Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

论文类型: Benchmark/分析型

论文提出一个反事实审计框架(counterfactual audit),用于诊断音频语言模型(ALM)作为评判者(judge)时是否真正使用副语言证据(affect、prosody、timing),还是仅依赖转录文本。框架包含 native one-context judgment protocol、contrastive recoverability control,以及将每项审计分解为 perception skill 和 response-mapping skill 的诊断状态。在 Gemini、GPT 和开源音频模型上评估,发现 contrastive success 常高估 native judge 可靠性,且相似聚合精度可掩盖不同失败模式。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 ⚠️ 6 1.0 6.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 6.3/10(加权分之和 60.0 / 权重之和 9.5) 最终建议: Borderline