我已经掌握了足够的事实依据。正在综合撰写审稿意见。核心锚点如下:

  1. Earnings-21 (2104.11348): 39 小时,9 个行业,NER 聚焦,fstalign 工具。已通过 free-search 确认。
  2. Earnings-22 (2203.15591): 119 小时(125 个文件),全球化,口音聚焦,IWER 分析。论文摘要声称“约 160 小时”——这是论文中的一处事实错误(夸大了约 34%)。
  3. SPGISpeech (2104.02014): 5,000 小时训练语料库;SPGISpeech 2.0 (2508.05554, 2025 年 8 月): 多说话人、说话人标记的转录——这是一项未被论文引用的密切相关的同期工作(在 2 个月内,属于同期工作,但论文日期为 2026 年 7 月,因此 SPGISpeech 2.0 应该被引用)。
  4. Open ASR Leaderboard (2510.06961, 2025 年 10 月): 跨 12 个数据集的 86 个系统,标准化的 WER/RTFx,明确的长格式音轨。未被引用;这是相关的基准测试基础设施。论文日期为 2026 年 7 月,因此应该引用此项。
  5. Parakeet-TDT: Xu 等人,PMLR 2023 — 论文中引用正确。
  6. Contextual Earnings-22 (2604.07354, 2026 年 3 月): 具有自定义词汇表的相关同期工作——未被引用,但在 4 个月内,属于相关工作。
  7. Whisper (2212.04356): 已在 paper-wiki 中确认。

现在开始撰写审稿意见。

Paper Review: Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

论文类型: benchmark 型

Earnings25 是一个面向金融领域 ASR 评测的 benchmark,包含两个互补的测试集(testset-full 498h、testset-segmented 46h),提供对齐转录稿与结构化元数据(speaker roles、industry labels、call structure),并报告 Whisper 与 Parakeet-TDT 的可复现基线。论文的核心贡献是数据集/评测基准,而非新方法或新模型,因此按 benchmark 型论文的更严格标准审查。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

核心问题: 论文标题声称 “Comprehensive”,但 4 个 baseline 配置不足以支撑该声称。一个 benchmark 的价值部分取决于其能否为社区提供 progress 刻度——当 86 个系统已在 Open ASR Leaderboard 上被评测时,Earnings25 仅提供 4 个数据点,且未与该平台对接。论文需要补充至少 Whisper large-v3、一个 SPGISpeech-finetuned 领域适配模型、和一个 commercial API,并将 Earnings25 注册到 Open ASR Leaderboard 框架中,才能真正实现 “comprehensive” 的声称。

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 8 1.0 8.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 ⚠️ 5 2.0 10.0
六 新颖性公理 ⚠️ 4 2.0 8.0
七 可复现公理 8 1.0 8.0

加权总分: 5.47/10(加权分之和 54.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5