我已经掌握了足够的事实依据。正在综合撰写审稿意见。核心锚点如下:
现在开始撰写审稿意见。
Earnings25 是一个面向金融领域 ASR 评测的 benchmark,包含两个互补的测试集(testset-full 498h、testset-segmented 46h),提供对齐转录稿与结构化元数据(speaker roles、industry labels、call structure),并报告 Whisper 与 Parakeet-TDT 的可复现基线。论文的核心贡献是数据集/评测基准,而非新方法或新模型,因此按 benchmark 型论文的更严格标准审查。
依据: benchmark 型论文的效用标准是 scenario validity、数据来源、judge 独立性、指标可信度、baseline 覆盖度。逐项检查:
Scenario validity: ✅ 真实收益电话,真实口音分布,真实行业长尾。
数据来源: ✅ 498h S&P 500 + 46h industry-stratified,规模合理,Zenodo 公开 (CC BY 4.0)。
judge 独立性: ✅ 无 judge,WER 标准计算。
指标可信度: ⚠️ 四个 WER 变体是标准做法,但论文未报告字符错误率 (CER)、NER 错误率、speaker-attributed WER (saWER) 等金融场景关键指标——尽管论文声称 “enabling speaker-aware evaluation”,实际只报告了 aggregate WER,未提供 speaker-role 分层结果。这是声称与交付的 gap。
Baseline 覆盖度: ❌ 严重不足。仅 4 个模型配置(Whisper base/medium/large-v2 + Parakeet-0.6b-v2)。遗漏的关键 baseline:
baseline 覆盖度不足以支撑 benchmark 的 “comprehensive” 声称。一个 benchmark 如果只覆盖 4 个模型,无法为社区提供有意义的 progress 刻度。
事实错误: 论文摘要声称 Earnings-22 “approximately 160 hours”,实际为 119 hours (125 files, arXiv:2203.15591 确认)。这是 benchmark 论文中对前作的量化误述,影响可比性论证的可信度。
遗漏相关 benchmark: Open ASR Leaderboard (2510.06961, 2025-10) 在本文提交前 9 个月发布,跨 12 数据集评测 86 系统,明确包含 long-form track,且使用相同的 NeMo 标准化。论文未引用、未对比、未讨论与该 leaderboard 的关系,未说明 Earnings25 如何补充或改进该平台。SPGISpeech 2.0 (2508.05554, 2025-08) 提供多说话人 speaker-tagged 转录——与本文的 speaker-aware 评估目标直接相关,也未引用。
依据: 论文声称的新颖性有三层:(1) 规模——498h 为最大公开金融 ASR 评测集;(2) industry-balanced sampling——testset-segmented 每行业一 segment;(3) rich metadata——speaker roles + industry + call structure。
规模: SPGISpeech 测试集约 2000h(论文自述),Earnings25 的 498h 并非绝对最大。但 SPGISpeech 测试集设计为训练语料附带,非独立 benchmark,因此 Earnings25 在 “专为评测设计” 维度仍有增量。增量真实但不大。
Industry-balanced sampling: 这是论文最实质的设计贡献。Earnings-22 明确缺乏 industry balancing(论文正确指出),Earnings25 的 disproportionate stratified sampling 解决了该问题。但 stratified sampling 本身是统计学教科书方法,创新在于将其应用于金融 ASR benchmark 这一举措,属于应用创新而非方法创新。
Rich metadata: Earnings-21 有 9-sector 标签和 NER 标注;Earnings-22 有 country/accent 标签。Earnings25 新增 speaker roles 和 284-industry 分类,是真实增量。但 SPGISpeech 2.0 (2508.05554) 在 2025-08 已提供 speaker-tagged transcription,早 11 个月,削弱了 speaker metadata 的新颖性。
整体: 论文是 Earnings-21/22 系列的自然演进,增量真实但偏渐进。核心创新(industry-stratified benchmark + speaker metadata)是已有方法的合理组合,未提出新机制、新问题重构或新经验压缩。benchmark 型论文的新颖性标准应看 “是否开启了之前不可能的分析”——industry × speaker-role 二维 WER 分解确实开启了新分析维度,但论文自身未展示该分析(只报告了 aggregate WER + 单维度 industry 表),削弱了新颖性的实证支撑。
核心问题: 论文标题声称 “Comprehensive”,但 4 个 baseline 配置不足以支撑该声称。一个 benchmark 的价值部分取决于其能否为社区提供 progress 刻度——当 86 个系统已在 Open ASR Leaderboard 上被评测时,Earnings25 仅提供 4 个数据点,且未与该平台对接。论文需要补充至少 Whisper large-v3、一个 SPGISpeech-finetuned 领域适配模型、和一个 commercial API,并将 Earnings25 注册到 Open ASR Leaderboard 框架中,才能真正实现 “comprehensive” 的声称。
| Axiom | 判定 | 分数 | 权重 | 加权分 |
|---|---|---|---|---|
| 一 对象公理 | ✅ | 8 | 1.0 | 8.0 |
| 二 识别公理 | ⚠️ | 5 | 1.5 | 7.5 |
| 三 独立性公理 | ✅ | 8 | 1.0 | 8.0 |
| 四 压缩公理 | ⚠️ | 5 | 1.0 | 5.0 |
| 五 效用公理 | ⚠️ | 5 | 2.0 | 10.0 |
| 六 新颖性公理 | ⚠️ | 4 | 2.0 | 8.0 |
| 七 可复现公理 | ✅ | 8 | 1.0 | 8.0 |
加权总分: 5.47/10(加权分之和 54.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5