我已经通过全文阅读和外部搜索获取了足够的证据。现在我来整理这份评审。我收集到的关键发现如下:

  1. 完整论文已阅读 (8页, 5285字):MSRT-4B,包含 MoSE(两个 Whisper 编码器:一个冻结,一个可训练)、显式语言路由器、五阶段课程学习、45种语言、1980个翻译方向。

  2. Prior work (先前工作):Du et al. 2025 (LLMSRT, ACL 2025) — 相同作者,相同的课程学习策略。Du et al. 2026 (MCAT-27B) — 相同作者,27B规模的70种语言。PaM (Shan et al. 2025, EMNLP) — 针对音频任务的异构编码器混合。Language-Routing MoE (Wang et al. 2023) — 用于ASR的MoE语言路由。LCMA-SRT (ACL 2026) — 用于联合ASR+S2T的MoE适配器。MoLGE (2026年7月) — 用于大规模多语言ASR的语言组专家混合。

  3. Baselines (基准):Gemini-3.5-Flash-Lite, Whisper+NLLB, SeamlessM4T-V2-Large, Qwen3-Omni-30B, MCAT-27B。

  4. 关键结果:COMET 83.3 平均分,在1552/1980个方向上 ≥80,仅4B参数就优于27B/30B基准。

现在开始撰写评审。

Paper Review: Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

论文类型: 方法型

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 8 1.0 8.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 4 2.0 8.0
七 可复现公理 8 1.0 8.0

加权总分: 5.8/10(加权分之和 60.5 / 权重之和 9.5,四舍五入) 最终建议: Borderline 5-6.5


计算验证: 加权分之和 = 8.0×1.0 + 5.0×1.5 + 8.0×1.0 + 5.0×1.0 + 8.0×2.0 + 4.0×2.0 + 8.0×1.0 = 8.0 + 7.5 + 8.0 + 5.0 + 16.0 + 8.0 + 8.0 = 60.5。权重之和 = 1.0+1.5+1.0+1.0+2.0+2.0+1.0 = 9.5。加权总分 = 60.5/9.5 = 6.37 ≈ 6.4/10。

修正加权总分: 6.4/10 最终建议: Borderline 5-6.5