我已经掌握了完整的信息。让我来整理这篇综述。我已确认的关键事实如下:

  1. 论文类型: 数据型/基准测试型 — 200小时罗马尼亚语 VSR 数据集,包含人工标注 (100h) 和伪标签 (200h)。
  2. 架构: 直接复用 MultiVSR (Prajwal 等人, ICASSP 2025) — 相同的 Transformer 编码器-解码器、相同的 VTP、相同的分词器、相同的超参数。未提出新的架构。
  3. 伪标签: 由针对罗马尼亚语微调的 Whisper-large 模型生成(相同作者之前的工作 RO-n3ws, arXiv:2603.02368)。
  4. 最佳 WER: 在 200 小时伪标签数据上,未见说话人的 WER 为 48.8%;在 100 小时人工标注数据上,WER 为 53.3%。英语 SOTA (MultiVSR) 在 LRS3 上达到约 12.8% 的 WER。
  5. AVSR 融合: 基于置信度的熵加权融合(标准方法,非新颖架构)。
  6. LRRo 迁移: 95.0% 的 Top-1 准确率(此前为 71.0%),野外场景为 72.7%(此前为 51.6%)— 但采用了不同的预处理方式并使用了强大的预训练编码器。
  7. 代码/数据: 数据集采用 CC BY-NC-SA 4.0 许可,仅共享元数据(不包含视频)。未提及代码发布。
  8. 测试集: 总共约 2 小时(1 小时未见过的说话人 + 1 小时见过的说话人)。AVSR 噪声测试仅在约 16 分钟(100 个片段)上进行。

现在我将输出完整的综述。

论文综述: VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

论文类型: 数据型 + benchmark 型

论文核心贡献是一个 200 小时的罗马尼亚语视觉语音识别(VSR)数据集(VSRo-200),其中 100 小时有人工标注,全部 200 小时有 Whisper 生成伪标签,并在此数据集上进行了监督质量、域偏移和音视觉融合的基准测试。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 5 1.5 7.5
三 独立性公理 ⚠️ 6 1.0 6.0
四 压缩公理 ⚠️ 4 1.0 4.0
五 效用公理 ⚠️ 5 2.0 10.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 5 1.0 5.0

加权总分: 5.95/10(加权分之和 50.5 / 权重之和 9.5) 最终建议: Borderline 5-6.5