Paper Review: VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

论文类型: 方法型

本文为联合视频-音频生成提出首个 omni 奖励模型 VA-Judger,配套构建了人类偏好数据集 VAPref-10K 与评测基准 VA-Judger-Bench,并设计了三阶段渐进训练(easy 冷启动 SFT、hard 人工核验 rejection sampling、维度级 GRPO)以及基于 VA-Judger 的 LTX-2 后训练。核心贡献横跨数据、方法、评测与下游 RL 应用,主体是奖励模型的建模方法与训练策略,按方法型审查。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

主要问题在于三处:其一,下游收益全部用论文自证”不可靠”的窄指标报告,而唯一独立的同步相关指标 DeSync 反而显著恶化(0.226→0.592,越高越不同步)且未被讨论;其二,out-of-domain 评测的独立性有限(500 对样本与采样流程同源、与 in-domain 仅差 2.6 个点),且 hard 对监督经过 Gemini 生成再核验,引入模型偏好偏差;其三,RL 后训练只在 LTX-2 单 policy 上验证,未做跨模型泛化,也无 inter-annotator agreement 报告。

日报摘要

打分

一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 ⚠️ 5 1.0 5.0
四 压缩公理 8 1.0 8.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 8 2.0 16.0
七 可复现公理 9 1.0 9.0

加权总分: 7.37/10(加权分之和 70.0 / 权重之和 9.5)

最终建议: Weak Accept (6.5-8) — 7.37 落在 Weak Accept 区间,需 major revision:要求(1) 用与窄指标独立的评测(如扩大人评规模并报告 tie 分布/个体差异)验证下游收益,并正面解释 DeSync 退化;(2) 公开 VAPref-10K 与维度级 GRPO 训练代码,披露 Gemini 标注协议与 inter-annotator agreement;(3) 在至少一个额外 policy(如 OVI 或 DaVinci-MagiHuman)上复现 RL 后训练以验证跨模型泛化。