我已经收集到了所需的所有研究锚点。现在我将输出最终的结构化审查报告。


Paper Review: Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

论文类型: 方法型 + 系统型(混合)

本文提出一个 post-training 框架,将预训练双向音频-视频扩散模型(LTX2.3)转化为因果实时长流式生成器。核心涉及训练方法(mixed forcing + self forcing + DMD)、模块设计(LLM speech planner)、系统集成(bounded KV-cache + 4-step denoising),兼有方法型和系统型特征。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

日报摘要

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 ⚠️ 5 1.0 5.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 6.3/10(加权分之和 59.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8 — 因加权总分 6.3 略低于 6.5,实际落在 Borderline 5-6.5 区间。

论文在效用上表现强劲(唯一实时 native T2AV、长序列稳定),但新颖性受限于已有方法组合、独立性存在数据闭环隐患、识别公理缺少 DMD 单独消融。建议接收条件:补充 (1) DMD vs. 无 distillation self forcing 的分离消融;(2) TF/DF 混合比例消融;(3) 合成数据的独立质量评估或人类校验。