Paper Review: EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

论文类型: 方法型

论文提出 EchoCache,一种面向 A2V(audio-driven video generation)推理加速的 training-free 缓存框架。核心方法包含三个组件:(1) 基于音频时频能量的跨模态显著性锚点(Cross-modal Saliency Anchor),用于在 latent 级别区分 active/inactive token;(2) 能量引导的 step-latent 动态缓存调度,联合 timestep 级别和 latent 级别调整更新比例;(3) 带自适应量化的内存高效缓存管理。论文在 Wan2.2-S2V 和 LongCat-Avatar 两个模型上评测,对比 TeaCache、MagCache、TaylorSeer 三个缓存 baseline。


公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理


总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 8 1.0 8.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 ⚠️ 6 2.0 12.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 8 1.0 8.0

加权总分: 6.0/10(加权分之和 60.0 / 权重之和 9.5) 最终建议: Borderline 5-6.5