Paper Review: Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding

论文类型: 方法型

本文提出 Visual Token Codec (VTC),一种双路径学习特征编解码器,用于压缩 ViT 中间层特征以支持分布式部署。核心方法贡献包括:将 global token 与 patch token 分离到不同编码路径、在 patch-token 原生 2D 网格上使用 SCCTX 熵模型、feature-matching supervision 以及 single-model variable-rate coding。


公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理


总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 9 1.0 9.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 9 1.0 9.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 6.42/10(加权分之和 64.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8

注:加权总分 6.42 略低于 Weak Accept 下界 6.5,处于 Borderline 上沿。考虑到五项任务上的显著效用提升和实际部署价值(效用公理权重最高且得分较高),以及问题对象的真实性和评测的独立性,综合判定为 Borderline 偏向 Weak Accept。主要扣分点在于方法组件的原创性不足(压缩公理和新颖性公理)以及关键消融实验的缺失(识别公理)。若作者补充 feature-matching loss 独立消融、SCCTX 子组件消融、以及与 DT-UFC 的实验对比,可明确进入 Weak Accept 区间。