我已经掌握了所需的所有信息。现在我来撰写最终的结构化评审。

Paper Review: Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

论文类型: 方法型

论文提出 SpeechKV,在 Speech LLM 的中间层对语音 token 的 KV cache 进行 learned pooling 压缩,以替代 adapter 层的早期下采样。核心主张是:延迟压缩到 LLM 内部可保留全分辨率 query 和 residual stream,在加速解码的同时不损失识别性能。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 8 1.5 12.0
三 独立性公理 8 1.0 8.0
四 压缩公理 8 1.0 8.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 6 2.0 12.0
七 可复现公理 ⚠️ 6 1.0 6.0

加权总分: 7.37/10(加权分之和 70.0 / 权重之和 9.5) 最终建议: Weak Accept

核心理由:SpeechKV 在对象真实性、识别严谨性、独立性、压缩简洁性和效用上表现扎实——方法极简、ablation 清晰、R=4 时性能不降反升且实现 1.49-2x 加速。主要短板在新颖性(KV cache 压缩在文本 LLM 中已有 DynamicKV 等成熟工作,本文核心贡献是跨模态迁移 + 模态适配)和可复现性(无代码开源、私有测试集)。作为 SLT 2026 投稿,方法实用性和经验分析达到了接收门槛,但作者应补充代码开源、至少一个外部 token-reduction baseline 对比(如 FastAdaSP),并讨论 layer-wise redundancy 分析在非 Qwen3 backbone 上的可迁移性。