我现在已经掌握了所有必要的信息。让我整理一下研究中的关键事实:

收集到的关键事实:

  1. 论文: CoFi-Lite,12.87M MACs/s,83.12k 参数。双路径(粗粒度全频段 + 细粒度低频段),CPF 模块。使用 DNS3 + DiDiSpeech 数据集,在 DNS3 模拟数据和 DNS 2020 测试集上进行评估。指标:PESQ, ESTOI, SI-SNR, DNSMOS P.808/P.835。
  2. 基线: GTCRN (ICASSP 2024), LiSenNet (ICASSP 2025), UL-UNAS (TASLP 2026, 来自同一实验室), AdaptCRN (TASLP 2025, 来自同一实验室)。所有 4 个基线均被正确引用和比较。
  3. 先验工作: “First coarse, fine afterward” (Dang et al., Speech Communication 2023) — 级联两阶段粗-细方法。FullSubNet (ICASSP 2021) — 全频段+子频段融合。两者均被引用并讨论。论文声称其贡献在于并行(而非级联)+ CPF 交互。
  4. 消融实验: ID1-5 测试单路径 vs 双路径 vs +CPF。ID6-9 测试压缩比。ID10-12 测试截止频率。CPF 带来 +0.14 PESQ 提升(ID3→ID5),+0.10 PESQ 提升对比参数匹配的 ID4。
  5. 同实验室重叠: UL-UNAS 和 AdaptCRN 均来自同一个 Nanjing University/Horizon 实验室(部分作者重叠)。这是一个值得注意的潜在偏见问题。
  6. 代码/演示: 提供了演示页面。未明确提及代码发布,但基线模型使用了原始代码库重新训练。
  7. Wiki 查询: 所有 OMC wiki 查询均返回空结果。Paper-wiki 没有语音增强模型。所有事实锚点均通过 free-search 建立。

Paper Review: CoFi-Lite: Pushing the Limits of Ultra-Lightweight Speech Enhancement

论文类型: 方法型

本文提出一种超轻量语音增强架构 CoFi-Lite,通过将谱建模解耦为粗粒度(全频段包络)和细粒度(低频段细节)双路径并行处理,并引入 Cross-Path Fusion (CPF) 模块进行跨路径特征交互,在 12.87M MACs/s 和 83.12k 参数的极低计算量下超越基线 GTCRN。

公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理

总评

日报摘要

打分

Axiom 判定 分数 权重 加权分
一 对象公理 8 1.0 8.0
二 识别公理 ⚠️ 6 1.5 9.0
三 独立性公理 ⚠️ 5 1.0 5.0
四 压缩公理 ⚠️ 5 1.0 5.0
五 效用公理 8 2.0 16.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 7 1.0 7.0

加权总分: 6.32/10(加权分之和 60.0 / 权重之和 9.5) 最终建议: Weak Accept 6.5-8