我已经获取了全文并完成了研究。以下是最终的结构化审稿意见。
论文审稿:A Multi-Scale Temporal Framework with Dynamic Fusion for EEG-Based Emotion Recognition
论文类型: 方法型
本文提出了一种多尺度时间框架(多窗口分解 + 共享注意力编码器 + 动态融合),用于基于脑电(EEG)的情感识别,并在 DMER 数据集上进行了评估,包括二分类(正性/负性)和三分类(正性/负性/混合)任务,采用了受试者独立的协议。
公理审查结果
公理一:对象公理
- 判定: ⚠️
- 分数: 6
- 依据: 研究对象真实且具有临床动机:基于脑电的情感识别是一个成熟领域,而混合情感作为一种同时包含正性和负性成分的独特类别,已在心理测量学(PANAS [3]、效价-唤醒度 [4])和临床文献 [1,7,8] 中得到充分论证。受试者独立协议是最难、最具实际意义的评估设置。然而,本文未能令人信服地将多尺度时间分析与混合情感识别的具体挑战联系起来。在三分类任务中,最佳配置排除了全信号窗口,依赖于 2/5/10 秒的局部窗口——这一发现虽然有趣,但并未与混合情感中正负成分共存这一动机直接关联。核心问题“为什么多尺度时间分析对混合情感尤为必要”仍未得到解答。此外,45.43% 的三分类准确率(仅比 33.33% 的随机水平高出 12 个百分点)引发了对该方法能否真正解决其所提出目标的严重质疑。
- Wiki 证据: OMC Wiki 对“EEG emotion recognition”、“mixed emotion EEG clinical”、“multi-scale temporal attention fusion EEG”均无记录。paper-wiki 对“EEG emotion recognition”、“multi-scale temporal attention”、“dynamic fusion attention EEG”、“mixed emotion classification”均无记录。free-search 找到 DMER 数据集论文(Yang et al., Scientific Data 2024)及若干 EEG-ER 工作,确认对象真实但多尺度与混合情感的关联尚未确立。
公理二:识别公理
- 判定: ⚠️
- 分数: 5
- 依据: 本文进行了系统的内部对比:29 种窗口配置、全信号基线、单尺度与多尺度对比、拼接与动态融合对比。共享编码器设计控制了参数量变化(4.81–4.97M)。然而,不存在任何外部基线。论文未与以下基线进行比较:(a) DMER 数据集论文本身的基线 [32];(b) 标准 EEG-ER 方法,如 DGCNN [12]、EEG-Conformer [14]、微分熵+SVM [13,19];(c) 近期多尺度方法,如 miMamba [29] 或 MSGM [30];(d) 简单的频谱基线(例如,在多尺度窗口上使用 DE 特征的 SVM)。如果没有外部基线,无法判断 65.22%/45.43% 是强还是弱,也无法判断性能提升是归因于多尺度建模、注意力编码器,还是仅仅因为模型看到了同一信号的更多视角。消融实验本质上只是配置扫描,而非真正的消融实验——未测试更简单的编码器(如 CNN)是否能在相同多尺度配置下达到类似效果,也未测试简单平均池化是否能替代注意力机制。
- Wiki 证据: OMC Wiki 无“EEG emotion recognition SOTA baseline”记录。paper-wiki 查询返回空。free-search 找到 EEG-ER 评估综述(arXiv 2505.18175,216 篇论文分析)指出该领域“缺乏统一评估”,以及多个受试者独立的 EEG-ER 方法(arXiv 2403.04041, 2601.08094),本文均未引用或对比。
公理三:独立性公理
- 判定: ✅
- 分数: 8
- 依据: 评估独立性良好。DMER [32] 是一个独立发布的公共数据集(Scientific Data 2024),包含 73 名受试者,采用 PANAS 和 VAS 验证的混合情感标签。受试者级分割确保无受试者泄露。通过基于 LOSO 难度的分层分区减少膨胀,且仅用于构建平衡分割——不影响训练或模型选择。测试集仅用于最终报告。不涉及合成数据、模型生成标签或自训练循环。数据集创建者的预处理流水线(ICA、带通 1–50 Hz、陷波 50 Hz、Pz 重参考)被直接使用,未进行可能引入偏差的自定义处理。标注来自受试者自我报告,由数据集创建者独立于本文方法进行验证。
- Wiki 证据: OMC Wiki 无“DMER dataset”、“EEG evaluation independence”相关记录。free-search 确认 DMER 为独立公开数据集(Nature Scientific Data),标签通过心理测量自我报告验证。
公理四:压缩公理
- 判定: ⚠️
- 分数: 5
- 依据: 该框架结构复杂:6 层分层交叉注意力 + 自注意力编码器(维度 128→32,100 个片段状态,8/8/6/6/4/2 个注意力头),窗口特定归一化,以及带有可学习查询 + 位置嵌入的动态融合模块。这种复杂性是否合理?动态融合相对于拼接的优势微弱:二分类最佳配置提升 2.47 个百分点(65.22% vs 62.75%),三分类最佳配置仅提升 0.12 个百分点(45.43% vs 45.31%)。在所有 29 种配置中,两种策略表现“相当”,动态融合仅在与时间异质尺度结合时表现出“最大优势”。计算成本从 1.36 增至 17.88 GFLOPs(13 倍),而二分类准确率仅提升约 8 个百分点。多尺度时间分析本身并非创新——论文引用了 [29] miMamba 和 [30] MSGM 作为现有的多尺度 EEG-ER 方法。动态融合本质上是标准的注意力加权池化。该框架是现有组件(多尺度窗口化 + 共享 Transformer 编码器 + 注意力融合)的组合,缺乏明确的协同效应证明或对“为何这种特定架构优于更简单替代方案”的机制解释。
- Wiki 证据: OMC Wiki 无“multi-scale temporal attention fusion EEG”、“shared encoder dynamic fusion”记录。paper-wiki 对“multi-scale temporal attention”、“dynamic fusion attention EEG”均无记录。free-search 确认 miMamba (IEEE TAC 2025) 和 MSGM (Frontiers in Neuroscience 2026) 已提出多尺度 EEG-ER 方法。
公理五:效用公理
- 判定: ⚠️
- 分数: 4
- 依据: 绝对性能不足以令人信服。二分类:65.22%(略高于 50% 随机水平,但对于受试者独立的 EEG-ER 来说是中等水平)。三分类:45.43%(仅比 33.33% 随机水平高 12 个百分点;混合情感类别几乎无法识别)。没有外部基线来评估竞争力——不知道 DMER 上的 SOTA 是多少,也没有与数据集论文本身的基线或其他方法进行比较。相对于内部基线的提升是真实的,但并不显著:全信号 57.41% → 最佳 65.22%(+7.81 个百分点,二分类);37.24% → 45.43%(+8.19 个百分点,三分类)。最佳配置需要 13.65–16.52 GFLOPs,而全信号基线为 1.36 GFLOPs(10–12 倍计算量)。论文未能在 DMER 上展示与任何已发表方法的竞争力。EEG-ER 评估综述 (2505.18175) 强调了该领域基线比较不一致的问题;本文通过完全避免外部比较加剧了这一问题。动态融合在最具竞争力的三分类配置中的优势(0.12 个百分点)在统计上几乎不显著,尤其是在只有 13 个测试受试者的情况下。
- Wiki 证据: OMC Wiki 无“EEG emotion recognition SOTA”、“DMER baseline”记录。paper-wiki 对“EEG emotion recognition SOTA”、DMER 数据集查询均无记录。free-search 找到多篇受试者独立 EEG-ER 工作(arXiv 2403.04041, 2601.08094, 2106.03461)及 DMER 数据集论文,本文未进行任何对比。Memory-guided Prototypical Co-occurrence Learning (arXiv 2602.20530) 同样使用 DMER 进行混合情感识别,亦未引用。
公理六:新颖性公理
- 判定: ⚠️
- 分数: 4
- 依据: 各组件均非原创:(1) 多尺度时间窗口化已在 EEG-ER 中提出——miMamba [29] (IEEE TAC 2025) 使用多尺度倒置 Mamba,MSGM [30] (Frontiers in Neuroscience 2026) 使用多尺度时空图 Mamba;(2) 跨尺度的共享编码器权重是标准做法;(3) 通过注意力机制实现的动态(样本自适应)融合是标准的注意力池化,广泛用于多模态融合;(4) 基于 Transformer 的带交叉注意力的 EEG 编码器遵循 EEG-Conformer [14]。论文声称的贡献——将这些组件组合用于包含混合情感的 EEG 情感识别——属于 A+B+C 组合,缺乏明确的协同效应证明。论文确实是将其自身之前的工作 [31](ICMI 2025 的多窗口交叉注意力融合用于呼吸疼痛识别)扩展到了新的模态/任务。这种跨领域迁移本身是合理的,但创新贡献有限。动态融合在主要任务中并未显示出显著的、一致的优势,这削弱了其作为核心创新的地位。
- Wiki 证据: OMC Wiki 无“multi-scale temporal EEG prior work”、“dynamic fusion novelty”记录。paper-wiki 对“EEG emotion recognition”、“multi-scale temporal window EEG”均无记录。free-search 确认 miMamba (2507.15914/IEEE TAC 2025) 和 MSGM (2507.15914/Frontiers 2026) 为已发表的多尺度 EEG-ER 方法,CATM (Sensors 2024) 提出了跨尺度注意力 EEG 情感识别——核心多尺度+注意力理念已存在。
公理七:可复现公理
- 判定: ⚠️
- 分数: 6
- 依据: 训练细节充足:AdamW,学习率 1e-4,权重衰减 0.05,余弦调度带 20 轮热身,200 轮,batch size 32,固定随机种子 3407,开启确定性 cuDNN。数据集 DMER 公开可用。架构规格明确(6 层,维度 {128,128,96,96,64,32},S=100 个片段,注意力头调度,dropout 0.20)。表 I 报告了受试者分割。预处理完全依赖 DMER 提供的流程。然而:未提及代码发布或 GitHub 链接。无公开 checkpoint。数据增强参数虽以范围(pn~U(0.50,0.80), φ~U(1,1000), pm~U(0.50,0.80), ρ~U(0.15,0.30))说明,但确切的增强实现未验证。分层分割协议依赖于受试者级 LOSO 难度估计,其实现细节未完全明确。仅有 13 个测试受试者导致高方差——在未发布代码的情况下,完全复现特定数值结果可能具有挑战性。
- Wiki 证据: OMC Wiki 无相关记录。paper-wiki 对本论文 arxiv ID 2608.09088 查询返回“Paper 2608.09088 not found”。
日报摘要
- Strength: 在 DMER 数据集上进行了系统性的 29 种配置搜索,受试者独立评估设计严谨(分层难度平衡分割),三尺度动态融合在二分类任务上达到 65.22%(全信号基线 57.41%,+7.81pp)。
- Weakness: 无任何外部基线对比(未引用 DMER 原论文基线、DGCNN、EEG-Conformer、miMamba、MSGM 等同类方法),三分类最佳 45.43% 仅比随机水平高 12pp,动态融合相对拼接在三分类仅优 0.12pp(13 个测试受试者,统计意义存疑),多尺度+注意力+动态融合各组件均为已有方法。
总评
- 科学价值: 低 — 多尺度时间分析对混合情感识别的必要性未建立因果关系;无外部基线使得无法评估结果的科学意义;混合情感三分类准确率接近随机水平,未实质性推进该任务。
- 方法价值: 低 — 框架是已有组件(多尺度窗口化 [29,30]、共享 Transformer 编码器 [14]、注意力池化融合)的组合,动态融合的核心贡献在主任务上优势微弱(0.12pp),计算代价 10-13 倍增加换取的收益不成比例。
- 社区价值: 中 — 受试者独立协议 + 混合情感三分类设置有参考价值;29 配置的系统搜索和准确率-计算代价 trade-off 分析对后续研究者有借鉴意义;但缺少外部对比和代码发布限制了可复用性。
打分
| Axiom |
判定 |
分数 |
权重 |
加权分 |
| 一 对象公理 |
⚠️ |
6 |
1.0 |
6.0 |
| 二 识别公理 |
⚠️ |
5 |
1.5 |
7.5 |
| 三 独立性公理 |
✅ |
8 |
1.0 |
8.0 |
| 四 压缩公理 |
⚠️ |
5 |
1.0 |
5.0 |
| 五 效用公理 |
⚠️ |
4 |
2.0 |
8.0 |
| 六 新颖性公理 |
⚠️ |
4 |
2.0 |
8.0 |
| 七 可复现公理 |
⚠️ |
6 |
1.0 |
6.0 |
加权总分: 4.95/10(加权分之和 40.5 / 权重之和 9.5)
最终建议: Borderline (5-6.5)
核心改进建议(若作者修订):
- 必须加入至少 3 个外部基线:DMER 原论文基线 [32]、EEG-Conformer [14]、miMamba [29] 或 MSGM [30] 在相同 DMER split 上的结果。
- 用更简单的编码器(如 CNN)替换注意力编码器进行消融,隔离编码器 vs 多尺度的贡献。
- 在 13 个测试受试者上报告置信区间或多次随机 split 的方差,评估 0.12pp 差异的统计显著性。
- 开源代码和预训练 checkpoint。
- 将多尺度动机与混合情感的神经机制(正负成分在不同时间尺度上的表达)明确关联。