研究阶段已完成。PDF 已完整读取(1199 行,8 页,4 张图表)。paper-wiki CLI 报错(traceback,记录为失败)。free-search 找到大量 SOTA 语音 deepfake 检测工作(SONAR、SLIM NeurIPS 2024、BiCrossMamba-ST、WaveSP-Net、CtrSVDD Challenge 2024 等)。下面直接输出最终 review。


Paper Review: Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

arXiv: 2607.04154v1 Authors: Yusei Tamura, Shigekazu Ishihara, Ken Ito Categories: cs.SD, cs.AI Pages: 8 pages, 4 figures

论文类型: 方法型(兼问题定义型,Part 1 系列首篇)

论文提出一种基于 Wasserstein 距离 + 持久同调(persistent homology)+ 信息几何的语音 deepfake 检测方法,以日语五元音 moraic syllabary 为例。声称合成语音元音频谱分布比自然语音”窄”,可由此区分真假语音。这是一个新方法的原理性介绍 + 单说话人 case study,没有量化评测。


公理审查结果

公理一:对象公理

公理二:识别公理

公理三:独立性公理

公理四:压缩公理

公理五:效用公理

公理六:新颖性公理

公理七:可复现公理


总评

打分

Axiom 判定 分数 权重 加权分
一 对象公理 ⚠️ 5 1.0 5.0
二 识别公理 2 1.5 3.0
三 独立性公理 3 1.0 3.0
四 压缩公理 ⚠️ 4 1.0 4.0
五 效用公理 2 2.0 4.0
六 新颖性公理 ⚠️ 5 2.0 10.0
七 可复现公理 2 1.0 2.0

加权总分: 3.26/10(加权分之和 31.0 / 权重之和 9.5) 最终建议: Weak Reject

主要理由:(1) 零量化结果且正文数值出现”**“占位符;(2) N=1 说话人 case study 无任何 baseline 与独立性保障,”合成谱窄”可能是训练集小/合成器差的工程产物而非通用机制;(3) 不可复现;(4) 数学 machinery 复杂但无 ablation 证明必要性。作为系列 Part 1 的原理展示可接受,但作为独立科研贡献未达方法型论文的效用与识别门槛。建议作者补齐:多说话人、多合成系统、ASVspoof 风格量化指标(EER/accuracy)、最简 baseline 对比、代码与数据开源、关键数值填补。