Sitemap

A list of all the posts and pages found on the site. For you robots out there, there is an XML version available for digesting as well.

Pages

每日论文

每日 arXiv 音频/语音/音乐/声学论文 — 按评分排序

Posts

paper_reviews

What’s a Credit Worth? A Market Framework for Attribution-Aware Compensation in Generative Music

Published:

我现在已经掌握了充分的事实依据。我找到了关键的先前研究 —— Deng 等人 2023 年的 “Computational Copyright” (arXiv:2312.06646),这是由同一团队(Deng、Jiang、Donahue、Ma)完成的最直接的先前研究,此外还有 Choi 等人 2025 年关于通过 unlearning 进行音乐归因的研究,以及 Barnett 等人 2024 年的研究。我还发现了 “ARIA: A Diagnostic Framework for Music Training Data Attribution” 和 “Attribution-by-design” 的相关研究。OMC wiki 没有返回任何相关结果,paper-wiki 中也没有归因与补偿相关的条目。我现在已经有足够的信息来撰写评审了。

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

Published:

已建立充分的事实锚点。层级分类头(GC、LCL)是标准技术(HiClass 库,Ding 等人 2023 — 论文中已引用)。KNN 蒸馏(Kong 等人 2020,Yang 等人 2022 — 均已引用)。CLAP 是基础。BST/BSD10k 是官方数据集。DCASE 2026 挑战赛排行榜确实存在。该论文是一篇挑战赛技术报告(5 页,DCASE 格式)。现在我已经有足够的信息来撰写审稿意见了。

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

Published:

关键事实:OmniVoice (2026年4月1日,早于 DELTA-TTS 2026年7月5日约3个月) 使用了“diffusion language model-style discrete NAR”架构,并采用“从预训练 LLM 初始化”——这很接近,但并非明确意义上的 AR-to-dLLM 转换。这是并发相关工作,并非严格的先验工作,但在时间线上非常接近(刚好在2个月的宽限期之外,因此可以视为相关工作,而非并发工作)。DELTA-TTS 的核心创新点——“AR-to-dLLM 转换”、基于置信度排序的解码以及用于语音的 Conformer 卷积——依然具有其独特性。

Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

Published:

研究阶段已完成。PDF 已完整读取(1199 行,8 页,4 张图表)。paper-wiki CLI 报错(traceback,记录为失败)。free-search 找到大量 SOTA 语音 deepfake 检测工作(SONAR、SLIM NeurIPS 2024、BiCrossMamba-ST、WaveSP-Net、CtrSVDD Challenge 2024 等)。下面直接输出最终 review。

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

Published:

事实锚点已足够。关键发现:

  • UniCaCLF (arXiv 2506.08493, 2025年6月) — 最近的 SOTA 基线,已确认
  • AV-Deepfake1M++ (arXiv 2507.20579, 2025年7月) — 一个更新的基准数据集,可能未被本文采用
  • DiMoDif (2411.10193), UMMAFormer (2308.14395) — 均为真实且被引用的基线
  • paper-wiki 中没有关于 AV-TFL 的记录;不存在与 skip-scan 等同的先前研究
  • UniSkip-Mamba 是通过 “skip scanning mamba deepfake frequency-aware” 搜索得到的唯一匹配结果(确认了其新颖性声明)

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

Published:

根据搜索结果,我已掌握了关键事实:AudioCaps SOTA CIDEr 约为 91.1(来自 LAMB),SLAM-AAC 是近期强劲的基准模型。CARD 仅达到 55.4,而基于编码器的基准模型为 66.4 —— 这虽然存在显著差距,但消融实验清晰地支持了核心论点。AuRA (arXiv 2606.11033, 2026年6月9日) 是被明确指出为同期工作的相关工作。我已掌握了足够的信息来撰写评审。

Semantic Homogenization in Italian Popular Music: A Diachronic Analysis

Published:

我已经获取了论文全文并进行了基础研究。OMC Wiki 中没有关于这些主题的记录。Paper-wiki 中也没有匹配项。Free-search 找到了关键的相关工作:Parada-Cabaleiro et al. (2024) 在《Scientific Reports》上发表的论文是主要的英语语言先行研究,而 Kim & Akama (2024) 的论文则涉及歌词相似性感知。现在我将撰写完整的评审。

Towards Robust Uncertainty-Aware Speaker Modeling

Published:

我已有足够的事实依据。关键锚点:

  • U3-xi (arXiv 2601.15719, Li & Lee, 2026 年 1 月) 是其直接前置工作/强基线 —— UAAM-Softmax 仅使用说话人间的可分性。
  • Xi+ (arXiv 2509.05993) 是更早的不确定性监督研究(ICASSP 2026)。
  • Wang 等人 (ICASSP 2023, 2302.11763) 和基于不确定性的余弦评分 (2403.06404) 是关键先驱。
  • ECAPA-TDNN、WeSpeaker、CAM++、SphereFace2、AM-Softmax 均为既定标准基线 —— 均在论文中作为基线使用。
  • 针对 SRE 的基于不确定性的领域适配此前尚未有人探索;特征级 DA (CORAL/MMD/DANN) 是标准做法。
  • 该论文的 ECAPA512 基线 EER 在 Vox1-O 上约为 1.07%,在 CNCeleb 上为 15.3% —— 这些数字是合理的。

Unified Audio Intelligence Without Regressing on Text Intelligence

Published:

好的,我已经整理好事实锚点。关键发现如下:

  • UALM (Tian et al., 2026) 是由同一团队(NVIDIA)发表的先前工作,也是 Audex 明确承认并在此基础上构建的基础。
  • Qwen3-Omni 声称实现了“无退化”,但 Audex 的论文对其提出了反驳,指出在推理基准测试中存在明显的退化。
  • Nemotron-Cascade-2 (Yang et al., 2026) 是基础 LLM 主干,这是一篇真实的 NVIDIA 论文 (arXiv:2603.19220)。
  • 模型检查点已在 HuggingFace 上发布。

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

Published:

我已掌握了充分的信息。论文全文已阅读(8页),相关的过往工作已通过 free-search 识别(包括 Whisper 幻觉、In-Sync 并行工作、WhisperXCrisperWhisperLwF、持续学习 ASR)。paper-wiki 索引了 ASR/Whisper 相关的论文,但没有直接匹配“时间戳漂移”(timestamp drift)的内容。现在我将直接输出最终的结构化评审报告。

InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective

Published:

我现在已经掌握了完整的信息。让我整理一下最终的审稿意见。我已经:

  • 阅读了完整的论文文本(1431 行,从摘要到参考文献)
  • 通过 wiki_query 查询了 OMC Wiki(3 次查询,全部返回空)
  • 查询了 paper-wiki(3 次查询,全部返回空)
  • 使用 free-search 查找了前期工作(4 次查询,获得了有效结果)

Breaking the Quality–Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

Published:

我现在已经掌握了充足的事实依据。关键发现:StarTSE (arXiv 2604.19635) 被确认为基础模型,而 MeanFlow-TSE (Interspeech 2026)、FlowTSE (Interspeech 2025)、TargetVoice (Interspeech 2025) 以及 Discriminative-Generative TSE (arXiv 2601.06006) 是相关的最新 TSE 工作。关于语音的 DPO:已存在针对 TTS 的 MPO、DiffRO、Preference Alignment 等方法。WavLM 用于说话人验证是标准做法。我已经获取了全文及所有附录表格。现在我将输出最终评审。

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

Published:

INFP 使用的是 DyConv 数据集,而不是 DualTalk 数据集。这很重要——INFP 是一个相关并行工作,但使用了不同的数据集。Learn2Chat 在 DualTalk 上对其进行比较可能不公平,但 INFP 在二元对话头部生成领域是一个知名的 CVPR 2025 方法,应该被引用并在相关工作中讨论。

Semantic Sampling via Learnable Observation Front Ends

Published:

我已从全文、维基查询(全部无结果)、paper-wiki 查询(全部无结果)以及 free-search(已获取关于基线、可学习前端和压缩感知的相关工作)中收集了所有信息。以下是完整的结构化评审。

Qwen-Music Technical Report

Published:

我现在已经从全文阅读和外部搜索中获得了足够的事实依据。让我来整理最终的评审意见。

Qwen-Audio-VAE Technical Report

Published:

我已完整阅读了这篇 15 页的 PDF 文件,并执行了所有必要的 wiki/paper-wiki/free-search 查询。现在开始输出结构化的评审意见。

Synchronized Three-Dimensional Vocal-Tract Motion for Speech Synchronization via Joint-Embedding Predictive Architecture Alignment

Published:

太棒了——我找到了一个非常相关的前置工作:“ArtNet: A JEPA-Like Articulatory Predictive Framework for Robust Zero-Shot Phoneme Recognition” (arXiv:2606.16595),这是一个将 JEPA 应用于发音语音学的同期工作。我现在已经从全文和外部搜索中获得了足够的事实锚点。让我来撰写最终的评审。

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

Published:

已确认:Vasilakis et al. (arXiv 2601.13931, 2026年1月) 这篇论文未被引用——该研究探讨了音乐 CLAP 模型中的否定建模,提出了基于不相似性的对比损失(contrastive loss)和文本增强(text augmentation)方法,并设计了检索和分类评估协议。这是一项直接的前序工作,比当前论文早了 6 个月,文中提到“扩展到其他领域,如语音内容和音乐属性,是未来工作的重要方向”——然而 Vasilakis 已经完成了音乐领域的研究。这是一个重大的遗漏。

From Prediction to Collaboration: Interactive Symbolic Music Analysis

Published:

我已经掌握了完整的事实依据。论文全文已阅读(通过 pdftotext 获取 8 页文本),所有 OMC wiki 查询均未返回结果,paper-wiki 中没有相关记录,已使用 free-search 补充了外部 SOTA 锚点。正在输出最终评审。

SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models

Published:

关键发现已确认。该论文引用了 [7] = STRIP (Gao et al. 2019, ACSAC),但并未引用 STRIP-ViTA (arXiv 1911.10312, 同一作者,同年度 2019),该文献明确将 STRIP 应用于 Speech Commands Dataset 的音频任务,使用了 1D-CNN 和 2D-CNN,并报告了音频任务的 FAR 结果。这是一个重大的遗漏基线。

Natural Backdoor Attacks on Speech Recognition Models

Published:

我已阅读全文(10 页,LNCS 会议论文,最初发表于 2023 年,于 2026 年 7 月重新发布至 arXiv),并收集了 wiki/paper-wiki/free-search 的证据。OMC Wiki 没有返回任何结果;paper-wiki 没有关于此主题的具体匹配信息。Free-search 找到了相关的先前和同期工作。以下是评审结果。

Falsification-Based Verification of LLM-Generated Optimization Models: Sound Test Batteries and Their Detection Limits

Published:

我现在已经掌握了所有必要的事实依据。ReLoop (Lian et al., 2026, arXiv:2602.15983) 是最接近的现有工作,发表于 2026 年 2 月,本文发表于 2026 年 7 月——时间跨度约为 5 个月,因此它不属于同期工作,构成了合理的创新性比较。我已经阅读了完整的 PDF(32 页)和完整的 HTML 全文(81KB 纯文本)。我已具备输出审稿所需的一切材料。

AI_LectureNote: A Retrospective Pilot Study of a Post-ASR Workflow for English-Script Rendering and Semantic Drift in Korean-English Medical Lectures

Published:

我已获取全文并进行了事实核查。论文的 Related Work 中引用了几个关键锚点(Ma et al. 2023 LLM post-ASR correction, Adedeji et al. 2024/2025 medical ASR+LLM, Sudo et al. 2024 contextual biasing, Chapman et al. 2001 negation, Zheng et al. 2026 dysarthric post-ASR)。Wiki 记录为空;free-search 确认了该领域已有先前研究。现在我将输出最终评审。

FillGauss: Fine-Grained Filling-Aware Impact Sound Generation for 3D Gaussian Splatting

Published:

我已经掌握了足够的事实依据。已确认的关键基准如下:

  • SonicGauss (arXiv:2507.19835, 2025年7月26日) — 最新的三维感知撞击声 SOTA,发表于 ACM MM 2025。这是本文的基础工作。
  • Physics-Driven Diffusion Models (Su et al., CVPR 2023) — 撞击声扩散领域的重要先驱工作。
  • RealImpact (Clarke et al., CVPR 2023) — 真实世界撞击声数据集。
  • TangoFlux — 文本到音频生成模型。

SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark

Published:

我已有足够的依据。EMOE (CVPR 2025) 是一个强有力且近期的基线模型,文中已包含。论文中引用的五个基线模型(MulT, MISA, EmotionCLIP, TCL-MAP, EMOE)均为已发表的模型。研究阶段结束,现在开始撰写审稿意见。

Audio Cross Verification Using Dual Alignment Likelihood Ratio Test

Published:

我现在有足够的信息来撰写评论了。论文中的所有组件(MFCC、DTW/HSTW、Shazam 风格的 fingerprinting、LRT)都是现有的技术。关键的先前研究是同一作者于 2020 年发表的 arXiv:2010.12173 (Shan & Tsai),它提出了相同的“音频交叉验证”问题框架,并提出了 SNWTW + BiLSTM。当前的 DA-LRT 是一种无需学习的后续研究。

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

Published:

我已经获取了完整的论文文本(5页,33364字符)以及知识库查询结果。OMC Wiki 中没有关于音频语言模型、DCASE 或文本捷径基准测试的条目。Paper-wiki 中仅包含 MOSS-Audio (2606.01802);关键引用文献 AudioMCQ/2509.21060、MMAU/2410.19168 未被收录。我将继续进行评审。

Black-Box Optimization for Identifying and Inverting Audio Dynamic Range Control Effects

Published:

我已收集到足够的事实锚点。关键发现:

  1. DeepAFx (Ramírez et al., ICASSP 2021) — 已有 black-box audio effect 优化(SPSA),是本文最直接的前置工作
  2. arXiv 2504.04751 — “Unsupervised Estimation of Nonlinear Audio Effects” — diffusion-based blind system identification,是同期/近期同类工作
  3. arXiv 2411.04337 — 作者自己之前的工作(MEE),是本文的直接前作
  4. CleanUMamba — 语音去噪模型,不是 audio effect inversion 的自然 baseline
  5. OMC Wiki 和 paper-wiki 均无该领域记录

Ultra-Compact CNN Architectures for Tropical Bird Audio Detection on Microcontrollers

Published:

很好。我已经阅读了完整论文并进行了所有研究查询。OMC Wiki 中没有匹配的页面,paper-wiki 中没有相关记录,但 free-search 返回了有用的结果。我发现了以下内容:

  • TinyChirp (Huang et al. 2024) — 基准模型,真实且已确认
  • Benhamadi et al. 2026 — AudioMoth 能量模型,Goertzel 基准
  • SEABAD (Zabidi et al. 2026) — 同一作者的配套数据集
  • BioDCASE 2025,BirdNET,BirdVoxDetect — 相关工作已确认
  • GitHub 仓库存在 (mun3im/seabadnet, mun3im/drongonet)

VibeVoice-ASR-BitNet Technical Report

Published:

我已阅读完整的 arXiv HTML 全文(174KB,涵盖所有章节:引言、方法、实验、结论、局限性、参考文献),查询了 OMC wiki(3次查询,均无结果),paper-wiki(概念搜索 + 4篇论文搜索,基础论文无直接命中),并使用 free-search 作为补充(BitNet b1.58 = 2402.17764,VibeVoice-ASR = 2601.18184,BitNet.cpp = 2410.16144 — 均来自同一 Microsoft 团队)。现在输出评审意见。

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

Published:

我已经从全文(HTML,已提取 67K 字符)和 paper-wiki 的事实锚点中获得了足够的材料。OMC Wiki 中没有相关记录(记录了所有查询的失败)。paper-wiki 确认 X-OPD (2603.24596) 是作者团队之前的直接前身工作——相同的作者重叠(Cao, Fu, Jin),这使得 X3-OPD 成为具有扩展数据覆盖范围的后继工作。现在我将输出最终的结构化审查报告。

MemNMF: Memory-Augmented NMF on LPC Spectra for Anomalous Sound Detection

Published:

我已经完成了所有必要的研究。我已经获取了论文全文,并确认了以下信息:

  • 论文类型:方法型 (AE-based ASD with LPC + NMF memory)
  • 先前研究:Gong et al. ICCV 2019 (memorizing normality), NMF-based ASD (PHMAP 2017), 基于记忆的 ASD (DCASE 2024 tech report, OpenReview PeV5LKMrxb)
  • 基线模型:AE [5], AE-IDNN [6], ANP-IDNN [9], PAE [10], AudDSR [11], VAE/GRLNet [23]
  • 数据集:MIMII, DCASE 2020 Task 2

Singlish, Can or Not? Fine-Tuning and Evaluating Zero-Shot TTS for Singapore English

Published:

我现在掌握了所有关键研究发现。最关键的发现如下:

  1. AccentBox (ICASSP 2025) - 针对零样本(zero-shot)口音生成的现有工作,论文引用了该工作但未将其作为基线进行比较
  2. 两篇 NTU 学位论文探讨了新加坡英语零样本 TTS 及 Singlish 神经语音合成——这直接对“首次系统研究”的新颖性声明提出了挑战
  3. malaya-speechsil-ai/tts-singlish 项目 - 先前存在的 Singlish TTS 实现
  4. 存在多种口音 TTS 方法(Accent Vector、Scalable Controllable Accented TTS、Joycent),但均未被用作基线

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

Published:

我已经掌握了足够的依据。通过 free-search 发现的关键点:T-Mimi (2601.20094) 和 Qwen3-TTS 是用于端侧 TTS 的相关并行/近期工作,而 “Efficient Streaming TTS Acoustic Model with Depthwise RVQ Decoding Strategies in a Mamba Framework” (Interspeech 2025) 是另一项直接针对 RVQ 深度解码效率的相关工作。现在我已有足够的信息来撰写评估报告。

Looking for Affect in Spontaneous Finnish Speech through Linguistic Interpretability

Published:

我现在已有充分的事实依据。论文本身引用了 Wagner 2023,其揭示了纯音频模型会隐式地学习语言结构——这直接确立了多模态文本与音频情感识别(SER)已经是一个有充分研究基础的研究方向,而本文的研究结果证实了 Wagner 的早期发现。我现在已经有了完整的事实基础。让我输出最终评审。

Revisiting Vocos: That Phasiness Business in Time-Frequency Neural Vocoding

Published:

我已经掌握了所需的全部证据。让我来整理这份评审。这项并发工作(2509.18806,发表于 2025 年 9 月)在 2 个月的并发窗口期之外(该论文发表于 2026 年 7 月),因此它是相关的前期工作。让我来撰写最终的评审。

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

Published:

太好了——我现在有了详尽的研究结果。我发现了以下几项关键的前置工作:

  • MVAD 数据集论文 (arXiv:2512.00336,发表于 2025 年 11 月) —— 这是本文使用的基础数据集
  • “Divide and Conquer” (arXiv:2602.00209) —— 针对 DDL 挑战赛的多模态 deepfake 检测
  • X-AVDT (CVPR 2026) —— 用于 deepfake 检测的音视频交叉注意力机制
  • HAVIC (CVPR 2026, 作者同一团队) —— 整体音视频内在一致性
  • 关于 deepfake 检测中分数级融合规则的分析 (MDPI 2022)
  • “A Robust Approach to Multimodal Deepfake Detection” —— 展示了模态解耦的优势

Teffic-Audio: Tell Fact from Fiction

Published:

我已经阅读了完整的16页论文,并从wiki、paper-wiki和free-search中收集了研究证据。现在输出最终的结构化综述。

Versatile On-device Adaptation at the Edge by Unifying Few-shot, Zero-shot, Continual, and In-context Learning

Published:

现在我已经获取了所有研究锚点。OMC wiki:无结果(在所有 8 次查询中均为空)。paper-wiki:失败(缺少 papers 目录)。Free-search:已确认 Chameleon [25] 是作者之前发表的关于 FSL+CL 的工作;FSL-HDnn [18] 和 Clo-HDnn [19] 是基于硬件的 FSL/CL 竞争对手;SAPIENS [20] 和 Kim et al. [21] 是 FSL 硬件竞争对手;Liu et al. [50] 是基于硬件的 ZSL 竞争对手;RegBench [51] (Akyurek et al. 2024) 和 Fluent Speech Commands [49] 是已确立的基准。目前没有先前的工作在边缘设备上统一这四种学习场景。现在开始输出审查结果。

Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation

Published:

我现在已经有足够的研究依据了。让我来整理这篇综述。我已经获得了完整的论文文本,执行了所有必要的 wiki 查询(均未返回结果),搜索了 paper-wiki(找到了 CosyVoice3、Fish-Speech-S2、VoxCPM2、InstructTTSEval、SPAM、DMP-TTS、DisCo-Speech),并进行了自由搜索(找到了关键的相关研究 “Do You Hear What I Mean?” 2509.13989)。

Band-Count Dense Modal Estimation with Fixed-Frequency Differentiable Resonator Refinement

Published:

所有三次 OMC wiki 查询均未返回结果。OMC wiki 中没有关于此主题的记录。free-search 工具找到了关键的相关工作(Engel 等人的 DDSP [ICLR 2020],Diaz 等人的 Differentiable Modal Resonators [ICASSP 2023],Yu 等人的 Differentiable All-pole Filters [OpenReview],以及 ESPRIT/matrix-pencil 经典方法)。paper-wiki 中没有相关记录。我已掌握足够的事实锚点来撰写审稿报告。现在开始生成结构化的 Markdown 审稿报告。

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

Published:

我已获取全文并完成所有维基/论文库/自由搜索查询。OMC Wiki 对所有查询均未返回相关记录(TTS 幻觉领域无经验知识)。论文库中收录了 CosyVoice、Seed-TTS、GLM-TTS 和对比解码综述论文 (2603.09232)。Free-search 确认了该论文及两篇密切相关的先行工作:Liu 等人 2025 (EMNLP, GFlowNet 分布对齐) 和 Wang 等人 2025 (注意力引导)。现在开始输出最终评审。

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

Published:

已收集足够的研究锚点。论文 wiki 确认了以下内容:

  • Moshi (2410.00037):双流全双工,7B Helium LLM,Mimi codec,Inner Monologue — 已记录
  • Qwen3-Omni (2509.17765):Thinker-Talker MoE 架构,这是首个在多模态之间没有性能下降的单模型 — 已记录
  • Freeze-Omni (2411.00774):未在 wiki 中收录,但论文引用其为 baseline
  • JoyVoice (2512.19090):同一团队的 Talker 所采用的架构 — 已记录
  • TurnGuide (2508.07375):全双工 turn-taking SOTA — 已记录
  • Full-Duplex-Bench v3 (2604.04847):存在较新的 v3 版本,但论文使用的是 v1.5

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

Published:

我已有足够的研究锚点。OMC wiki 没有返回任何结果;paper-wiki 有一些 ASR 论文 ID,但该概念下没有相关的数据集或具体论文;free-search 确认了 Whistle 论文(相同作者群,前置工作)、Autosegmental Neural Nets(参考文献 14,音素-声调建模)、Universal Phone Recognition(参考文献 16),并且未发现已有的“latent softmax”或针对音素 ASR 的声调边缘化方法。现在我将输出最终评审。

FATE: Frame-Level Audio-Visual Temporal Embedding

Published:

我已经获取了所需的所有信息。全文已阅读(742行),知识库已查询(OMC wiki 和 paper-wiki 中无记录,已用 free-search 补充),基线已通过搜索验证。正在输出最终评审。

The Role of Disfluencies in Speech Translation

Published:

我已阅读全文(共 20 页,已转换为 3876 行文本)并完成了所有 wiki 查询。OMC Wiki 中未找到关于语音翻译不流利主题的相关记录。paper-wiki 中虽然收录了关于音频基础模型 (2602.16687) 和带有不流利现象的语音智能体 (2604.04847) 的论文,但它们是相关工作,而非直接的基准模型或重复研究。以下是结构化评审结果。

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

Published:

我已获取完整数据。论文已全文阅读(HTML:引言、相关工作、包含 ASD/HCM/ADM 在内的方法、损失函数、包含表 1-8 和附录 A-B 在内的实验、消融实验、可视化、局限性)。已对 OMC Wiki(无记录)、paper-wiki(无记录)及免费搜索(找到 AVISM CVPR’25、ACVIS ICASSP’26、AVS-Mamba、SeaVIS、Learning What to Hear ICASSP’26)进行了查询。现已有足够信息输出评审。

Speaker Verification Under Real Classroom Conditions for English Speech

Published:

EDSI 是马里兰大学的一个项目,目前正计划开放获取,但目前尚未提供下载链接,且需要通过专用平台才能访问 PII。没有找到该论文的代码/GitHub 仓库。我已经掌握了足够的事实锚点。现在我将撰写最终的评审报告。

Equivariant Music Transformer

Published:

我现在已经掌握了充分的信息。我已确认以下事实:

  • Moonbeam (arXiv:2505.15559) 的作者是同一位第一作者 (Zixun Guo) —— EMT 正是建立在 Moonbeam 的基础之上
  • Anticipatory Music Transformer (arXiv:2306.08620) 是公认的 SOTA 基线
  • Music102 是一篇关于 D12-等变 Transformer 的相关工作,但它专注于和弦进行伴奏,而非生成式建模
  • PESTO、STONE 和其他等变自监督工作侧重于判别式任务(音高/节奏/调性估计),而非自回归生成

Transfer Learning for Avian Bioacoustics under Sparse Positive Labels

Published:

我现在已经建立了所有必要的事实依据。BirdCLEF+ 2025 的获胜解决方案在 private leaderboard 上实现了约 0.930 的 ROC-AUC,而本文在 BirdCLEF+ 2026 上报告了 0.860 的 macro AUC。该论文的核心方法是一个基于源可靠性特征的 L2 正则化逻辑回归元分类器——本质上是带有特征工程的 stacking。让我来撰写最终的评审意见。

Assessing AI-generated music detection in real-world broadcast monitoring

Published:

已完成全部研究阶段(Step 0-3):读完全文731行 PDF 文本、执行了 6 次 wiki_query(均无记录)、3 次 paper-wiki 查询(均无结果)、3 次 free-search(找到前序工作 Afchar et al. ICASSP 2025、Rahman et al. ICLR 2025、López-Ayala et al. ICASSP 2026,以及同期工作 MusicDET、Improved Robustness、Finding the noise)。现在输出最终 review。

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

Published:

所有研究查询已完成。OMC Wiki 对所有查询均未返回结果。paper-wiki 中虽然有语音合成相关的论文,但没有关于小提琴/乐器合成的记录。free-search 找到了关键基准(ViolinDiff, ICASSP 2025)及相关工作。我已经阅读了完整的 9 页论文。现在我将输出评审意见。

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

Published:

自由搜索证实,目前没有关于遥感图像口语查询引用分割(spoken-query referring segmentation for remote-sensing imagery)的前序研究。已找到关键的 RRSIS 基线(CroBIM, LSCF, FIANet, SBANet, STDNet),它们与论文中作为对比基线使用的方法一致。现在让我来撰写最终评审。

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

Published:

我已经获取了完整的论文内容,并收集了来自 wiki 查询和免费搜索结果的所有必要研究数据。OMC Wiki 中没有关于音频深度伪造检测的记录,并且 paper-wiki 也返回了空结果。我现在将基于完整的论文文本和搜索结果中发现的相关工作进行综合评估。

Luna-TTS Family Technical Report

Published:

我现在已经掌握了足够的上下文信息。我已经阅读了完整的论文(共 1897 行,21 页),并且获得了外部搜索结果。现在让我来汇总最终的审稿意见。

papers

portfolio

talks

teaching