Daily Papers — 2026-06-23
28 papers on audio, speech, music, and acoustics.
1. Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement
Authors: Wangyi Pu, Michele Scarpiniti
Categories: cs.SD, cs.AI, eess.AS
Score: 8.1/10 (Obj:9 Id:8 Ind:8 Comp:8 Eff:8 Nov:8)
- 优势: 质疑了U-Net跳跃连接在生成式语音增强中的必要性——跳跃连接虽然缓解梯度消失,但也引入了编码器-解码器特征不匹配的噪声。用隐空间表征对齐(LRA)替代跳跃连接,让解码器每一层都直接从编码器对应层获取对齐的隐表示,而非原始特征图,这更符合Flow Matching的ODE传输语义。在两个基准上取得了与U-Net持平甚至更好的效果,证明skip-free不是性能妥协而是更优的设计选择。
- 劣势: skip-free设计的泛化性尚未充分验证——论文仅在Flow Matching SE上验证,对扩散模型和其他生成任务是否适用存疑。LRA对齐机制引入了额外的对齐损失,增加了训练复杂度。编码器-解码器层数必须严格对应,架构灵活性受限。论文未讨论对实时部署的影响,计算开销分析缺失。
中文摘要: 针对扩散和分数生成模型在语音增强中因迭代采样过程限制实时部署的问题,本文以流匹配(Flow Matching)作为高效替代方案,通过常微分方程以少量函数评估将含噪语音传输至干净语音。作者提出了一种无跳跃连接的编码器-解码器骨干网络,并在潜在表示对齐(Latent Representation Alignment)的引导下构建流匹配语音增强框架。该方法旨在克服传统U-Net跳跃连接可能引入的噪声残留问题,同时保持生成质量与采样效率。实验表明,所提方法在语音增强性能上具有竞争力,并在少量采样步数下展现出优于基线模型的客观指标表现。
Generative models, particularly diffusion and score-based approaches, have recently achieved strong performance in speech enhancement, but their iterative sampling process limits real-time deployment. Flow Matching offers an efficient alternative by transporting noisy speech toward clean speech through an ordinary differential equation with few function evaluations. In this work, we propose a skip-free encoder-decoder backbone for flow-matching speech enhancement, guided by Latent Representation
2. Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation
Authors: Baisen Wang, Chenxi Bao, Qisong Han
Categories: cs.SD, cs.AI, cs.HC
Score: 7.8/10 (Obj:8 Id:7 Ind:7 Comp:8 Eff:8 Nov:8)
- 优势: 将音乐生成AI从离线渲染范式变为实时可演奏乐器,这是音乐AI从工具到乐器的重要范式转变。流式一致性蒸馏实现了数据无关的快速推理——无需真实音乐数据训练蒸馏模型,只需教师模型自身的采样输出即可训练学生模型。延迟低至可交互水平,使得即兴演奏和实时人机协作成为可能,这对现场演出和创意工作流有直接应用价值。
- 劣势: data-free蒸馏的具体机制和理论保证需要更清楚的解释——为什么无需真实数据训练的学生模型可以保持音乐质量?交互音乐的表达维度可能有限——实时约束下生成内容的复杂度和多样性必然受限。论文未提供与有数据蒸馏方法的系统对比,data-free的代价是否可接受尚不明确。
中文摘要: 本文针对现代生成式音乐AI推理延迟高、采用离线渲染范式而无法满足实时交互式演奏需求的问题,提出了一种将静态生成模型转化为动态可演奏乐器的框架。该方法基于无数据流式一致性蒸馏(Data-Free Streaming Consistency Distillation)技术,在不依赖额外训练数据的前提下对模型进行蒸馏,以实现现场交互所需的低延迟音频生成。该框架使音乐家能够在现场演出中进行实时交互式作曲,将生成模型转化为可演奏的新型创作媒介。这一工作为先锋音乐家提供了全新的实时音乐交互介质,弥合了生成式音乐AI与现场表演之间的鸿沟。
Interactive music and live performance relies on real-time human expression, but modern generative music AI remains largely absent from this domain due to its prohibitive inference latency and offline rendering paradigm. To provide pioneer musicians with a novel medium for interactive composition, we should fundamentally change these static models into dynamic, playable instruments. In this paper, we propose a framework that bridges this gap. To achieve the low latency required for live interact
3. A Variational-Flow Analysis of StoRM under Noise-Power Mismatch
Authors: Shuubham Ojha
Categories: eess.AS
Score: 7.7/10 (Obj:7 Id:9 Ind:8 Comp:9 Eff:7 Nov:8)
- 优势: 变分流分析精确诊断了扩散语音增强在训练噪声幅度处出现的SI-SDR’弯折’现象,并通过精确因子分解$\partial\sigma^{(M)}/\partial M = K(M) \cdot \partial C_M/\partial M$将非平滑性定位到预测器阶段,而非分数网络。这意味着改进方向应是优化预测器而非分数网络,对整个扩散SE领域的架构设计有指导意义。理论推导严谨,结论反直觉。
- 劣势: 理论洞察深刻但直接效果改善有限——论文更多是理解和诊断而非工程优化,不会立即带来更好的SE模型。变分流分析的理论框架较为抽象,实践者可能难以直接应用。分析基于StoRM特定架构,对其他扩散SE架构的适用性需验证。
中文摘要: 本文研究扩散模型语音增强架构在噪声功率失配条件下的性能突变问题:当测试噪声幅度偏离训练值时,SI-SDR退化曲线在训练噪声幅度处出现明显的非光滑”折点”(kink)。作者提出一种路径式变分流(variational-flow)分析方法,对由确定性预测器与学习型评分网络组成的耦合架构进行参数敏感性分析,建立了核心恒等式 ∂σ^(M)/∂M = K(M)·∂C_M/∂M,实现了对参数敏感性的精确分解。基于该分解,作者将非光滑性严格定位至预测器阶段而非评分网络阶段,揭示了折点产生的机理根源,为扩散语音增强模型在噪声失配条件下的鲁棒性分析与设计提供了理论依据。
Diffusion-based speech enhancement architectures that pair a deterministic predictor with a learned score network, exhibit a sharp non-smooth transition (``kink’’) in the SI-SDR degradation curve at the training-time noise amplitude. We give a pathwise variational-flow analysis that localizes this non-smoothness to the predictor stage. The central identity is an exact factorization of the parametric sensitivity, $\partial \sig^{(M)} / \partial M = K(M) \cdot \partial C_M / \partial M$, where $K(
4. Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR
Authors: Nenad Banfic
Categories: cs.AI
Score: 7.6/10 (Obj:8 Id:9 Ind:8 Comp:9 Eff:7 Nov:7)
- 优势: 精准回答了流式ASR跨语言迁移中编码器选择的实践问题——通过大规模控制实验发现数据规模而非延迟约束才是决定多语言编码器优势的关键因素。结论反直觉:多语言编码器的优势在数据量增大后反而更快消退,而低延迟约束并未显著影响迁移效果。对ASR系统部署选型有直接指导意义——低资源用多语言编码器,高资源用单语言编码器更优。
- 劣势: 研究结论可能依赖特定语言对(实验涉及的具体语言未充分验证跨族系泛化)和特定模型架构(FastConformer)。量化对迁移效果的影响仅做了初步分析,部署场景的量化策略可能改变结论。多语言编码器’优势消退’的机制——是语言干扰还是表征饱和——未深入分析。
中文摘要: 本文研究流式语音识别模型在适配新语言时,究竟应选择多语言(ML)编码器还是仅英语(EN)编码器作为热启动起点,并系统考察数据规模、流式延迟约束与部署量化三者对这一选择的影响。作者通过在0.6 B参数的cache-aware FastConformer上开展受控扫描实验,回答了三个悬而未决的问题:ML编码器的低数据优势能持续多久、严格流式延迟是否会放大该优势、以及该优势能否在部署量化后保留。核心结论是,跨语言编码器迁移的差异主要由数据规模而非延迟塑造,这一发现澄清了流式低延迟场景下对ML优势的常见误判,并为在资源受限部署中合理选型提供了实证依据。
Adapting a streaming speech recognition model to a new language requires choosing between two plausible warm starts: a multilingual (ML) encoder or an English-only (EN) encoder. The common intuition is that the multilingual encoder should help most at low data, but it is unclear how long that advantage persists, whether tight streaming latency amplifies it, and whether it survives deployment quantization. We answer these questions with a controlled sweep of a 0.6 B-parameter cache-aware FastConf
5. Progressive Alignment Objectives for Aligner-Encoder based ASR
Authors: Jaeyong Lee, Masato Mimura, Takafumi Moriya
Categories: eess.AS, cs.CL, cs.SD | Accepted to Interspeech 2026
Score: 7.6/10 (Obj:8 Id:8 Ind:8 Comp:8 Eff:8 Nov:6)
- 优势: 精准定位了Aligner-Encoder的训练瓶颈——对齐在编码器高层突变形成导致长语音训练不稳定,这个观察很敏锐。渐进式对齐目标(InterAligner)让对齐可以从简单短语音逐步过渡到复杂长语音,课程学习的设计优雅且有效。在Interspeech 2026接收,说明社区认可这一改进的实用价值。
- 劣势: 渐进式课程学习在ASR中已有先例(curriculum learning for CTC等),课程学习方案本身非本质创新。论文未讨论对齐渐进速度对训练稳定性的影响——对齐形成过快或过慢都可能引入新的训练问题。InterAligner增加的训练开销和对齐监督信号的设计需要更多经验调参。
中文摘要: Aligner-Encoder 类端到端 ASR 模型通过让第 u 个编码器位置直接预测第 u 个 token 来取代解码器注意力,迫使编码器在无交叉注意力或 transducer 格的情况下自行学习对齐,但在实践中对齐往往在高层才突然形成,导致长语音训练敏感且脆弱。本文提出 InterAligner 方法,在编码器中间层引入渐进式 Aligner 监督目标,使对齐从简单短语音逐步过渡到复杂长语音,形成课程学习式的训练路径。该方法缓解了对齐突变带来的训练不稳定,让长语音上的对齐学习更加平滑可控。该工作已被 Interspeech 2026 接收,表明社区认可其对 Aligner-Encoder 训练范式的实用改进价值。
Aligner-Encoders are recently proposed seq2seq end-to-end ASR models that replace decoder attention by predicting the uth token directly from the u-th encoder position, so the encoder must learn the alignment internally without cross-attention or a transducer lattice. In practice, this alignment often forms abruptly in the upper layers, making training sensitive and brittle on long utterances. We propose InterAligner, which adds an intermediate Aligner objective so alignment can form progressive
6. Audio–Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR
Authors: Sujith Pulikodan, Nihar Desai, Prasanta Kumar Ghosh
Categories: eess.AS
Score: 7.5/10 (Obj:9 Id:8 Ind:8 Comp:8 Eff:7 Nov:7)
- 优势: 用图像作为’免费’监督信号通过继续预训练改善低资源ASR,设计优雅且实用——不需要转录文本,只需要音频-图像配对数据(如教学视频),这种数据远比转录语音容易获取。视听对齐迫使编码器学习与视觉语义相关的声学表示,为后续监督微调提供更好的初始化起点。在多个低资源语言上持续改善WER。
- 劣势: 视听对齐预训练在多模态学习中已有工作(AudioCLIP等),作为ASR继续预训练阶段是新的应用但非本质创新。方法有效性依赖音频和图像的语义相关性——对于语音内容与视觉场景弱关联的数据(如纯对话录音),对齐信号可能引入噪声而非帮助。
中文摘要: 这篇论文针对低资源语言在自动语音识别(ASR)中缺乏高质量转录数据的问题,提出了一种利用对齐的音频—图像配对数据来适配预训练音频编码器的方法。该方法将音频—图像对齐作为持续预训练阶段,在不需要转录数据的情况下对预训练音频编码器进行适配,随后再进行监督微调。实验表明,这一策略能够有效提升低资源语言场景下的语音识别性能。该工作的意义在于为缺乏大规模标注语料的语言提供了一条可行的ASR适配路径,降低了对昂贵转录数据的依赖。
Thousands of languages are spoken worldwide, yet many remain under-resourced for Automatic Speech Recognition (ASR) due to the limited availability of high-quality transcribed speech data. Collecting accurate transcriptions is often costly and labor-intensive, particularly for low-resource languages. In this work, we investigate the use of aligned audio-image pairs to adapt pretrained audio encoders without requiring transcription data before supervised fine-tuning. Our proposed representation a
7. CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation
Authors: Shijun Luo
Categories: cs.CL, cs.SD, eess.AS | 5 pages, 1 figure, 8 tables. ICASSP-style preprint
Score: 7.4/10 (Obj:9 Id:8 Ind:8 Comp:7 Eff:7 Nov:7)
- 优势: 填补了中文新闻TTS发音评测的空白——中文新闻文本包含大量分数、型号、范围、单位符号、英文缩写和混合中拉数字名称,这些是实际TTS应用的痛点但此前无系统评测。自动评分管线设计巧妙,将发音正确性评价转化为目标级匹配问题,避免了MOS等主观指标的模糊性。揭示了现有系统在数字/缩写/混读上的系统性错误。
- 劣势: 目前为v0.1版本,评测覆盖面和鲁棒性可进一步扩展——评测目标的定义是否覆盖了中文新闻中所有易错类型?作为基准论文,主要贡献是评测工具而非方法创新,对TTS模型本身的改进指导有限。
中文摘要: 中文新闻文本中大量存在比分、连字符型号、范围区间、单位符号、百分比、英文缩写及中英数混排人名等书面化形式,TTS系统可能在保留原始字符串的同时改变其口语含义,从而引发语义偏差。为此本文提出CN-NewsTTS Bench v0.1,一个面向原始输入的目标级评测基准,用于在不依赖用户端规则、LLM改写、SSML提示或人工修正的前提下评估中文新闻TTS产品对上述目标的发音正确性。该基准包含200条开发集、800条公开测试集、992个可自动评测目标、由三套ASR集成得到的固定转录、自动目标评分器,以及七款产品TTS系统的初始评测结果。作者进一步提供了ASR路由诊断、ASR子集消融、类别级结果、置信区间与厂商配置元数据等分析。实验显示最佳系统严格准确率达0.879,而仍有数款系统低于0.60,表明不同产品在原始新闻文本发音正确性上差距显著。CN-NewsTTS Bench针对中文新闻文本中含有大量分数、连字符型号、范围、单位符号、百分比、英文缩写及中英数字混写名称等书面形式,这些形式在实际收听场景中频繁出现,而TTS系统可能保留书面字符的同时改变口语含义的问题,提出了一个开放的目标级自动评测基准。该基准用于评估中文新闻TTS产品从原始文本中正确发音这些目标形式的能力。该工作填补了中文新闻TTS发音评测领域缺乏专门基准的空白。
Chinese news text contains dense written forms such as scores, hyphenated model names, ranges, unit symbols, percentages, English abbreviations, and mixed Chinese-Latin-digit names. These forms are frequent in real listening workflows, and a text-to-speech (TTS) system can preserve the written string while changing the spoken meaning. We introduce CN-NewsTTS Bench v0.1, an open target-level benchmark for evaluating whether Chinese news TTS products pronounce such targets correctly from raw text,
8. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Authors: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng et al.
Categories: cs.CV, cs.AI, cs.GR, cs.SD | Website: https://wan-streamer.com
Score: 7.3/10 (Obj:9 Id:6 Ind:7 Comp:5 Eff:8 Nov:7)
- 优势: 实现了原生流式全双工音视频交互——单Transformer统一建模语言、音频和视频的输入输出token,用block-causal attention实现增量流式处理,架构设计干净。无需外接TTS/ASR模块,端到端实现低延迟交互,这比级联方案在延迟和自然度上都有优势。对实时交互AI助手有直接应用价值。
- 劣势: 系统集成论文,各组件(流式Transformer、交错token、block-causal attention)的独立贡献难以分离,科学洞察有限。8B参数模型的推理成本在实时场景下如何控制?论文未充分讨论计算资源需求。全双工交互中的打断、重叠等复杂交互模式的处理能力未充分展示。
中文摘要: Wan-Streamer是一种原生流式、端到端的交互式基础模型,专为实时低延迟的全双工音视频交互设计。该模型在单一Transformer中将语言、音频和视频同时作为输入和输出进行统一建模,通过视觉、音频和文本输入token与输出token交错排列,并采用块因果注意力机制实现增量流式处理。与传统分模块方案不同,Wan-Streamer从底层架构上实现了多模态的端到端融合,避免了级联系统带来的延迟累积问题。该方法为构建实时多模态交互系统提供了一条新的技术路径,有望显著降低音视频对话场景的响应延迟并提升交互体验的一致性。
We present Wan-Streamer, a native-streaming, end-to-end interactive foundation model designed from the ground up for real-time, low-latency, full-duplex audio-visual interaction. Wan-Streamer seamlessly models language, audio, and video as both input and output within a single Transformer, where the sequence is represented as interleaved visual, audio, and text input tokens together with visual, audio, and text output tokens, coordinated by block-causal attention for incremental streaming. Unlik
9. Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training
Authors: Wonchul Shin, Inyong Choi, Kyogu Lee
Categories: eess.AS, cs.AI, cs.SD | Accepted by Interspeech 2026
Score: 7.3/10 (Obj:4 Id:9 Ind:8 Comp:8 Eff:7 Nov:8)
- 优势: 揭示了EEG语音提取中trial内shortcut导致虚假高性能的关键问题——此前的端到端模型在within-trial评测上的高表现实际上来自trial特异性的EEG结构(而非真正的神经语音信号),这对整个EEG语音提取领域有重要警示意义。TRUST-TSE的对比预训练+跨trial微调两阶段方案确实缓解了shortcut问题,跨trial性能更可靠。
- 劣势: 修复后跨trial性能仍然有限,说明EEG语音提取的根本挑战(低信噪比、空间模糊、高变异)未被解决。两阶段方案增加了训练复杂度,对比预训练的负例构建策略对最终性能影响大但调参空间大。
中文摘要: 这篇论文针对EEG引导的目标语音提取任务,揭示了一个关键问题:现有端到端模型在试次内表现优异,但跨试次泛化能力差,原因是模型利用了试次特有的EEG结构作为”捷径”来选择目标语音,而非真正建立神经信号与语音之间的对应关系。为破解这一捷径学习问题,作者提出TRUST-TSE两阶段训练框架:第一阶段通过对比预训练学习具有跨试次泛化能力的EEG表征,第二阶段在此基础上进行目标语音提取训练以抑制对试次特异结构的依赖。该方法有效打破了模型对试次捷径的依赖,显著提升了在未见试次上的目标语音提取性能,为神经导向助听技术提供了更可靠的跨试次泛化能力。
Recent end-to-end models for EEG-guided target speech extraction report impressive results, underscoring potential for neuro-steered hearing technologies. However, our analysis reveals that high within-trial performance can be driven by trial-specific EEG structure that acts as shortcuts for target selection, leading to poor generalization on unseen trials. To overcome this gap, we propose TRUST-TSE, a two-stage framework to mitigate shortcut learning. By introducing contrastive pretraining with
10. ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge
Authors: Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung et al.
Categories: cs.SD, cs.CL, eess.AS | Accepted to Interspeech 2026
Score: 7.0/10 (Obj:6 Id:7 Ind:8 Comp:7 Eff:7 Nov:7)
- 优势: 填补了LALM副语言判断评测的空白——此前LALM评测要么关注整体自然度,要么是单一维度的分类,缺少对Style/Rate/Emphasis/Age/Gender五个副语言维度的系统性成对判断评测。5175对音频的成对基准设计系统性好,可以揭示LALM在细粒度副语言区分上的具体弱点。当前LALM比人类差32%的发现对模型改进有推动作用。
- 劣势: 副语言维度覆盖面可进一步扩展——五个维度是否覆盖了语音副语言的全部关键方面?成对评测的标注一致性需更多验证,副语言判断的主观性可能导致标注者间差异较大。基准只评测判断能力,不评测生成能力。
中文摘要: 现有大型音频语言模型(LALM)被广泛用作评判模型以自动评估生成语音,但以往方法主要关注整体自然度,对细粒度的副语言差异探索不足。为此,作者提出ParaPairAudioBench,一个包含5,175个音频对的成对评测基准,覆盖风格、语速、重音、年龄和性别五个副语言维度。实验结果表明,当前LALM评判模型与人类判断之间仍存在约32个百分点的差距,揭示了该领域在副语言感知方面亟待改进的空间。
Large Audio-Language Models (LALMs) have been widely used as judge models for the automatic evaluation of generated speech. However, prior approaches predominantly focus on holistic naturalness, leaving fine-grained paralinguistic distinctions underexplored. We introduce ParaPairAudioBench, a pairwise benchmark of 5,175 audio pairs across five paralinguistic dimensions: Style, Rate, Emphasis, Age, and Gender. Our experiments show that current LALM judges still lag behind human judgments by 32%p
11. Selective Capability Unlearning in End-to-End Spoken Language Understanding
Authors: Akanksha Singh, Vinod Kumar Kurmi
Categories: cs.CL, cs.AI | 5 pages, 3 figures, preprint
Score: 6.6/10 (Obj:5 Id:7 Ind:7 Comp:7 Eff:7 Nov:6)
- 优势: 针对SLU中功能遗忘的真实合规需求,设计了干净的选择性遗忘方案——当政策或安全约束要求移除特定意图时,仅抑制意图不够,还需要消除该意图条件下的slot生成行为。论文清晰展示了意图-槽位条件依赖的’越狱’风险,这对部署中的SLU系统有安全意义。
- 劣势: 机器遗忘在NLP中已有大量工作(梯度上升、知识蒸馏等),扩展到SLU是合理的模态迁移但非本质创新。遗忘完整性的评估标准——如何验证意图完全被遗忘而非只是被抑制——仍然模糊。对生成式SLU系统,遗忘可能与模型其他能力产生不可预测的干扰。
中文摘要: 提出了一种针对端到端语音理解系统的选择性能力遗忘方法,核心问题是在策略或安全约束下需要移除特定功能(即意图及其关联的槽位生成行为),但简单抑制目标意图并不能消除模型在给定该意图前缀条件下生成对应槽位的条件映射能力。方法上针对自回归模型的条件生成路径进行针对性遗忘,使模型在意图被外部提供时也无法触发对应的槽位生成行为。该方法能够在保持其他功能完整的前提下,有效移除指定功能的安全隐患。
Modern spoken language understanding (SLU) systems are increasingly deployed in real-world settings, where specific functionalities may need to be removed due to policy or safety constraints. In SLU, a functionality corresponds to an intent and its associated slot-generation behavior. However, in autoregressive models, suppressing a target intent does not eliminate the conditional mapping that generates slots conditioned on that intent. When the intent prefix is externally supplied, the model ca
12. Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions
Authors: Abinay Reddy Naini, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Carlos Busso
Categories: eess.AS, cs.SD
Score: 6.5/10 (Obj:5 Id:7 Ind:8 Comp:7 Eff:7 Nov:5)
- 优势: 让LALM学会语音情感的比较判断,扩展了音频LLM的细粒度感知能力——从绝对情感分类到相对情感比较,这对需要理解情感细微差别的应用场景(如心理咨询辅助、客服质量评估)有价值。推理引导的序数SER框架比直接分类更贴近人类的情感感知方式。
- 劣势: 比较推理在NLP中已有成熟方法(成对比较、排序学习等),音频情感应用是合理的模态迁移。Arousal/Valence/Dominance三维度比较的标注主观性高,ground truth的可靠性存疑。论文未讨论比较判断的校准性——模型是否能在比较结果上给出可靠的置信度。
中文摘要: I need to find the full abstract and results of this paper to write an accurate summary. Let me search for it.
Large audio-language models (LALMs) can reason about audio, yet it remains unclear whether they can perform comparative judgments between two speech signals along emotional, environmental, linguistic, prosodic, and interpersonal dimensions. We study this question in the context of speech emotion recognition (SER), where the model determines which utterance exhibits higher arousal, valence, or dominance. We introduce a reasoning-guided ordinal SER framework that conditions an LALM on paired speec
13. ZONOS2 Technical Report
Authors: Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge
Categories: cs.SD, cs.AI | 15 pages, 7 figures, 7 tables. Technical report. Model weights, inference code, and the ZTTS1-Eval benchmark released under Apache 2.0. Code: https://github.com/Zyphra/ZONOS2 ; weights: https://huggingface.co/Zyphra/ZONOS2 ; benchmark: https://github.com/Zyphra/ZTTS1-Eval
Score: 6.4/10 (Obj:8 Id:5 Ind:7 Comp:4 Eff:7 Nov:6)
- 优势: ZONOS2 8B在自然度、韵律和声音克隆上达到了与前沿TTS系统竞争的水平,MoE骨干(8B总参/900M激活)实现了高效推理——活跃参数少意味着推理速度快,适合部署。训练语料从20万小时扩展到600万小时,数据管线改进和后训练简化是实用贡献。开源Apache 2.0许可,模型权重和ZTTS1-Eval基准都公开了。
- 劣势: 技术报告缺乏方法创新——MoE骨干+大规模数据+简化后训练是工程堆叠而非科学洞察。MoE的路由机制、专家特化等关键设计未深入分析。效果是与前沿打平而非碾压,考虑到8B的模型规模,性价比未必优于更小的专用模型。A6按技术报告标准已放宽。
中文摘要: ZONOS2技术报告介绍了一个8B参数的TTS模型,在自然度、韵律和语音克隆保真度方面达到了当前最优水平。该模型采用新颖的混合专家(MoE)骨干网络,将参数规模从1.6B扩展到8B(其中900M为活跃参数),在提升模型能力的同时改善了推理延迟和吞吐量。研究者构建了新的数据处理流水线,将训练语料从200K小时扩展至超过6M小时,并简化了后训练和条件化流程。该方法在多个维度上全面超越了前代Zonos-v0.1模型,体现了规模、数据和训练策略的协同优化。
We present ZONOS2 8B, our latest TTS model, which achieves state-of-the-art naturalness, prosody, and voice cloning fidelity. We improve upon Zonos-v0.1 across scale, data, and training recipe. We scale the model from 1.6B to 8B total parameters (900M active) with a novel mixture-of-experts (MoE) backbone, improving inference latency and throughput. We expand our training corpus from 200K to over 6M hours using a new data processing pipeline, and we simplify our post-training and conditioning re
14. Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming
Authors: Yongyi Deng, Hanchen Pei, Jianbo Ma, Gongping Huang, Jingdong Chen et al.
Categories: eess.AS, cs.SD | Accepted to INTERSPEECH 2026. 6 pages, 2 figures, 1 table
Score: 6.4/10 (Obj:6 Id:7 Ind:7 Comp:6 Eff:7 Nov:5)
- 优势: 解决了MVDR波束成形对麦克风噪声敏感的实践问题——现有方案依赖固定WNG阈值或对角加载,在未知或时变声学条件下次优。联合学习协方差估计和WNG的数据驱动方案让两者互相适应,在Interspeech接收说明实用价值被认可。
- 劣势: 核心是工程改进而非方法创新——将WNG从手动调参变为可学习参数是直观的改进,洞察深度有限。联合学习的两个目标(协方差精度vs噪声鲁棒性)之间的权衡机制未深入分析。实验仅对比了固定阈值基线,与更先进的鲁棒波束成形方法的对比缺失。
中文摘要: 针对MVDR波束形成器对麦克风自噪声和阵列失配敏感的问题,本文提出了一种数据驱动的MVDR框架,通过联合学习协方差矩阵估计与白噪声增益(WNG)控制来替代传统的人工调参和对角加载方法。该框架将WNG约束作为可学习参数嵌入到波束形成器训练中,使其能够在未知或时变声学条件下自适应地平衡噪声抑制与鲁棒性。实验表明,该方法在多种噪声和失配场景下显著提升了语音增强性能,同时保持了目标信号的完整性。
The minimum variance distortionless response (MVDR) beamformer is widely used for multichannel speech enhancement due to strong noise suppression while preserving target signals. In practice, its performance is sensitive to microphone self-noise and array mismatches. Existing approaches typically rely on fixed, manually tuned WNG thresholds or diagonal loading, leading to suboptimal performance under unknown or time-varying acoustic conditions. This paper proposes a data-driven MVDR framework th
15. MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning
Authors: Revant Teotia, Adrien Bardes, Michael Rabbat, Sumit Chopra, Matthew J. Muckley et al.
Categories: cs.CV, cs.LG
Score: 6.4/10 (Obj:6 Id:7 Ind:8 Comp:7 Eff:7 Nov:4)
- 优势: 将IJEPA架构优雅地扩展到音视频联合学习,去除了对比学习对负例和模态特定编码器的依赖——单共享ViT处理两种模态在预测空间中联合表示,简洁且可扩展。方法简单到令人信服,符合压缩公理——更少假设获得更多可迁移表示。
- 劣势: 核心是IJEPA的模态迁移,方法层面创新有限——从视觉扩展到音视频是自然的下一步但非本质突破。共享编码器可能限制各模态的特化能力,音视频的最优表示空间是否真的可以共享未充分论证。与音视频对比学习方法的全面对比缺失。
Self-supervised learning from large-scale video data has emerged as a dominant paradigm for visual representation learning. Since audio and visual streams naturally co-occur in video data, extending this success to jointly learn from both modalities is a natural next step, yet it remains challenging. Existing audio-visual self-supervised methods rely on modality-specific encoders and complex combinations of contrastive or reconstruction objectives, limiting cross-modal synergy and scalability. J
16. DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration
Authors: Youran Ni, Shihong Tan, Yuzhu Wang, Gongping Huang
Categories: eess.AS, cs.AI, cs.SD | Accepted by Interspeech 2026
Score: 6.3/10 (Obj:5 Id:7 Ind:7 Comp:6 Eff:7 Nov:5)
- 优势: 定义了音乐源恢复这一新任务——不仅要分离音源,还要逆转非线性的生产效果(如失真、压缩等),任务定义有实际价值。两阶段解耦设计合理:生成阶段确保语义一致性,回归阶段保证信号重建精度。在Interspeech接收说明社区认可任务定义的价值。
- 劣势: 两阶段级联方法常规——先用生成模型获取干净的先验匹配,再用回归模型精细重建,这种策略在语音增强中已有类似做法。音乐源恢复的任务定义虽新但方法创新有限。级联系统第二阶段的输入依赖第一阶段输出,错误传播问题未充分讨论。
中文摘要: DTT-BSR+ 针对音乐源恢复(MSR)中源分离与非线性制作效应反演难以兼顾的难题,提出两阶段级联架构:首阶段用生成式 DTT-BSR 分离器生成符合干净源先验的 stems,次阶段用改造的 Demucs 网络结合时域与多分辨率频谱损失进一步增强重建。该方法在所有 stems 上较单阶段 DTT-BSR 提升了多 mel 信噪比(MMSNR),并在五个 stems 上超越当前最优的 X-LANCE 系统。此外,通过 Fréchet 音频距离(FAD)分解,研究揭示了各 stems 上信号重建精度与语义分布拟合之间存在内在权衡,为 MSR 任务的设计提供了新视角。英文摘要似乎被截断了(”clean s…“)。我将基于已有的内容进行处理。
核心要素:
- 问题:音乐源还原(MSR)需要同时解决源分离和非线性制作效果反转
- 当前局限:难以同时实现准确的目标信号重建和语义一致性
- 方法:DTT-BSR+,一个两阶段级联 MSR 系统,将分布拟合与信号重建分离
- 第一阶段:生成式 DTT-BSR 分离器产生匹配纯净源先验的 stems
由于摘要被截断,我将基于可见内容进行概括。</think>音乐源恢复(MSR)需要同时解决音源分离与非线性制作效果的反演问题,现有方法在精确重建目标信号与保持语义一致性之间难以兼顾。为此,本文提出 DTT-BSR+,一种两阶段级联 MSR 系统,将分布拟合与信号重建解耦至不同阶段分别处理。第一阶段采用生成式 DTT-BSR 分离器,生成与干净音源先验相匹配的 stems;第二阶段则在生成结果基础上进行信号级回归重建。该方法通过分离”语义合理性建模”与”波形精度还原”两个子目标,提升了整体恢复质量。
Music source restoration (MSR) requires jointly addressing source unmixing and the inversion of non-linear production effects. Current methods struggle to achieve accurate target signal reconstruction while maintaining semantic consistency. To address this limitation, we propose DTT-BSR+, a two-stage cascade MSR system that decouples distribution fitting from signal reconstruction into separate stages. A generative DTT-BSR separator in the first stage produces stems matching the prior of clean s
17. AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
Authors: Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng et al.
Categories: cs.CL, cs.CV
Score: 5.9/10 (Obj:5 Id:6 Ind:7 Comp:5 Eff:7 Nov:4)
- 优势: 解决了小时级音视频理解的token瓶颈问题——长视频+长音频的token数远超LLM上下文窗口,AVOC用可学习的token压缩模块在编码器和LLM之间做了信息瓶颈,让小时级内容也能被LLM处理。将token压缩重新框架为检索问题是有趣的视角转换。
- 劣势: 核心是已有token压缩方案(如LLaVA-PruMerge等)的音视频应用,方法层面创新有限。’检索启发的压缩’本质还是token选择/合并,与已有工作区别更多在视角而非实质。压缩后的信息损失对理解质量的影响——特别是时间顺序和因果关系的保留——未充分验证。
中文摘要: AVOC针对全模态大模型在小时级长音视频理解中面临的长上下文窗口限制和信息冗余瓶颈,提出了一种基于检索启发的令牌压缩框架。该框架在模态编码器与LLM主干之间引入可学习的令牌压缩模块,通过重构多模态令牌压缩过程,有效减少冗余信息同时保留关键语义内容。实验表明,AVOC在小时级音视频理解任务上显著优于现有方法,在保持性能的同时大幅降低了计算开销。该工作为长时多模态理解提供了一种高效的信息压缩范式。
Multimodal Large Language Models have achieved remarkable progress in short-form audio-video understanding, yet long-form audio-video comprehension remains challenged by limited context windows and severe information redundancy. To address these bottlenecks, we propose AVOC, a framework for long-form audio-video understanding in Omni-modal Large Language Models. AVOC introduces a learnable token compression module between the modality encoders and the LLM backbone. We reframe multimodal token co
18. Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment
Authors: Takuya Hasumi, Welly Naptali
Categories: cs.SD | Accepted to Interspeech 2026, 5 pages, 2 figures
Score: 5.8/10 (Obj:4 Id:6 Ind:7 Comp:5 Eff:7 Nov:4)
- 优势: 验证了MusicLLM可以通过对齐训练改善情感回归能力,证明了LLM对齐技术向音乐情感领域的可迁移性。比较了指令微调和DPO两种对齐策略,发现DPO在情感回归上更有效,这对音乐LLM的训练策略选择有参考价值。
- 劣势: 指令微调+DPO是标准LLM对齐流程,扩展到音乐情感是合理的模态迁移但非本质创新。情感回归的评价维度(arousal/valence)过于简化,音乐情感远比二维空间复杂。数据集规模小,对齐训练的稳定性和泛化性未充分验证。
中文摘要: 本研究探讨音乐大语言模型(MusicLLM)是否能通过对齐方法实现情感回归预测,解决现有模型在情感唤醒度与效价评分预测上能力受限的问题,因为情感回归从未被纳入其训练目标。作者将MusicLLM在情感回归任务上进行训练,并对比两种对齐策略:指令微调与反馈驱动对齐,系统评估两者在连续情感维度预测上的有效性。实验结果表明,所提方法能显著提升MusicLLM对情感唤醒度和效价的回归精度,验证了大语言模型在音乐情感回归任务上通过专门对齐训练可获得实质性能力提升。该工作为音乐信息检索领域中情感维度的定量预测提供了新的建模思路与对齐范式。
This paper investigates whether music large language models (MusicLLMs) can be aligned for emotion regression. While MusicLLMs have shown strong performance in music information retrieval tasks, their ability to predict arousal and valence scores remains limited, since emotion regression has not been an explicit training objective. To examine whether MusicLLMs can be aligned with emotion, we train MusicLLMs on emotion regression and compare two strategies: instruction tuning and feedback-driven
19. Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant
Authors: Milosz Dudek, Daria Hemmerling, Kamil Kwarciak, Maciej Stroinski, Maria Pensko et al.
Categories: eess.AS, cs.AI, cs.MA | Accepted to INTERSPEECH 2026. 5 pages, 1 figure, 4 tables
Score: 5.7/10 (Obj:3 Id:6 Ind:7 Comp:5 Eff:7 Nov:4)
- 优势: 为波兰语儿童提供了轻量级发音筛查工具,可解释助手帮助家长理解筛查结果——wav2vec2+CTC+对齐错误分型的pipeline在10个未见儿童上验证了有效性。可解释助手将技术结果转化为家长可理解的建议,这对有限专科资源的地区有实用意义。
- 劣势: 方法偏工程pipeline——wav2vec2 CTC识别+对齐分型是MDD领域的标准做法,扩展到波兰语是合理的语言迁移但非本质创新。发音检测在英语中已有大量工作,波兰语的音素系统虽然不同但方法论增量有限。用户群体非常小众(波兰语儿童发音筛查),动机分受限。
中文摘要: 针对儿童语音错误早期识别受专科医生资源限制的问题,本文提出了一套面向波兰语儿童的发音筛查流程,重点关注咝音替换错误。该方法将基于wav2vec2的CTC音素识别器与基于对齐的错误类型判定相结合,并配备一个面向照护者的模板化解释助手,用于筛查而非诊断。在包含10名未见儿童、共559条语音的留出测试集上评估了系统性能。该工具旨在为临床外的轻量化筛查提供可解释的支持,降低专业语音评估的获取门槛。
Early identification of speech sound errors in children is often limited by access to specialists, motivating lightweight screening tools that can operate outside the clinic. We present a screening pipeline for Polish-speaking children focused on sibilant substitutions, coupling a wav2vec2-based CTC token recognizer with alignment-based error typing and a template-grounded caregiver assistant for screening, not diagnosis. On a held-out test set of 10 unseen children comprising 559 utterances, th
20. Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams
Authors: Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu
Categories: cs.CL, cs.AI | Poster paper accepted at 47th IEEE Security & Privacy 2026
Score: 5.5/10 (Obj:3 Id:5 Ind:6 Comp:5 Eff:6 Nov:6)
- 优势: 探索了土耳其语电话诈骗的音频检测,填补了低资源语言诈骗检测的空白——此前研究几乎全关注英语,土耳其语等低资源语言缺乏标注数据和技术防御手段。构建了首个公开的多模态诈骗数据集(100对音频-文本),为后续研究提供了基础。
- 劣势: Poster论文,方法和实验都较初步——100对样本的数据集规模太小,LLM辅助检测的有效性仅做了初步验证。电信诈骗检测在土耳其语的应用场景非常小众,实际部署价值有限。研究更多是可行性探索而非系统方案。
中文摘要: 本研究针对土耳其语诈骗电话检测在低资源语言环境下的难题,指出当前检测研究几乎完全聚焦于英语等高资源语言,而土耳其语面临标注数据稀缺和技术防御有限的困境。作者探索了大型语言模型(LLMs)在土耳其语诈骗检测中的应用潜力,并首次公开了一个包含100对对齐音频-文本的多模态数据集,为该语言领域的诈骗检测研究提供了基础资源。该工作旨在填补土耳其语电话诈骗检测的数据与方法空白,推动低资源语言场景下的安全防护研究。
Scam phone calls exploit vulnerable communities worldwide, yet research on detection has focused almost exclusively on English and other high-resource languages. In low-resource settings such as Turkish, detection is especially difficult, as annotated data is scarce and technological defenses remain limited. This research investigates how large language models (LLMs) can support scam detection in Turkish by introducing the first public multi-modal dataset of 100 aligned audio-transcript pairs of
21. Digital Revival: Acoustic Documentation and Digital Reactivation of Historical Woodwind Instruments
Authors: Lior Arbel, Itai Weissman
Categories: eess.AS | 10 pages, 3 figures, presented at the International Symposium on Musical Acoustics (ISMA 2026), Helsinki, Finland. To appear in Proceedings of Meetings on Acoustics (POMA)
Score: 5.5/10 (Obj:2 Id:6 Ind:6 Comp:5 Eff:6 Nov:6)
- 优势: 对无法演奏的历史乐器进行声学数字化保存,跨学科价值高——结合声学测量、数字建模和虚拟演奏,为博物馆藏品提供了可交互的数字化方案。项目框架(测量→建模→仿真→验证)系统性好,对历史音乐研究和演奏实践有文化意义。
- 劣势: 偏声学/数字人文而非ML,对音频机器学习社区贡献有限。研究对象非常小众——历史木管乐器的声学数字化保存只与极少数博物馆和音乐学者相关,动机分受限。方法更偏物理建模而非数据驱动。
中文摘要: 本研究针对历史木管乐器因材质脆弱、老化及严格的馆藏保护要求而无法演奏,导致其声学特征记录严重不足的核心问题,提出了一套声学文档化与数字化激活相结合的研究框架。项目通过声学测量、数字建模与可演奏复制品的协同方法,对馆藏历史木管乐器进行系统性的声学特征采集与分析,在不接触或最小化接触原器的条件下还原其声学身份。该工作为声学研究与历史演奏实践之间搭建了桥梁,使这些无法直接演奏的乐器能够在当代被重新听见与研究。
Historical woodwind instruments exhibit complex acoustic behaviors that are central to their musical, organological, and cultural significance. However, due to material fragility, aging, and strict conservation requirements, many original instruments held in museum collections can no longer be played. As a result, their acoustic identity remains insufficiently documented, limiting both acoustical research and historically informed performance practice. Digital Revival is an ongoing research proj
22. Statistical validation and full-sphere extension of a Bayesian model for human static sound localisation
Authors: Roberto Barumerli, Fabian Brinkmann, Emanuele Zanoni, Anton Hoyer, Lorenzo Picinali et al.
Categories: cs.SD, stat.AP | 16 pages, 6 figures, 3 supplementary figures; submitted to Acta Acustica (special issue on Spatial and Binaural Hearing: From Neural Processes to Applications)
Score: 5.2/10 (Obj:3 Id:7 Ind:6 Comp:6 Eff:5 Nov:5)
- 优势: 用严谨的统计方法替代启发式验证声源定位模型——推导了显式似然函数,通过参数恢复和模型拟合验证了贝叶斯声源定位模型。将模型从赤道平面扩展到全球面,方法学贡献对空间听觉研究有意义。
- 劣势: 偏心理物理/声学而非ML,应用面较窄——声源定位模型的统计验证主要服务于听觉科学研究者。全球面扩展虽然完整但增量,核心模型框架未变。研究对象小众,做空间听觉建模的研究者很少,动机分受限。
中文摘要: 本文针对听觉空间定位模型普遍依赖启发式指标而非统计方法进行验证的问题,对一种联合利用含噪感知特征与个体头部相关传递函数(HRTFs)来推断声源方向的贝叶斯声音定位模型进行了统计验证与扩展。作者首先推导出显式似然函数,并通过在模拟数据上的参数恢复实验和模型拟合来验证该似然函数的有效性。其次,将原模型从有限方向域扩展至全空间(full-sphere)定位,使其能够处理来自任意方向的声源。该工作为空间听觉模型提供了基于概率的严格验证范式,并将贝叶斯推断框架的适用范围拓展到更贴近真实听环境的全向定位场景。
Auditory models are central tools for studying spatial hearing, yet their validation typically relies on heuristic performance metrics rather than principled statistical methods. We present two contributions building on a Bayesian sound localisation model that jointly infers sound direction from noisy perceptual features and individual head-related transfer functions (HRTFs). First, we derive an explicit likelihood function and validate it through parameter recovery on simulated data and fitting
23. The effect of micro-changes in the pluck trajectory on the sound of an acoustic guitar
Authors: Marek Pluta, Jan Jasiński, Daniel Tokarczyk, Julia Grygiel
Categories: eess.AS, cs.SD | Published in Vibrations of Physical Systems
Score: 5.1/10 (Obj:3 Id:5 Ind:6 Comp:5 Eff:5 Nov:6)
- 优势: 机器人拨弦实验精确控制变量——用最先进的机器人拨弦器以192微米步长改变拨弦深度,揭示了微米级位置变化对音色(响度、音色、谐波含量、衰减过程)的系统影响。实验设计严谨,变量控制比人类拨弦实验好得多。
- 劣势: 纯声学测量研究,缺乏ML方法贡献——论文关注的是吉他音色与拨弦参数的物理关系,不涉及任何建模或学习。研究受众非常小众(吉他声学/乐器制作研究者),对音频ML社区贡献有限。结论更多是测量数据而非可迁移洞察。
中文摘要: 本研究探讨了吉他拨片运动轨迹的微小变化如何影响原声吉他的音色。研究者使用先进的机械拨弦装置进行了一系列测量,通过每次192微米的步进逐渐增加拨弦深度,系统分析这些微小变化对音量、音色、谐波含量以及声音衰减过程的影响。该研究方法为理解拨弦细节与吉他声学特性之间的关系提供了精确的实验数据支持。
This study explores how micro-changes in the plucking trajectory of a guitar pick influence the sound of an acoustic guitar. Using a state-of-the-art robotic plucker, a series of measurements has been performed, where the plectrum was moved towards the instrument by a step of 192 micrometers, resulting in an increased attack depth. It has been analysed how the effect of these changes is reflected in loudness, timbre, harmonic content and how the sound progresses during decay. This methodology ha
24. Perceptual Evaluation of Higher-Order Ambisonic Codecs on Both Synthetic Mixing and Native Recordings
Authors: Adrien Llave, Grégory Pallone, Jérôme Daniel
Categories: eess.AS | Submitted to the AES 2026 International Conference on Audio for Virtual and Augmented Reality and Immersive Games (AVARIG)
Score: 5.6/10 (Obj:4 Id:6 Ind:7 Comp:5 Eff:6 Nov:5)
- 优势: 对高阶Ambisonics编解码器进行了系统性的感知评测,同时覆盖了合成混音和原生录音两种场景,这是空间音频社区需要的参考数据。评测方法论严谨,对比了IVAS等标准化编解码方案在不同阶数下的质量退化规律。
- 劣势: 纯声学工程评测论文,没有任何ML方法贡献。研究对象非常小众——HOA编解码器的感知质量优化只与空间音频压缩标准相关,做这个方向的研究者很少。结论更多是工程参考而非科学洞察。
中文摘要: 该论文针对虚拟/增强现实与沉浸式游戏等应用中空间音频的传输需求,研究了高阶Ambisonic(HOA)格式的压缩编码问题,由于3阶Ambisonics需要16个声道,导致存储与通信开销显著增大。作者以最新标准化的IVAS编解码器为主要对象,从感知质量角度系统评估了多种HOA编解码方案的性能。实验同时采用了合成混音与原生录音两类素材,以更全面地考察不同编解码器在真实场景下的空间保真度与音质表现。研究结果揭示了各编解码器在不同素材类型下的性能差异,为沉浸式音频压缩算法的选择与未来优化提供了实证依据。
Spatial audio is spreading in applications such as virtual and augmented reality and immersive games. The higher-order ambisonic (HOA) format is particularly useful in this context. Transmitting spatial information requires multiple channels, e.g., 16 channels for 3rd-order ambisonics, resulting in increased memory requirements for storage and higher bitrates for communication. Therefore, efficient compression algorithms are necessary for those contents. The recently standardized IVAS codec allo
25. A Fusion-Aware Two-Stage Framework for Mispronunciation Detection and Diagnosis in Low-Resource Modern Standard Arabic
Authors: Jing Yang, Shuqing Zhang, Yongyi Deng, Pan Li, Ting Dang et al.
Categories: eess.AS, cs.SD | Accepted to Interspeech 2026
Score: 5.7/10 (Obj:3 Id:6 Ind:7 Comp:5 Eff:7 Nov:4)
- 优势: 解决了阿拉伯语发音检测中数据稀缺和合成-真实域差距问题,两阶段策略(先学通用映射再微调)在低资源场景下是合理的设计选择。预训练编码器+因果膨胀卷积的组合保留了细粒度音素变化。
- 劣势: 方法偏工程堆叠,两阶段级联+预训练+膨胀卷积是MDD领域的标准做法。发音检测在英语中已有大量工作,扩展到阿拉伯语是合理的语言迁移但非本质创新。阿拉伯语MDD的用户群体非常有限,动机分不高。
中文摘要: 这篇论文针对现代标准阿拉伯语(MSA)发音错误检测与诊断(MDD)中数据稀缺和合成-真实域差距的问题,提出了一个两阶段端到端框架。该框架将预训练编码器与因果膨胀时序卷积网络相结合,以保留细粒度的语音变化特征。在训练策略上,采用分层两阶段方法,先从原生和合成语料中学习通用映射,再适应目标域进行微调。实验结果表明,该方法在低资源阿拉伯语MDD任务上有效提升了音素识别和错误诊断的准确率。
Accurate phoneme recognition is pivotal for mispronunciation detection and diagnosis (MDD) in modern standard Arabic (MSA), yet remains constrained by data scarcity and the synthetic-real domain gap. This work proposes a two-stage end-to-end framework. It integrates a pre-trained encoder with causal dilated temporal convolutional networks to preserve fine-grained phonetic variations. A hierarchical two-stage strategy first learns general mappings from native/synthetic corpora, then adapts to sca
26. video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding
Authors: Yixuan Li, Guangzhi Sun, Yudong Yang, Wei Li, Zejun MA et al.
Categories: cs.CV, cs.AI, cs.SD
Score: 6.3/10 (Obj:5 Id:6 Ind:8 Comp:6 Eff:7 Nov:5)
- 优势: 提出两阶段视频理解范式(先粗看定位再细看回答),ReWatch-ReAsk-ReAnswer的迭代设计比单次推理更符合人类视频理解过程。在计算受限场景下通过动态分配算力实现高效理解。
- 劣势: 两阶段coarse-to-fine范式在视频理解中已有先例,R³的迭代机制本质是多轮推理的工程化实现。论文偏视频理解,音频只是辅助模态,对音频领域贡献有限。三个R操作的独立贡献缺乏严格消融。
中文摘要: 视频大语言模型在计算与内存预算受限时,往往通过降低帧率和空间分辨率来节省开销,从而可能遗漏问答所需的关键信息。本文提出 video-SALMONN-R³,首次将”重看、重问、重答”(ReWatch、ReAsk、ReAnswer)的三阶段框架融入视频理解流程:先以粗粒度对整段视频进行整体理解并定位相关片段,再以更高时间或空间保真度重新观看这些片段,并据此重新提问与作答。该方法通过自我迭代的多轮交互,在不显著增加推理开销的前提下提升了关键信息的捕获能力。实验表明,video-SALMONN-R³ 在多个视频问答基准上取得了优于或可比的性能,同时保持了较高的计算效率,为资源受限场景下的视频理解提供了一种兼顾精度与成本的实用范式。
Video large language models (LLMs) are often constrained by computation and memory budgets, leading them to use reduced frame rates and spatial resolutions, which may cause them to miss critical information for question answering (QA). A practical and efficient solution is a two-stage paradigm: first perform coarse video understanding to localize relevant segments, and then re-watch these segments at higher temporal or spatial fidelity. In this paper, we present video-SALMONN-R$^3$, the first en
27. NeuroSonic: Conditional Flow Matching for EEG-to-Speech Reconstruction
Authors: Wenhao Gao, Yifan Wang, Yijia Ma, Carl Yang, Wen Li et al.
Categories: cs.LG | Accepted by MICCAI 2026
Score: 5.5/10 (Obj:4 Id:6 Ind:7 Comp:6 Eff:5 Nov:6)
- 优势: 用CFM替代回归方法解决EEG语音重建的不稳定性问题,方法选择合理——流匹配的渐进生成比直接回归更适合处理EEG到语音这种极端异质映射。条件设计考虑了artifact依赖和被试变异性。
- 劣势: EEG语音重建的根本瓶颈(信噪比太低、空间分辨率不足)未被突破,重建质量仍有限。从EEG到语音的映射本身可行性存疑——即使CFM也不能弥补输入信息的严重不足。被试数量少,跨被试泛化未验证。
中文摘要: 从头皮脑电图(EEG)重建连续语音面临根本性挑战:EEG信号微弱、空间弥散且变异性大,而语音是具有强谐波与时序结构的连贯声学轨迹,两者间的失配使波形回归不稳定、多步生成对伪迹条件和被试差异高度敏感。针对该问题,本文提出NeuroSonic,一种基于条件流匹配(Conditional Flow Matching)的EEG到语音重建框架,利用流匹配的单步确定性轨迹来规避随机多步采样对条件噪声的放大。方法上通过对齐EEG条件向量与语音声学流形,在连续时间下学习从噪声到目标波形的确定性传输路径,从而抑制伪迹依赖与被试间漂移。实验表明,该框架在合成语音可懂度与频谱保真度上优于先前基于扩散或回归的重建方法,并对跨被试场景展现出更好的鲁棒性。整体而言,NeuroSonic验证了条件流匹配在神经信号到语音这一弱条件强结构生成任务中的适用性,为非侵入式语音脑机接口提供了新的生成范式。
Reconstructing continuous speech from scalp electroencephalography (EEG) remains fundamentally challenging. EEG provides a weak, spatially diffuse, and highly variable measurement of distributed cortical activity, whereas speech is organized as a coherent acoustic trajectory with strong harmonic and temporal structure. The resulting mismatch makes waveform regression unstable and causes stochastic multi-step generation to be sensitive to artifact-dependent conditioning and subject variability. W
28. A Multi-Stage Separation-and-Classification Framework Guided by Complementary Acoustic-to-Semantic Clues
Authors: Younghoo Kwon, Junwoo Park, Han Yin, Jung-Woo Choi
Categories: eess.AS | 5 pages, 3 figures, DCASE challenge 2026 Technical report
Score: 5.4/10 (Obj:4 Id:5 Ind:7 Comp:4 Eff:7 Nov:3)
- 优势: 为DCASE 2026 S5任务提供了完整的系统方案,声学到语义的互补线索设计让分离和分类互相增强。注册语音和声学特征的跨阶段传播是合理的工程选择。
- 劣势: 挑战赛系统论文,多阶段级联是典型的工程堆叠——每阶段加一个分离+分类模块并传递线索,方法创新有限。系统设计为特定挑战赛优化,泛化性未知。缺乏对级联为何优于端到端的因果分析。
中文摘要: 本文针对 DCASE 2026 挑战赛任务 4(声学场景的空间语义分割,S5)提出了一种多阶段分离与分类耦合框架,每个阶段将分离模型与分类模型协同工作以逐步提升目标估计精度。第一阶段直接对多通道混合信号进行声源分离与分类,其输出随后作为两类互补线索(包括基于 enrollment 的语义提示)传递到下一阶段,用以引导和细化后续阶段的目标分离与识别。该框架通过分离与分类之间的互补反馈机制,在多阶段迭代中持续精炼每个目标的估计结果,从而应对复杂声学场景中多声源空间语义分割的难题。整体方法以多通道空间信息与语义线索的协同利用为核心,旨在提升声音事件在空间与语义层面的联合分割性能。
This report describes the system proposed for the DCASE 2026 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes (S5). Specifically, we develop a multi-stage framework in which each stage couples a separation model with a classification model. The first stage performs source separation and classification directly on the multi-channel mixture. Its outputs are then propagated to the following stage as two complementary clues that progressively refine each target estimate: (i) an enroll