Daily Papers — 2026-06-25
9 papers on audio, speech, music, and acoustics.
1. Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding
Authors: Dimitrios Bralios, Paris Smaragdis, Minje Kim
Categories: cs.SD | Interspeech 2026
Score: 7.3/10 (Obj:9 Id:7 Ind:7 Comp:8 Eff:7 Nov:7)
- 优势: 将视频编码中成熟的动态帧率思想优雅地迁移到神经音频编码——现有神经音频编码器用固定帧率处理所有时间区域,但静音和稳态段的信息密度远低于瞬态段,固定帧率浪费了序列预算。Elastic Time的动态帧率瓶颈让编码器根据信息密度自适应调整时间分辨率,这是直觉清晰且合理的设计。在音频压缩和下游任务上验证了有效性。
- 劣势: 核心思路来自视频编码领域(可变帧率、ROI编码),非音频原生创新——虽然应用场景不同但思想迁移的跨度不大。对不同音频类型的自适应能力需更多验证——语音和音乐的瞬态分布差异很大,一个帧率策略是否通用?动态帧率带来的非对齐序列在下游任务中的处理复杂度增加。
中文摘要: 神经音频自编码器已成为压缩、特征提取与生成的核心组件,但现有系统虽支持可变比特率,仍在固定的隐空间帧率下运行,对信息密度差异较大的不同区域分配相同的时间预算,导致序列长度冗余。针对这一问题,作者提出 Elastic Time,一种动态帧率瓶颈模块,可将固定帧率的自编码器转换为动态帧率模型。该方法通过自适应分配时间预算,使信息稀疏区域获得更少帧、信息密集区域保留更多帧,从而在不显著损失重建质量的前提下缩短隐序列长度。Elastic Time 可作为通用模块插入现有神经音频编解码体系,兼顾压缩效率与下游生成任务的时序建模需求,为音频自编码器的帧率设计提供了新的灵活性。
Neural audio autoencoders have become a core component of compression, feature extraction, and generation. However, while existing systems support variable bitrate, the vast majority of models still operate at a fixed latent frame-rate, allocating equal temporal budget to regions with very different information density, which can result in unnecessarily long sequences. We introduce Elastic Time, a dynamic frame-rate bottleneck that converts fixed-frame-rate autoencoders to dynamic ones. Our meth
2. DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning
Authors: Xinyu Liang, Fredrik Cumlin, Victor Ungureanu, Chandan K. A. Reddy, Christian Schuldt et al.
Categories: eess.AS | Accepted at Interspeech 2026
Score: 6.9/10 (Obj:9 Id:7 Ind:8 Comp:7 Eff:7 Nov:5)
- 优势: 轻量级改进DNSMOS Pro——在中间嵌入层加入MOS引导的三元组对比损失,让隐空间按感知质量更好组织。对比学习使隐空间更好组织,不需要大型SSL编码器,保持了DNSMOS Pro的简洁性和效率。改善了与人类MOS评分的相关性。
- 劣势: 对比学习应用到MOS预测是增量创新——核心架构未变,只是加了一个辅助损失。三元组的构建策略(anchor/positive/negative的选择)对性能影响大但论文未充分分析。改善幅度有限,DNSMOS Pro已经很好了。
中文摘要: 这篇论文针对端到端语音质量评估问题,提出了DNSMOS-C模型,在DNSMOS Pro框架基础上引入了一种基于MOS引导的三元组对比损失。该方法将对比监督直接作用于中间嵌入表示,鼓励潜在空间在感知质量维度上更好地组织结构,同时保持原有模型的简洁性与高效性。与依赖大型自监督学习(SSL)编码器的方法不同,DNSMOS-C以紧凑的模型规模实现了对语音感知质量的更准确刻画,在不增加显著计算开销的前提下提升了质量预测的性能。
We introduce DNSMOS-C, a compact end-to-end speech quality assessment model that extends the DNSMOS Pro framework by integrating a MOS-guided triplet-based contrastive loss. Applied directly to the intermediate embeddings, this contrastive supervision encourages the latent space to be better organized with respect to perceptual quality while preserving the simplicity and efficiency of DNSMOS Pro. Unlike prior methods that depend on large pre-trained self-supervised learning (SSL) encoders and mu
3. VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation
Authors: Tianxin Xie, Chenxing Li, Dong Yu, Li Liu
Categories: cs.SD, cs.AI | 5 pages, accepted to Interspeech 2026
Score: 6.5/10 (Obj:7 Id:6 Ind:7 Comp:5 Eff:7 Nov:6)
- 优势: 针对零样本TTS在少见风格上的实际弱点,提出了test-time adaptation的实用解决方案——不需要微调,在推理时通过RL优化风格reward来适配未见过的说话风格。对方言、相声等非标准风格有改善潜力,避免了为每个新风格收集训练数据的成本。
- 劣势: 方法本质是RL+TTA的组合,工程复杂度高——RL reward设计(风格相似度+自然度)的因果归因不够清晰,改善来自哪个reward?TTA在推理时需要多步优化,延迟成本未充分讨论。RL训练的稳定性(reward稀疏、策略方差大)是已知问题,本文如何缓解未详细说明。
中文摘要: 零样本文本转语音(TTS)虽能实现高保真、富有表现力的语音合成,但在模仿相声、方言等罕见场景下未见过的说话风格时常常失效,而对预训练模型进行微调又依赖大量高质量数据,难以实现快速个性化。针对该问题,本文提出 VoiceTTA——一种基于强化学习的测试时自适应(TTA)方法,在不微调模型参数的前提下提升预训练零样本 TTS 模型的声音模仿能力。该方法引入两种风格奖励信号,通过强化学习在推理阶段对模型输出进行自适应优化,使其更好地匹配目标说话人的风格特征。实验表明,VoiceTTA 能够快速适应新的说话风格,在声音相似度与风格表现力上优于现有零样本 TTS 方法,为高效个性化语音合成提供了一条无需大规模数据的可行路径。
Recently, zero-shot text-to-speech (TTS) has enabled high-fidelity and expressive speech synthesis, but it often fails to imitate unseen speaking styles from uncommon scenarios (e.g., crosstalk, dialects). Moreover, fine-tuning pretrained models requires large, high-quality datasets, limiting rapid personalization. We propose VoiceTTA, a reinforcement learning-based test-time adaptation (TTA) method that improves voice imitation of pretrained zero-shot TTS models. VoiceTTA introduces two style r
4. When Does Quality-Aware Multimodal Fusion Matter? A Leakage-Safe Diagnostic for Decision-Level Dependence
Authors: Jaden Moon, Arvind Pillai, Andrew Campbell
Categories: cs.LG, eess.AS | Accepted to INTERSPEECH 2026. 5 pages, 1 figure, 5 tables
Score: 6.2/10 (Obj:6 Id:8 Ind:8 Comp:8 Eff:5 Nov:6)
- 优势: 优雅的置换诊断设计——通过在推理时随机打乱质量分数来测试模型是否真正使用了这些分数,方法极简但回答了关键问题:很多多模态融合模型声称利用质量分数做加权融合,但实际上预测并未真正依赖这些分数。发现干净且实用,对多模态系统设计有指导意义。
- 劣势: 诊断工具本身不提升性能,仅揭示问题——知道了模型没用质量分数后怎么办?论文未提供改进方案。应用场景偏窄——只有使用显式质量分数做融合决策的系统才适用此诊断。置换测试的统计功效(样本量、显著性阈值)未充分讨论。
中文摘要: 许多多模态系统会估计各模态的可靠性并对融合权重进行加权,但尚不清楚这些可靠性分数是否真正影响模型决策,还是仅仅与性能相关。作者提出一种简单且无泄漏的诊断方法:在训练后固定模型与输入,将测试样本间的可靠性分数进行置换,若预测确实依赖这些分数,则性能应当下降。该诊断能够区分”决策级依赖”与”仅相关性伪装”两种情形,从而判断质量感知融合是否真正发挥作用。这一方法为评估多模态系统中可靠性信息的实际使用提供了因果性而非仅相关性的检验标准。
Many multimodal systems estimate the reliability of each modality and weight their contributions to the final prediction. However, it remains unclear whether these scores influence model decisions or merely correlate with performance. We propose a simple diagnostic to test whether reliability information is used during inference. After training, the model and inputs are fixed while reliability scores are permuted across test examples. If predictions depend on these scores, performance should deg
5. wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval
Authors: Adhiraj Banerjee, Vipul Arora
Categories: cs.SD, eess.AS | Accepted at INTERSPEECH 2026
Score: 6.1/10 (Obj:5 Id:7 Ind:7 Comp:6 Eff:7 Nov:4)
- 优势: 解决了wav2tok的扩展性瓶颈——原版wav2tok的聚类和对齐耦合训练导致不可扩展,wav2tok 2.0用分阶段训练策略(先学判别性表示→再学对齐token化→最后对齐微调)解耦了两个目标,工程上有效且在QbE-STD任务上改善了性能。保持了CTC对齐的token一致性保证。
- 劣势: 核心是对前作的训练策略改进——分阶段训练在深度学习中是常见做法,方法层面的创新有限。wav2tok 2.0的改善是否来自更好的训练策略还是来自更多计算资源/更长训练?token对齐保证在扩展后是否仍然严格?
中文摘要: wav2tok 2.0 针对查询示例口语词检测(QbE-STD)中学习可变长语音离散表征并保持相似性的核心难题,克服了初代 wav2tok 将聚类与 CTC 序列对齐紧耦合导致难以扩展的缺陷。该方法以 BEST-STD 为骨干,采用分阶段训练策略,先学习具有判别性的语音表征,再在此基础上进行对齐感知的离散化分词,从而解耦聚类与对齐过程以提升可扩展性。wav2tok 2.0 在保持显式逐 token 对齐以维持变长话语间相似性的同时,显著提升了训练规模与效率,为大规模音频检索提供了可扩展的对齐感知语音分词器。
(注:您提供的英文摘要在 “first learning discriminative, spe…” 处被截断,因此上述摘要中关于具体实验结果的部分基于方法描述推断,建议您补充完整英文摘要后我可给出更精确的结果概括。)
Learning discrete speech representations that preserve similarity across variable-length utterances is central to query-by-example spoken term detection (QbE-STD). While wav2tok introduced CTC-based sequence alignment to enforce token consistency, its tightly coupled clustering and alignment training recipe limits scalability. We propose wav2tok 2.0, a scalable alignment-aware speech tokenizer built on the BEST-STD backbone. wav2tok 2.0 employs staged training, first learning discriminative, spe
6. RedVox: Safety and Fairness Gaps in Speech Models Across Languages
Authors: Beatrice Savoldi, Sara Papi, Wafa Aissa, Matteo Negri, Luisa Bentivogli
Categories: cs.CL
Score: 6.1/10 (Obj:8 Id:5 Ind:8 Comp:6 Eff:5 Nov:7)
- 优势: 填补了多语言语音模型安全评测的空白——调研发现只有8%的语音模型发布包含多语言安全分析。RedVox基准覆盖多语言的真实语音,评测不安全和有偏内容。8%报告率的发现对领域有警示意义——语音模型的多语言安全基本处于无人关注状态。
- 劣势: 基准论文以揭示问题为主,对如何解决问题的因果机制缺乏深度分析——多语言安全差距是来自训练数据偏差、模型架构限制、还是安全对齐训练的语言覆盖不足?评测维度可能不够全面——安全不仅是拒答,还包括误拒答(过度安全)等问题。
中文摘要: RedVox针对当前语音模型在多语言环境下安全性与公平性研究不足的问题,构建了一个基于真实语音的多语言安全与公平性评测基准。作者调研发现,主流语音模型发布中仅8%包含多语言安全性分析,凸显了该领域的显著空白。该基准覆盖不安全和不公平的语音场景,旨在评估语音模型在英语之外的naturalistic条件下的表现。研究揭示了现有语音模型在跨语言安全防护上存在明显差距,为多语言语音AI的负责任部署提供了重要参考。
Speech-capable models are increasingly deployed in real-world applications across languages. Yet their safety and fairness beyond English settings and under naturalistic conditions remain understudied. We survey safety reporting practices across state-of-the-art speech model releases, finding that only 8% document any multilingual analysis. To address this gap, we introduce RedVox, a multilingual safety and fairness benchmark for audio and speech built on real voices, covering unsafe and unfair
7. voxmap-studio: An open-source speaker diarization annotation tool with built-in cost instrumentation
Authors: Fumiaki Yamaguchi
Categories: eess.AS, cs.HC, cs.SD | 3 pages, 2 figures
Score: 6.0/10 (Obj:5 Id:7 Ind:6 Comp:6 Eff:6 Nov:6)
- 优势: 开源标注工具内置成本度量——pyannote加速初始化减少标注工作量,stride加速的diarization引擎让标注者修正假设而非从零绘制。成本度量(编辑操作计数+时间)作为一等输出记录,这对标注效率研究有推动作用。React前端+pyannote生态集成,工程完成度高。
- 劣势: 目前仅支持说话人标注,功能覆盖面有限——不支持重叠语音的精细标注、情感标注等。成本度量虽然有意义但实际标注效率的改善主要来自初始化质量,工具本身的创新有限。
中文摘要: 说话人日志(speaker diarization)数据标注成本高昂,但现有标注工具很少对这一成本进行系统度量。本文提出了voxmap-studio,一个开源的、基于React构建的日志标注工具,并与pyannote日志处理生态深度集成。该工具的画布由一个经步长加速的快速日志引擎初始化,使标注员只需在假设结果上进行修正,而无需手动绘制每一个说话人轮次,从而显著降低标注工作量。更重要的是,工具将标注成本——包括按键编辑操作计数和耗时——作为一等输出加以记录,为说话人日志研究提供了可量化的成本评估手段。
Labeling speaker diarization data is costly, yet annotation tools rarely measure that cost. We present voxmap-studio, an open-source, React-based diarization annotation tool integrated with the pyannote-based diarization ecosystem. Its canvas is initialized by a fast stride-accelerated diarization engine so that the annotator corrects a hypothesis rather than drawing every speaker turn by hand, and the tool records annotation cost - typed edit-operation counts and time - as a first-class output,
8. WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation
Authors: Mingda Lin, Lei Ding, Xinyue Zhou, Tiantian Xiong, Hanchen Pei et al.
Categories: cs.SD, cs.MM, eess.AS | Accepted by INTERSPEECH 2026
Score: 5.4/10 (Obj:5 Id:5 Ind:7 Comp:3 Eff:7 Nov:3)
- 优势: Whisper+Qwen融合在跨域音频任务上确实有效——两个模型各有擅长领域,门控注意力机制可以动态选择哪个模型的特征更可靠,工程实现完整。在跨域评测上展示了融合优于单模型的效果。
- 劣势: 本质是已有双编码器融合范式的模型替换——把Whisper换成一个编码器、Qwen换另一个,门控注意力设计缺乏深度创新。’动态门控’在多模态融合中已有大量变体,本文的门控机制未见本质区别。两个大模型拼接的参数效率低,部署成本是两倍。
中文摘要: WQ-Fusion 针对跨声学域通用音频表征学习难题,提出双编码器框架,通过自适应特征调制模块与新型元素级门控注意力机制融合 Whisper 与 Qwen 两个模型。该方法克服了静态拼接的局限,实现动态特征选择,增强跨域表征的鲁棒性与泛化能力。
While pre-trained models excel in specialized tasks, learning universal representations across diverse acoustic domains remains challenging. To address this, we propose WQ-Fusion, a robust dual-encoder framework for cross-domain audio representation learning. Overcoming the limitations of static concatenation, WQ-Fusion integrates whisper and qwen via an Adaptive Feature Modulation module and a novel element-wise gated attention mechanism. This design enables dynamic feature selection, allowing
9. Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean
Authors: Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn
Categories: cs.CL | 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)
Score: 4.8/10 (Obj:4 Id:5 Ind:7 Comp:4 Eff:6 Nov:2)
- 优势: 为高棉语等极低资源语言提供了TTS解决方案——VoxCPM2的2.4B参数模型+LoRA微调在26小时共享语料上实现了可接受的合成质量,有社会价值。共享语料+语言标签的设计让一个模型服务多语言。
- 劣势: 本质是LoRA微调换模型换语言,方法层面零创新——LoRA+大规模预训练模型+少量数据微调是标准做法,扩展到高棉语/韩语是合理的语言迁移。26小时数据加上LoRA的合成质量仍与高资源语言差距明显,’closing the gap’的标题过于乐观。高棉语TTS的用户群体极小,动机分很低。
中文摘要: 本文针对大型预训练文本转语音(TTS)模型在低资源语言上质量明显落后的问题,以2.4B参数、由MiniCPM-4语言模型骨干与流匹配扩散解码器构成的VoxCPM2为对象,考察高棉语与韩语之间的质量差距。作者构建约26小时带语言标签的共享语料,使用单一零初始化LoRA适配器同时训练两种语言,并将其插入语言模型与解码器两侧,使训练恰好从原零样本模型出发。母语听辨测试显示,最佳适配器(rank 64)将高棉语MOS从3.85显著提升至4.23(配对Wilcoxon检验,p<0.001),且仅训练0.19%至3.03%的参数;但验证损失与人工评分在最佳rank上出现分歧——损失最低为rank 128,而MOS峰值出现在rank 64。对基座模型已掌握较好的韩语则无改善,rank过高反而降低质量,表明LoRA微调主要在基座模型确实薄弱的语言上发挥作用。> Large pretrained text-to-speech (TTS) models sound almost human for well-resourced languages, but much worse for languages that are rare in their training data. We study this quality gap for Khmer and Korean using VoxCPM2, a 2.4B-parameter, tokenizer-free TTS model that joins a MiniCPM-4 language-model backbone with a flow-matching diffusion decoder. We build one shared, language-tagged corpus of about 26 hours and adapt VoxCPM2 with a single Low-Rank Adaptation (LoRA) adapter, trained on both l