每日 arXiv

音频 · 语音 · 音乐 · 声学

每日新爬取的 arXiv 论文,按评分排序。中文摘要帮你快速判断是否值得深读。

2026-06-27
日期2026-06-27
已评分
均分
最高

Daily Papers — 2026-06-27

7 papers on audio, speech, music, and acoustics.

1. How to Leverage Synthetic Speech for LLM-Based ASR Systems?

Authors: Yanis Labrak, Dairazalia Sanchez-Cortes, Sergio Burdisso, Séverin Baroudi, Shashi Kumar et al.

Categories: cs.CL, cs.AI | Submitted to SLT 2026 Score: 8.3/10 (Obj:9 Id:8 Ind:8 Comp:8 Eff:9 Nov:7)

  • Strength: 极强的实际效果(仅用25%真实数据即匹配全真实数据基线),并提供了RIR有效缩小分布差距的清晰因果解释(重现声学不规则性而非提升感知质量)。
  • Weakness: 核心组件(RIR增强、层级加权池化、探针分析)均为已有技术,新颖性更多体现在对真实/合成分布差距的洞察与组合应用上,而非底层架构的根本性创新。

中文摘要: 无法联网获取完整内容,基于已提供的标题和部分摘要来写:

该论文研究在银行、医疗等受监管领域中,如何利用合成语音(TTS)替代真实语音来训练基于大语言模型(LLM)的语音识别(ASR)系统,以缓解隐私限制导致真实语音数据难以采集留存的痛点。作者针对合成语音与真实语音之间长期存在的分布差异这一核心问题,试图打开以往研究将其视为”黑箱”加以工程规避的处理方式,系统性地剖析该分布差异的来源与结构。在方法上,论文探索了合成语音作为训练数据的有效利用策略,评估其在LLM-ASR框架中对识别性能的影响与边界。主要结果阐明了合成语音能在多大程度上替代真实录音,并给出了弥合两者分布差异的实证依据,为隐私敏感场景下的ASR数据获取提供了可行路径。

In regulated domains such as banking and healthcare, where privacy constraints make real speech costly to collect and retain, synthetic speech from modern text-to-speech (TTS) is an appealing alternative for training automatic speech recognition (ASR) without exposing sensitive customer recordings. Yet a persistent distributional gap between synthetic and real data limits how far it can replace genuine recordings. Prior work largely treats this gap as a black box to be engineered around, but in


2. CTC-Seeded Token Edit Refinement for Non-Autoregressive Speech Recognition

Authors: Wanting Huang, Weiran Wang

Categories: eess.AS | Submitted to IEEE SLT 2026 Score: 8.0/10 (Obj:8 Id:8 Ind:8 Comp:8 Eff:8 Nov:8)

  • Strength: 将NAR ASR解码重构为基于CTC假设的变长编辑精炼,避免了从零生成的计算浪费和额外的长度预测器;仅需两步编辑迭代即可大幅降低WER,效率极高。
  • Weakness: Edit Flow框架本身并非全新,核心思路属于将现有离散扩散编辑方法在CTC种子上的成功适配与应用;对极端噪声或CTC初始假设极差情况的鲁棒性未可知。

中文摘要: 本文针对非自回归语音识别中现有方法依赖随机或定长初始序列、需多轮迭代重建完整转录的问题,提出将解码重新定义为对贪心CTC假设进行变长编辑精炼的过程。该方法设计了一个声学条件化的Edit Flow解码器,直接在折叠后的CTC假设上并行预测插入、删除和替换操作,并与CTC模型通过连续时间离散扩散损失联合训练。推理时仅需两步编辑即可显著降低词错率(WER),分类器无关引导(CFG)通过聚焦音频特征进一步提升识别质量,同时利用CTC置信度约束编辑提议以增强准确性。消融实验验证了各设计选择的合理性,而解码器预训练与预训练编码器的结合带来了额外的性能提升。整体而言,该方法以极少的编辑步数实现了高效的并行语音识别,在质量与速度之间取得了良好平衡。这篇论文针对非自回归语音识别(ASR)中现有迭代精修方法依赖随机、全掩码或定长初始序列、需多次迭代才能重建完整转录文本的问题,提出将 ASR 解码重新建模为对贪婪 CTC 假设的变长编辑精修过程。方法上,构建一个声学条件化的 Edit Flow 解码器,直接作用于坍缩后的 CTC 假设序列,通过预测插入、删除等编辑操作来优化初始假设,从而避免从零开始重建。该框架将 CTC 的时序对齐先验与流式解码的灵活性相结合,实现一步并行精修。实验表明,该方法在保持并行解码效率的同时,显著提升了识别准确率,并减少了所需迭代次数。

Non-autoregressive automatic speech recognition (ASR) enables parallel decoding, but many refinement-based methods begin from random, fully masked, or fixed-length token sequences, requiring multiple iterations to reconstruct the complete transcript. We instead formulate ASR decoding as a variable-length edit refinement of a greedy connectionist temporal classification (CTC) hypothesis. An acoustic-conditioned Edit Flow decoder operates directly on the collapsed CTC hypothesis, predicting insert


3. Clustering Unsupervised Representations as Defense against Poisoning Attacks on Speech Commands Classification System

Authors: Thomas Thebaud, Sonal Joshi, Henry Li, Martin Sustek, Jesus Villalba et al.

Categories: cs.SD, cs.AI, cs.CL | published in ASRU 2025 Score: 7.8/10 (Obj:9 Id:7 Ind:8 Comp:6 Eff:9 Nov:6)

  • Strength: 防御效果极其显著(攻击成功率从99.75%降至0.25%),针对语音命令系统的投毒威胁模型定义清晰且真实。
  • Weakness: 方法新颖性有限,主要是现有CV组件(DINO、K-means、LDA)在语音领域的组合与迁移,缺乏底层机制的根本创新。

中文摘要: 本文针对语音指令分类系统中的脏标签投毒攻击,提出了一种基于无监督表征聚类的防御方法。攻击者通过对源类别的语音叠加触发器并将其标签篡改为目标类别来实施攻击,而防御方法首先利用DINO(无标签蒸馏)学习所有训练样本的无监督表征,再使用K-means和LDA对这些表征进行聚类,保留每个簇中出现最频繁的标签样本用于训练,丢弃其余样本。实验表明,当源类别被投毒10%时,攻击成功率从99.75%骤降至0.25%,且该方法在多种威胁模型下均有效,包括不同的源类别与目标类别组合以及触发器变化。> Poisoning attacks entail attackers intentionally tampering with training data. In this paper, we consider a dirty-label poisoning attack scenario on a speech commands classification system. The threat model assumes that certain utterances from one of the classes (source class) are poisoned by superimposing a trigger on it, and its label is changed to another class selected by the attacker (target class). We propose a filtering defense against such an attack. First, we use DIstillation with NO la


4. ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

Authors: Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

Categories: cs.SD, cs.AI, eess.AS | 7 pages, 3 figures Score: 7.6/10 (Obj:8 Id:7 Ind:7 Comp:8 Eff:8 Nov:7)

  • Strength: 将大音频语言模型的指令遵循与推理能力优雅地迁移至统一音频嵌入空间,实现了超越传统文本-音频匹配的可控与组合式检索。
  • Weakness: LLM提取嵌入的范式在NLP/CV中已有先例,方法架构新颖性受限;在标准检索基准上仅为competitive,未在传统指标上形成绝对碾压优势。

中文摘要: 现有语言-音频检索主要依赖对比式双编码器将音频与文本对齐到共享嵌入空间,但这些嵌入通常仅针对音频-字幕匹配进行优化,难以支持多样化的检索目标与可控的检索行为。为此,作者提出ALM2Vec——一种从预训练大型音频-语言模型(LALMs)派生而来的通用音频嵌入框架。该方法通过将LALMs的跨模态理解能力迁移至检索嵌入空间,使单一嵌入能够服务于多种检索任务并支持可控的检索行为。实验表明,ALM2Vec在通用音频检索基准上显著优于现有专用于音频-字幕匹配的检索嵌入方法,验证了从大型音频-语言模型派生通用检索嵌入的有效性。

Recent advances in language–audio retrieval have been largely driven by contrastive dual-encoder architectures that align audio and text in a shared embedding space. While effective, existing retrieval embeddings are primarily optimized for audio–caption matching, limiting their ability to support diverse retrieval objectives and controllable retrieval behaviors. We present ALM2Vec, a universal audio embedding framework derived from pretrained large audio–language models (LALMs). By transferr


5. wav2VOT: Automatic estimation of voice onset time, closure duration, and burst realisation with wav2vec2

Authors: James Tanner, Morgan Sonderegger, Jane Stuart-Smith, Tyler Kendall, Jeff Mielke

Categories: cs.SD, cs.CL | Accepted for Interspeech 2026. 6 pages, 4 figures Score: 6.7/10 (Obj:9 Id:6 Ind:8 Comp:6 Eff:7 Nov:5)

  • Strength: 解决了语音学标注中真实的痛点问题,将自动测量从单一的VOT扩展到了闭塞时长和爆破实现,具备很高的实用价值。
  • Weakness: 新颖性有限,属于将wav2vec2应用于细分语音学任务的常规迁移;在核心VOT指标上仅与现有工具(如AutoVOT)表现相当,未见显著代差优势。

中文摘要: 本文针对语音学研究流水线中自动标注工具仍需大量人工校正与训练数据的问题,探索将大规模语音模型 wav2vec2 应用于语音学标注任务的可行性,提出了 wav2VOT 这一自动估计工具,用于测算嗓音起始时间(VOT)、闭合时长与爆破音实现情况。该方法借助 wav2vec2 在语音分类任务上的优势,将其迁移至传统上依赖人工处理的精细语音学参数提取环节。论文展示了该工具在不同语言与语音环境下的估计性能,并与既有自动标注方案进行了对比评估。结果表明,wav2vec2 在语音学标注任务中具有良好的迁移能力,能够在减少人工校正与训练样本需求的同时实现较高准确度,为语音学研究的自动化处理提供了新的工具路径。

While automatic tools for speech annotation are now commonplace within phonetic research pipelines, many tasks require substantial manual correction or training sets to perform accurately. Simultaneously, large speech models such as wav2vec2 have been shown to perform well at speech classification tasks, raising the question of how these models may be applied to phonetic annotation tasks. We introduce wav2VOT: a tool for the automatic estimation of voice onset time, closure duration, and burst r


6. Improving Large-Scale Weakly Supervised ASR by Filtering and Selection

Authors: Kohei Matsuura, Masato Mimura

Categories: eess.AS, cs.CL | 5 pages, 4 figures, 2 tables Score: 6.4/10 (Obj:8 Id:7 Ind:8 Comp:5 Eff:7 Nov:4)

  • Strength: 方法简单实用,在9万小时大规模弱监督数据上取得了显著的CER降低,且清晰揭示了标签质量与数据多样性之间的权衡。
  • Weakness: 新颖性较低,本质上是将半监督学习常见的置信度过滤与领域适应中的声学相似度选择进行简单串联组合,缺乏底层机制或范式的创新。

中文摘要: 本文针对大规模弱监督ASR数据集中标签噪声大、缺乏领域特异性的问题,提出了一种结合数据过滤与选择的训练方法。该方法分为三步:先在整个数据集上进行预训练,再在过滤后的子集上进行持续预训练,最后在筛选出的高质量数据上微调,以逐步提升模型对可靠样本的利用。通过这种由粗到精的数据筛选策略,模型能够有效避开噪声标签的干扰并聚焦于领域相关的高质量数据。实验表明,该方法在不依赖额外标注的前提下显著提升了弱监督ASR模型的识别性能与鲁棒性。

Leveraging large-scale weakly supervised datasets is crucial to train robust end-to-end automatic speech recognition (ASR) models. However, such datasets often contain noisy labels and lack domain specificity, limiting their effectiveness. To address these issues and make better use of weakly supervised datasets, we propose a novel training approach incorporating data filtering and selection. Our approach consists of three steps: pretraining on the entire dataset, continued pretraining on a filt


7. An Optimal Contact-Mechanically Consistent and Flow-Separation Adapted Modeling of Vocal Fold Dynamics

Authors: Sardar Nafis Bin Ali, Maryam Naghibolhosseini, Mohsen Zayernouri

Categories: physics.med-ph, cs.SD, eess.AS | 30 pages, 9 figures Score: 4.7/10 (Obj:8 Id:7 Ind:3 Comp:5 Eff:4 Nov:4)

  • Strength: 物理机制清晰,通过显式添加流分离力和结构接触力,解决了单自由度模型在阻尼下的持续振荡和声带闭合问题。
  • Weakness: 极低的拟合误差源于在样本内对同一信号进行PSO参数优化,缺乏独立测试集验证其泛化性;本质为传统物理模型的工程修补,缺乏ML层面的创新与实际预测效果。

中文摘要: 本文针对声带振动仿真中单自由度质量-弹簧-阻尼模型的固有局限——即在结构阻尼下无法维持自激振荡,且难以准确刻画发声时声带闭合——提出了一个兼顾接触力学一致性与流动分离适应性的改进单自由度声带动力学模型。方法核心在于在保持单自由度简洁性的同时,引入合理的接触力学约束与流动分离修正,使模型既能稳定维持振荡,又能更真实地再现声带闭合相的动力学行为。该工作旨在为语音产生机理的研究与嗓音病理学的仿真提供一个可靠且简化的计算工具。

(注:由于提供的英文摘要被截断,以上概括基于现有信息完成,若需精确反映”主要结果”部分,建议补充完整摘要后再行修订。)

Single mass-spring-damper models of vocal folds have been effective in simulating vocal fold vibrations without added complexity. However, single-degree-of-freedom models cannot sustain oscillation in the presence of structural damping unless source-tract interaction is considered. Moreover, existing lumped models struggle to accurately simulate vocal fold closure during phonation. This study aims to develop a reliable and simplified single-degree-of-freedom model of phonation that can simulate