每日 arXiv

音频 · 语音 · 音乐 · 声学

每日新爬取的 arXiv 论文,按评分排序。中文摘要帮你快速判断是否值得深读。

2026-06-24
日期2026-06-24
已评分
均分
最高

Daily Papers — 2026-06-24

18 papers on audio, speech, music, and acoustics.

1. Joint Residual Reweighting for Classifier Free Guidance in Flow-Matching Zero-Shot TTS

Authors: Runwu Shi, Yujin Wang, Hongjin Song, Chunxiang Jin

Categories: eess.AS, cs.SD

Score: 8.4/10 (Obj:9 Id:9 Ind:9 Comp:9 Eff:8 Nov:8)

  • 优势: 通过优雅的数学分解揭示了多条件CFG中被忽视的联合残差——当文本和说话人条件独立遮蔽时,标准CFG的联合引导忽略了两个条件的交叉影响。Joint Residual Reweighting无需重训练、无需额外推理成本,仅在推理时重新分配条件权重即可打破文本正确性与说话人相似度之间的固有权衡。在多个零样本TTS基准上验证了有效性,方法简洁到令人信服。
  • 劣势: 方法有效性可能依赖基础模型内部对文本和说话人条件的解耦程度——如果基座模型本身两条件耦合严重,残差重加权可能无法充分解耦。不同模型可能需要调整残差权重,超参敏感性未充分验证。理论分析假设条件独立遮蔽,实际模型中条件间的交互可能更复杂。

中文摘要: 这篇论文研究流匹配零样本文本到语音(TTS)中无分类器引导(CFG)的设计问题:标准CFG对文本和语音提示两类条件进行联合强化,而最近的分支选择式方法分别增强两类条件,往往在文本正确性与说话人相似度之间产生权衡。作者在独立掩码条件下重新审视CFG机制,发现问题的根源在于两类条件引导的残差(条件与无条件预测之差)规模不匹配。为此提出联合残差重加权方法,通过自适应调整两类条件残差的相对权重,平衡文本遵循度与说话人保真度。实验表明该方法在多个零样本TTS基准上同时提升了合成语音的文本准确率与说话人相似度,有效缓解了既有方法的权衡问题。

Classifier-free guidance (CFG) is widely used in flow-matching-based zero-shot text-to-speech (TTS), where generation is typically controlled by two conditions: the target text and a prompt speech signal. Standard CFG strengthens these conditions jointly, while recent branch-selective guidance methods attempt to enhance text or speaker conditioning separately, often leading to a trade-off between text correctness and speaker similarity. In this paper, we revisit the CFG under independently maske


2. Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection

Authors: Zihan Pan, Sailor Hardik, Jinyang Wu

Categories: cs.SD, cs.AI

Score: 8.3/10 (Obj:9 Id:8 Ind:9 Comp:7 Eff:9 Nov:7)

  • 优势: 在ASVspoof5上取得SOTA且跨域泛化极强——mix-frame后训练策略创造帧级局部扰动,迫使SSL模型学习真实伪造所共有的局部不一致性,而非记忆特定伪影。帧级监督的设计直觉清晰有效:deepfake的破绽往往出现在局部帧而非全局,让模型关注局部细节比全局分类更鲁棒。跨数据集泛化结果令人印象深刻。
  • 劣势: 三阶段流程工程复杂度高(后训练→微调→推理),实际部署是否需要全部阶段存疑。合成扰动(mix-frame)产生的伪影与真实deepfake不一致性之间的因果等价性需更深层验证——模型学到的是真实破绽还是合成扰动的特征?

中文摘要: 本文针对大型语音基础模型在深度伪造检测中直接微调时,自监督预训练目标与伪造特定伪影之间存在不匹配这一核心问题,提出了一种混合帧后训练(mix-frame post-training)策略。该方法通过构造局部化、面向伪造的扰动,并引入帧级监督,促使自监督模型学习对鲁棒伪造检测至关重要的局部不一致性特征。实验在 ASVspoof5 基准上开展,结果显示该方法达到了当前最优性能,表明显式引导模型关注帧级伪造痕迹能有效弥补预训练目标与检测任务之间的鸿沟。该工作为语音基础模型在安全敏感场景下的可靠适配提供了一条以局部一致性监督为核心的可行路径。

Large speech foundation models have shown strong potential for speech deepfake detection, but direct fine-tuning is limited by a mismatch between self-supervised pre-training objectives and spoof-specific artifacts. To address this, we propose a mix-frame post-training strategy to create localized spoof-oriented perturbations and use frame-level supervision to encourage the SSL model to learn local inconsistencies that are critical for robust spoof detection. On ASVspoof5, we achieve state-of-th


3. Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming

Authors: Rotem Rousso, Eyal Cohen, Joseph Keshet

Categories: eess.AS, cs.CL, cs.SD | This work has been submitted to the IEEE for a possible publication

Score: 8.2/10 (Obj:9 Id:8 Ind:9 Comp:8 Eff:8 Nov:8)

  • 优势: 精准定位了端到端ASR在强制对齐上的精度瓶颈——HMM-GMM虽古老但在对齐精度上仍然竞争力强,说明端到端模型在音素边界定位上存在系统性不足。可微动态规划(soft Viterbi)优雅地弥合了神经模型与经典Viterbi解码的鸿沟——让对齐过程可微分,从而可以端到端训练。双分支编码器+对比学习的设计在对齐精度上显著超过HMM基线。
  • 劣势: 双分支编码器设计引入了归纳偏置——为什么需要两个独立编码器而非一个?可微DP与对比学习的独立贡献需更严格消融。soft Viterbi在训练中的数值稳定性(梯度通过argmin-like操作传播)可能需要特殊处理。

中文摘要: 本文针对语音强制对齐任务相较于ASR技术发展滞后的现状,提出了一种端到端全可微神经架构,通过软动态规划实现音素对齐。该方法的核心创新在于设计了完全可微分的动态规划模块,使模型能够以可端到端训练的方式从音频中学习音素的时间对齐关系。实验表明,该架构在保持可微性的同时,显著提升了强制对齐的精度,挑战了传统HMM-GMM框架在此任务上的长期主导地位。

Recent advances in sequence modeling have significantly improved ASR systems, bringing them close to human-level recognition accuracy and enhancing robustness across diverse acoustic conditions and languages. In contrast, Forced Alignment has not experienced comparable progress, and traditional HMM-GMM frameworks remain widely adopted and highly competitive. To address this gap, we propose an end-to-end, fully differentiable neural architecture specifically designed for phoneme alignment. The mo


4. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

Authors: Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

Categories: cs.CL, cs.AI, cs.SD

Score: 8.2/10 (Obj:9 Id:8 Ind:8 Comp:9 Eff:8 Nov:8)

  • 优势: 精准定义了语音AI的’情感智力’评测维度——不仅是感知情感,更要在多轮对话中根据情感线索做出社交恰当的响应。语义-声学解耦设计优雅地揭示了所有主流模型(GPT-4o、Gemini等)的系统性失败:它们听懂了词但忽略了声音中的情感,在紧急场景下做出危险决策。这对语音AI的安全部署有重要警示意义。
  • 劣势: 数据生成依赖LLM-TTS管线,可能引入合成伪影——合成语音的情感表达与真实人类情感在微妙维度上可能存在差异。评测的生态效度(ecological validity)需进一步验证——受控场景中的失败是否直接外推到真实部署?评分标准的客观性(’情感智力’的ground truth)依赖人工标注,主观性不可避免。

中文摘要: 现有对机器情感智能的评估仅通过孤立的文本或被动声学感知来衡量,忽略了多轮主动对话中所需的跨模态社会推理能力。为此,作者提出SpeechEQ评估框架,构建了基于EQ-i 2.0理论、覆盖15个情商子量表的2265段对话数据集,并设计了受人类情商测评启发的多轮评估协议与Spoken EQ(SEQ)评分指标。实验表明,无论是语音情感识别模型还是端到端语音语言模型,在通过语音理解和运用副语言社会线索方面均存在明显局限,其中端到端架构虽优于级联系统,但整体表现仍不尽人意。研究进一步揭示了当前多模态模型面临的三重障碍:依赖文本的”模态捷径”、由对齐训练引发的”安全陷阱”以及”上下文遗忘”,这些瓶颈阻碍了真正具备情感感知能力的AI的实现。> As multimodal conversational systems increasingly engage in spoken interaction, their ability to navigate paralinguistic social cues has become a critical bottleneck for natural human-AI communication. However, existing evaluations of machine emotional intelligence assess reasoning exclusively through isolated text or passive acoustic perception, overlooking the complex cross-modal reasoning required for active, multi-turn dialogue. We introduce \textsc{SpeechEQ}, a comprehensive framework desig


5. Real-Time Voice AI Hears but Does Not Listen

Authors: Martijn Bartelds, Federico Bianchi, James Zou

Categories: cs.CL, eess.AS

Score: 7.9/10 (Obj:9 Id:7 Ind:9 Comp:8 Eff:8 Nov:7)

  • 优势: 清晰揭示了实时语音AI在感知与决策间的情感智力鸿沟——四个主流生产系统(GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus/Flash)在词义与声学情感冲突时,一致地选择词义而忽略声学信号。三个高风险场景(哭泣坚持没事→结束通话、批准可疑转账、忽略痛苦求助)的失败模式对AI安全部署极具警示意义。评测设计简洁有力。
  • 劣势: 因果归因停留在行为学现象层面——模型内部为什么’听到但不听’?是训练数据偏差(文本主导)、架构限制(声学编码器权重不足)、还是对齐训练中情感信号被忽略?未深入探究。提出的改进方向(’listen’)缺乏具体的技术路线图。

中文摘要: 本文研究实时语音AI系统能否理解话语之外的语音传递信息(如语调、情绪等)。作者评估了四款主流生产级实时语音系统(OpenAI GPT Realtime 2、Google Gemini 3.1 Flash Live、Alibaba Qwen3.5 Omni Plus和Omni Flash)在三类关键场景下的表现:哭泣的来电者坚称自己没事、批准电汇转账、以及其他言语与语音情绪矛盾的情形。结果显示,所有四个系统都只根据字面词语做出反应,而忽略了声音中传递的情感与意图信号。这一缺陷意味着系统会在 crying 来电者坚持没事时挂断电话、在语音暗示风险时仍批准转账,暴露出当前实时语音AI在多模态理解上的根本性盲区。

Speech conveys information through both words and vocal delivery. We evaluate four leading production realtime voice systems-OpenAI’s GPT Realtime 2, Google’s Gemini 3.1 Flash Live, and Alibaba’s Qwen3.5 Omni Plus and Omni Flash-on tasks where the words and the delivery patterns both convey meaningful information. Across three consequential scenarios, all four systems act on the words rather than the voice. They end calls with crying callers who insist nothing is wrong, approve wire transfers au


6. Frequency-Aware Self-Supervised Music Representation Learning

Authors: Yicheng Gu, Junan Zhang, Jerry Li, Zhizheng Wu, Lauri Juvela

Categories: cs.SD | Submitted to TASLP

Score: 7.7/10 (Obj:7 Id:7 Ind:9 Comp:8 Eff:8 Nov:7)

  • 优势: 将音乐频谱图视为2D钢琴卷帘结构的动机直观优雅——音乐在频谱图上呈现清晰的水平音高线和垂直和声结构,这是1D序列模型完全忽略的先验。2D视觉Transformer可以直接利用这种空间结构进行掩码预测,在MARBLE基准上对1D序列SSL模型(MERT等)取得显著优势。方法简洁,符合’更少假设获得更多表示’的压缩公理。
  • 劣势: 2D视觉架构引入较多工程调参(patch大小、掩码策略、位置编码等),2D结构先验与工程优化的因果归因存在一定混淆——性能提升来自2D结构利用还是来自更大的模型容量和更多调参?推理时需要处理2D输入,与1D流式处理的兼容性未讨论。

中文摘要: 该论文针对自监督音乐表示学习(MIR-SSL)中普遍将音频视为1D序列(时域波形或展平的频谱图)从而丢失时频表示中丰富空间与结构信息的问题,提出一种频率感知的自监督框架,将时频谱图视为2D图像以保留音乐制作中的直觉性结构。方法上,通过引入频率维度的掩蔽与变换策略,使模型在自监督预训练中显式建模频带间的依赖关系,而非仅沿时间轴建模。实验在多个MIR下游任务上评估,所提方法相比将音频当作1D序列的SSL基线取得了一致的性能提升,证明了频率感知建模对音乐表示的有效性。

Self-supervised learning (SSL) has emerged as an essential paradigm for music information retrieval (MIR). While current SSL models achieve state-of-the-art performance across various MIR tasks, they typically treat audio as 1D sequences, either operating on time-domain waveforms or on flattened time-frequency-domain spectrograms. This discards the rich spatial and structural information in time-frequency representations and overlooks a fundamental intuition in music production. In particular, m


7. From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

Authors: Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang et al.

Categories: cs.SD, cs.AI, cs.MM

Score: 7.7/10 (Obj:7 Id:7 Ind:9 Comp:8 Eff:8 Nov:7)

  • 优势: 清晰定义了LALM在跨声学层上下文推理上的关键缺陷——现有基准只评测单一声学层(纯语音/纯音效/纯音乐),忽略了真实世界中多声源共存时的上下文推理需求。提供了可控可扩展的半合成基准,可以精确控制声源组合和上下文关系。揭示了当前LALM在跨层推理上的系统性失败。
  • 劣势: 作为基准论文主要揭示现象,对如何从架构或训练机制上解决跨层融合问题缺乏深度因果归因。半合成数据的生态效度存疑——人工组合的声场景与真实声场景在时序和空间关系上可能存在差异。

中文摘要: 大型音频语言模型(LALMs)在语音、声音、音乐等单一声学层上已取得显著进展,但现有基准通常将这些层孤立评估,忽略了真实听觉场景中多声源共现所产生的复杂上下文关系。真实世界的听觉理解需要上下文感知的听觉场景理解(CASU)能力,即在多个声源同时存在时,模型需综合推理各声源之间的语义与时序关联。为此,该论文提出一个面向CASU的评测基准,旨在系统衡量LALMs在复合听觉场景下的上下文推理与场景级理解水平。通过在所提基准上对多个代表性LALMs进行评测,论文揭示了当前模型在多声源上下文融合方面的明显短板,并为未来面向真实场景的音频语言模型研究提供了标准化评测工具与基线参照。

Note: The English abstract you provided was truncated mid-sentence (“the ability to compre…”), so the summary above is based on the available portion. If you can share the complete abstract, I can refine the Chinese summary with more precise method and result details.

Recent Large Audio Language Models (LALMs) have achieved remarkable progress in audio perceptual tasks across individual acoustic layers, including speech, sound, and music. However, existing benchmarks predominantly evaluate these layers in isolation, overlooking the complex contextual relationships that arise when multiple acoustic sources co-occur in real-world auditory scenes. Real-world auditory interpretation requires Context-Aware Auditory Scene Understanding (CASU): the ability to compre


8. Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

Authors: Tomoya Mizumoto, Yusuke Fujita

Categories: eess.AS, cs.CL, cs.SD | Accepted to Interspeech2026

Score: 7.1/10 (Obj:7 Id:7 Ind:7 Comp:8 Eff:7 Nov:7)

  • 优势: 提出了优雅可迁移的洞察——双向翻译目标(语音→文本+文本→语音)迫使编码器生成语言无关表示,比Whisper的单向翻译更本质地解决了语音编码器与LLM语言无关空间的结构错位问题。发现简单且实用:只需要在预训练时加一个反向翻译目标,就能显著改善SLM的跨语言能力。
  • 劣势: 实验仅对比三种预训练目标变体,消融粒度较粗——未能深入隔离翻译方向性、翻译质量、数据规模等混淆因素。改善是否仅来自更多预训练数据/更长训练而非双向目标本身?论文未充分控制这些变量。

中文摘要: 该论文研究了语音编码器与大语言模型(LLM)之间的结构错位问题:基于语音识别的编码器通常在不同语言空间中产生表示,而LLM则在统一的语言无关空间中运作,两者之间存在表征不对齐。作者提出将语音翻译目标融入编码器预训练,因为与单语转录不同,翻译要求模型跨语言桥接,从而学到语言无关的表示。实验表明,引入翻译增强的预训练能改善跨模态融合,并在多种下游Speech LLM任务上取得更优性能。> Connecting a pre-trained speech encoder to a Large Language Model (LLM) is the standard architecture for building Speech LLMs. However, a structural misalignment exists between the encoder and the LLM. Unlike encoders based on automatic speech recognition, which often produce representations in separate language-specific spaces, LLMs operate within a unified language-agnostic space. A mechanism is required to align the encoder’s language-specific representations with the LLM’s shared space. We a


9. Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

Authors: Lianbo Liu, Shiao Zhu, Kai Washizaki, Reo Yoneyama, Haesung Jeon et al.

Categories: cs.SD, cs.AI, cs.CL

Score: 7.0/10 (Obj:6 Id:8 Ind:7 Comp:7 Eff:8 Nov:5)

  • 优势: 精准定位了日语语音合成中汉字多音字这一真实痛点——日语汉字的读音高度依赖上下文,现有LLM-TTS系统在此错误率高。Kana-CER评测指标设计巧妙,直接衡量音素级正确性而非WER。数据规模扩展+针对性数据合成的双管齐下策略在多音字处理上显著改善。
  • 劣势: 方法偏重数据工程与规模堆叠——通过扩大训练数据和合成多音字上下文来改善性能,缺乏模型架构层面的优雅洞察。Kana-CER虽然是更好的指标但与实际听感的相关性需验证——音素错误不一定都导致听感劣化。

中文摘要: Sarashina2.2-TTS 针对日语语音合成中汉字一字多音的上下文依赖难题,通过数据规模扩展与定向数据合成相结合的双管齐下策略加以解决。该系统以日语为核心构建基于大语言模型的 TTS 架构,弥补了现有系统偏重中英文而对日语支持不足的空白。研究者通过扩充训练数据规模并专门针对汉字读音歧义场景合成数据,显著提升了模型对多音字消歧的能力。该工作已开源(github.com/sbintuitions/sarashina2.2-tts),为日语语音合成领域提供了可复用的基线方案。

While large language model (LLM)-based text-to-speech (TTS) systems have achieved high-quality speech synthesis, most existing systems focus on English and Chinese. Japanese, however, remains under-explored, and its unique linguistic challenges, such as widespread context-dependent kanji polyphony, have yet to be adequately tackled. Here we introduce Sarashina2.2-TTS (https://github.com/sbintuitions/sarashina2.2-tts), a Japanese-centric LLM-TTS system that tackles these challenges through a dual


10. STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

Authors: Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu et al.

Categories: cs.SD, cs.AI

Score: 7.0/10 (Obj:6 Id:7 Ind:8 Comp:7 Eff:7 Nov:7)

  • 优势: 首个系统评估S2ST表现力的基准——不仅评测翻译保真度,还评测情感、场景风格和非语言发声的保持。无参考LLM评判管线(reference-free)解决了跨语言参考语音难以获取的实践问题,与人类感知高度对齐。32.6小时中英数据集填补了空白。
  • 劣势: LLM评判引入黑盒代理指标存在潜在偏差——LLM自身对情感和风格的判断能力是否足够?目前数据仅限于中英语言对,S2ST表现力问题在其他语言对上可能表现不同。reference-free评测的校准性——LLM评分与真实听感的系统性偏差——需更深入分析。

中文摘要: 语音到语音翻译不仅要保留语义,还需传达情感、场景风格和言语副特征,但跨语言参考语音难以大规模采集,使基于参考的评测不可行。为此作者提出STEB基准,提供32.6小时中英双语数据及配套合成方案,在保证翻译忠实度的同时实现表达性可控对齐。方法上通过合成语音自动生成符合源语言表达特征的目标语音,规避人工采集瓶颈。主要结果:STEB能够系统、可复现地评测S2ST系统的表达性传递能力,并揭示了现有系统在情感与风格保真度上的显著不足。

Speech-to-speech translation (S2ST) should preserve not only lexical meaning, but also expressive attributes: emotion, scenario style (e.g., news reporting vs. dramatic dialogue), and nonverbal vocalizations (NVs). Moreover, collecting cross-lingual target speech that is both translation-faithful and expressively aligned with the source is difficult at scale, making reference-based evaluation impractical. We introduce STEB (Speech-to-Speech Translation Expressiveness Benchmark), a 32.6-hour Chin


11. Adaptive Oscillatory Inductive Bias for Modeling Sharp Prosodic Dynamics in Diffusion-Based TTS

Authors: Sandipan Dhar, Nirmesh J. Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

Categories: eess.AS, cs.AI, cs.CL, cs.SD, eess.SP | Accepted in INTERSPEECH 2026

Score: 6.9/10 (Obj:6 Id:7 Ind:8 Comp:8 Eff:7 Nov:6)

  • 优势: 对Snake激活函数做了简洁的自适应修改——Snake的固定频率周期非线性对急促韵律过渡(如重音、停顿前加速)建模不足,Adaptive Snake让频率参数随输入变化,直接针对这个真实难点。修改简洁到令人信服——仅增加很少参数就让扩散TTS更好地建模急促音高变化。在Interspeech接收。
  • 劣势: 整体改善可能增量——自适应频率是否真的带来了质的改善还是仅是微调?自适应边界与急促韵律过渡改善的因果链需更严格验证:改善来自更好的谐波建模还是来自更多可学习参数?论文未提供对Snake频率在训练中演化的分析,缺乏对’自适应’机制的可解释性验证。

中文摘要: 这篇论文针对扩散模型文本到语音合成(TTS)中难以建模急剧韵律转换和快速音高变化的问题,提出了一种自适应振荡归纳偏置方法。现有基于扩散的TTS解码器通常使用Snake等周期性非线性激活函数来捕捉谐波结构,但在处理幅度和频率的突变时适应性不足。该方法通过引入可自适应调节的振荡机制,增强模型对急剧韵律动态变化的建模能力,从而在保持语音质量的同时更好地再现表达性语音中的韵律细节。

Diffusion-based text-to-speech (TTS) models have achieved significant improvements in speech quality. However, modeling sharp prosodic transitions and rapid pitch variations in expressive speech remains challenging. Existing diffusion-based TTS decoders commonly utilize periodic nonlinearities such as Snake activation function to capture harmonic structures, but this activation funcation provides limited adaptability when modeling abrupt amplitude and frequency variations. In this paper, we inve


12. One Model, Many Latencies: Universal Speech Enhancement for Diverse Real-Time Applications

Authors: Szu-Wei Fu, Rong Chao, Xuesong Yang, Sung-Feng Huang, Ante Jukić et al.

Categories: cs.SD

Score: 6.9/10 (Obj:9 Id:7 Ind:8 Comp:7 Eff:7 Nov:5)

  • 优势: 解决了不同实时应用需分别训练SE模型的真实部署痛点——不同场景(助听器需要<5ms、电话需要<20ms、离线处理不限延迟)此前需要各自训练专用模型。单模型通过配置look-ahead帧数和early exit策略即可适配不同延迟需求,设计实用且工程优雅。并行卷积层避免了变padding的训练效率问题。
  • 劣势: early exit+并行卷积的组合缺乏深度科学洞察——这些都是已有技术的组合应用,通用模型与专用模型仍有性能差距。early exit的退出判断标准(哪个中间层输出足够好)可能需要针对不同噪声条件调参。论文未讨论通用模型在极端噪声条件下的鲁棒性是否下降。

中文摘要: 不同实时语音应用对延迟预算要求各异,传统做法需为每个场景单独训练语音增强模型,成本高昂。本文提出一种”一模型多延迟”的实时通用语音增强模型,可对算法延迟和计算延迟进行显式控制:算法延迟通过可配置的前瞻帧数灵活调节,并引入并行卷积结构以避免因填充配置变化导致的学习效率下降。该模型用单一网络适配多种实时场景,在统一框架内同时兼顾低延迟响应与增强质量,从而免去了为每个延迟档位单独训练和部署模型的负担,为跨延迟等级的实时语音增强提供了通用且高效的解决方案。

Different real-time speech applications impose distinct latency budgets, often requiring separately trained enhancement models for each scenario. In this paper, we propose a one-for-all, real-time universal speech enhancement model that provides explicit control over both algorithmic and computational latency. Algorithmic latency is flexibly adjusted via configurable look-ahead frames. To avoid learning inefficiency caused by varying padding configurations, we introduce parallel convolutional la


13. FoleySet: A Multi-Level Human-Annotated Foley Sound Dataset

Authors: Sunshiyu Wang, Alexander Lerch

Categories: cs.SD | Accepted to the International Conference on Digital Audio Effects (DAFx 2026)

Score: 6.8/10 (Obj:6 Id:7 Ind:7 Comp:6 Eff:7 Nov:7)

  • 优势: 填补了细粒度人工标注Foley音效数据集的空白——此前Foley音效研究要么用自动标注(质量差),要么数据规模小。FoleySet提供了二级分类法(大类别+细粒度子类)和人工标注,CC许可开源对社区有直接价值。在DAFx接收说明质量被认可。
  • 劣势: 目前数据规模有限——Foley类别覆盖面可进一步扩展。数据集论文的贡献是资源而非方法,对Foley生成/检索方法的改进指导是间接的。二级分类法的粒度是否满足下游任务需求(如细粒度Foley生成)需更多验证。

中文摘要: 影视后期制作中的Foley音效(如脚步声、衣物摩擦声、道具 handling 声)通常需要由专业Foley艺术家使用实物道具同步录制,工作流程资源消耗大,这促使了数据驱动的Foley研究,但高质量的人工标注Foley数据集仍然稀缺。为填补这一空白,作者提出了FoleySet——一个公开可用的Foley数据集,包含10,000个音频片段,并由两级Foley分类体系进行人工标注,将Foley界定为源于人类相关动作(人与材料交互及人类产生的声音)的声响。该数据集采用Creative Commons许可,提供标准化、结构化的资源,以支持数据驱动的Foley分类、检索与生成任务。作者认为,FoleySet的两项主要贡献在于:既填补了声音效果领域中这一重要但研究不足的子方向的数据空白,又提出了一套设计过程、依据和结构均有系统文档说明的Foley专属分类体系。该数据集不仅服务于Foley模型的开发,也对更广泛的数据驱动音频任务具有参考价值。

In audiovisual post-production, Foley refers to synchronous sound effects associated with human actions, such as footsteps, cloth rustle, and prop handling, that are recreated to match the on-screen movements and interactions of characters. These sounds are often recorded by professional Foley artists using physical props. This resource-intensive workflow has motivated data-driven research on Foley, including tasks such as classification, retrieval, and generation; however, high-quality annotate


14. SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios

Authors: Jinming Zhang, Wei Rao, Xionghu Zhong, Eng Siong Chng

Categories: eess.AS, cs.AI | Accepted by Interspeech 2026

Score: 6.2/10 (Obj:7 Id:7 Ind:7 Comp:5 Eff:7 Nov:4)

  • 优势: 精准定位了级联音频管线中SE与AGC的相互负面影响——AGC在SE之前会放大噪声,SE在AGC之前会过度抑制低音量语音。联合优化方案让SE和AGC共享表示并互相感知,在会议场景的音量变化下表现更好。实用价值明确。
  • 劣势: 方法架构常规——联合SE+AGC的网络设计未见本质创新,核心贡献更多在于任务重构(将SE和AGC从级联变为联合)与数据流水线设计。与级联基线的对比可能不够公平——联合训练天然有端到端优势但工程复杂度更高。

中文摘要: 传统音频处理流程将语音增强(SE)和自动增益控制(AGC)作为独立模块串联处理,存在性能瓶颈:先做AGC会放大背景噪声,先做SE则容易压制低音量语音。针对这一问题,作者提出了SE-AGCNet,一个面向会议场景联合优化SE与AGC的端到端框架。该框架针对会议中音量波动显著的特点,通过统一网络同时建模噪声抑制与增益调节,避免了模块级联带来的误差累积与目标冲突。实验表明,SE-AGCNet在保持语音清晰度的同时实现了稳定的响度控制,整体性能优于传统分模块处理方案。

Conventional audio pipelines typically treat speech enhancement (SE) and automatic gain control (AGC) as discrete modules, which often limits overall performance. For instance, applying AGC before SE may inadvertently amplify background noise, while prioritizing SE tends to over-suppress low-volume speech. To address these limitations, we propose SE-AGCNet, an end-to-end framework that jointly optimizes SE and AGC. Tailored for meeting scenarios with significant volume variations, SE-AGCNet leve


15. Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

Authors: Tomoya Mizumoto, Yusuke Fujita, Hao Shi, Lianbo Liu, Atsushi Kojima et al.

Categories: eess.AS, cs.CL, cs.SD | Accepted to ASRU2025

Score: 6.0/10 (Obj:5 Id:6 Ind:8 Comp:5 Eff:7 Nov:4)

  • 优势: 清晰定义了方言鲁棒性评测范式——用标准语/方言性能比(Dialect Robustness Ratio)作为量化指标,系统验证了基座LLM的方言理解能力是否可以迁移到SLM。发现LLM的方言鲁棒性确实部分迁移到SLM,但语音模态引入了额外的方言脆弱性。在ASRU接收说明质量被认可。
  • 劣势: 发现多为经验性且符合直觉——LLM的文本方言理解能力能部分帮助SLM,这并不意外。缺乏对鲁棒性跨模态迁移深层因果机制的挖掘——为什么语音模态的方言退化比文本更严重?是ASR编码器的方言弱点还是声学-文本对齐的方言不匹配?

中文摘要: 针对大语言模型(LLM)在方言变体下的理解能力不足问题,本文系统评测了基于语音的语言模型(SLM)与纯文本LLM在日语方言上的鲁棒性,并提出以标准语与方言的性能比作为”方言鲁棒性比”的量化指标。研究关注基座LLM的方言理解能力能否跨模态迁移到集成语音处理组件的SLM中,填补了语音方言理解评测的空白。实验发现,基座LLM的文本方言鲁棒性确实能部分迁移到SLM,但语音模态会引入额外的方言脆弱性,导致整体性能下降。该工作为构建方言鲁棒的口语对话系统提供了清晰的评测范式与基线,并被ASRU2025接收。

Dialogue systems based on large language models (LLMs) have advanced significantly in recent years. However, dialectal variation remains a major challenge, particularly for systems that process spoken input. LLM-based speech language models (SLMs), which integrate LLMs with speech processing components, show promise for spoken language tasks, yet their ability to comprehend dialects has not been sufficiently studied. Moreover, it remains unclear how the dialectal understanding of the base LLM af


16. Probing in the Wild: A Case Study of Self-Supervised Speech Representations on Mandarin Sub-dialects with Unsupervised Articulatory Analysis

Authors: Shu Shang, Fuliang Weng, Zeqian Hu, Yaqian Zhou

Categories: cs.CL

Score: 5.8/10 (Obj:5 Id:5 Ind:7 Comp:7 Eff:6 Nov:5)

  • 优势: 将语音表征探测从依赖人工标注的受限语料扩展到自然发生的方言语音,去除了标注假设对探测结论的干扰。无监督发音分析方法让研究可以在无标注语料上进行,扩展了probing方法的适用范围。
  • 劣势: 探测研究本身因果归因较弱——表征包含方言信息不等于模型使用了方言信息。自然语料引入未控制的混淆因素(录音条件、说话人差异),难以清晰隔离模型对方言音变的真实表征机制。结论偏向描述性而非解释性。

While self-supervised speech models have achieved strong performance across speech tasks, relatively little is known about how their internal phonetic representations behave under fine-grained dialect variation. Existing probing studies typically rely on curated corpora with manual phonetic annotations, limiting their applicability to naturally occurring dialect speech. We present a case study of articulatory feature representations in a Mandarin self-supervised speech model using an entirely un


17. SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding

Authors: Po-Yen Chen, Berlin Chen

Categories: cs.CL, cs.AI | Interspeech 2026

Score: 6.2/10 (Obj:5 Id:7 Ind:9 Comp:5 Eff:7 Nov:4)

  • 优势: 针对LLM解码随机性在多意图SLU中的问题,提出了语义帧级自一致性聚合方案,将预测分解为意图特定的帧再做结构化投票。提供了完全独立的零样本评测方案,避免了训练/评测闭环。
  • 劣势: 框架过度工程化——帧级分解+域-意图-slot三重一致性+自一致性聚合,整个pipeline的组件太多。自一致性在NLP中已有大量工作,帧级分解只是换了粒度,本质创新有限。多意图SLU本身应用场景较窄。

中文摘要: 针对基于大语言模型的提示式口语理解(SLU)在多意图场景下因解码随机性导致意图-槽位结构不一致的问题,本文提出了语义帧级多任务自一致性框架(SFL-MTSC)。该方法不再采用输出层的多数投票,而是将模型预测分解为意图特定的语义帧,并在帧层级进行结构化聚合,从而在域、意图与槽位多个任务层面施加一致性约束。通过将多任务信息整合到帧级表示中,SFL-MTSC能够有效抑制单次解码中的噪声与不一致输出。实验表明,该框架在多意图SLU基准上显著提升了鲁棒性与准确性,优于传统的输出级一致性方法。整体而言,该工作为LLM驱动的SLU提供了一种结构化的自一致性增强路径。

Prompt-based spoken language understanding (SLU) with large language models (LLMs) often suffers from inconsistent intent–slot structures due to decoding stochasticity, particularly in multi-intent scenarios. In view of this, we propose Semantic Frame-Level Multi-Task Self-Consistency (SFL-MTSC), a novel structured aggregation framework operating at the semantic frame level. Instead of output-level majority voting, SFL-MTSC decomposes predictions into intent-specific frames, applies domain–int


18. CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations

Authors: Ram Annamdevula, Ankit Tatawat, Ashishkumar P. Gudmalwar, Nirmesh J. Shah, Pankaj Wasnik

Categories: eess.AS, cs.AI, cs.SD | Accepted at INTERSPEECH 2026

Score: 6.2/10 (Obj:6 Id:7 Ind:8 Comp:5 Eff:7 Nov:4)

  • 优势: 针对跨语言口音控制这一真实挑战,提出了可在推理时连续调节口音强度的具体机制,说话人和口音的解耦设计理论上可以独立控制音色和口音。对印地语等低资源语言的口音转换有实用价值。
  • 劣势: 方法属于典型的工程堆叠(LLM+Codec+Perceiver+对抗训练),核心洞察缺乏深度与极简性。说话人-口音解耦在TTS中已有多种方案,本文的解耦策略并非全新。多组件串联的训练稳定性与各组件独立贡献缺乏严格消融。

中文摘要: 这篇论文针对跨语言文本到语音(TTS)系统中的口音转换与可控性这一核心难题展开研究,尤其关注资源匮乏且语音多样的印度语言场景。作者指出,尽管当前基于大语言模型(LLM)的TTS系统在跨语言泛化方面表现优异,但在口音特征及其强度的显式控制上仍存在明显不足。为此,论文提出了CrossAccent-TTS框架,通过解耦说话人表示与口音表示,在保持说话人身份不变的同时实现口音的控制与转换。该框架为跨语言语音合成中口音的精细化调控提供了新的解决思路。

需要注意的是,您提供的英文摘要仅包含问题陈述与方法概述,并未包含具体实验结果,因此上述中文摘要未能涵盖”主要结果”部分。若您能补充完整英文摘要(含实验数据和结论部分),我可以补充对应的结果概述。

Accent conversion and controllability remain fundamental challenges in cross-lingual text-to-speech (TTS), particularly for low-resource and phonetically diverse Indic languages. While recent large language model (LLM)-based TTS systems exhibit strong cross-lingual generalization, they provide limited explicit control over accent characteristics and intensity. In this paper, we propose CrossAccentTTS, a framework that enables both accent control and conversion while preserving speaker identity.