清华大学学报(自然科学版)

北大核心,CA,INSPEC,JST,EI

国内刊号:11-2223/N

国际刊号:1000-0054

清华大学学报(自然科学版)杂志2025年第7期:基于语音谐波结构的多通道语音增强网络

发布日期:

作者:努尔艾力·阿力甫, 曹瑞, 李津, 葛檬, 王天锐, 王浩宇, 崔中健, 王龙标, 党建武

单位:1. 天津大学智能与计算学部, 天津市认知计算与应用重点实验室, 天津 300072,2. 中国科学院深圳先进技术研究院, 深圳 518055

关键词:多通道语音增强,波束成形,空间滤波

多通道语音增强(multi-channel speech enhancement,MCSE)的主要目标是利用麦克风阵列捕获的空间关系和时间频谱信息恢复干净的语音信号。尽管现有方法在去噪和减少失真方面表现出色,但在低信噪比(signal-to-noise ratio,SNR)和高混响等不利声学环境下,语音的声学结构和空间信息可能会不完整或模糊。依赖网络隐式学习频谱-空间信息的方法难以准确预测波束成形权重,从而导致语音失真。为解决这一问题,该文设计了一种基于语音谐波结构的2阶段MCSE网络,显式引入频谱谐波结构信息。在第1阶段,在UNet波束成形网络中集成语音信息提取模块,学习并保留谐波结构;在第2阶段,引入残差迭代修正模块,进一步增强在第1阶段未被充分处理的声学结构,从而减少失真。基于LibriSpeech仿真生成的数据集试验结果表明:在不利声学环境下,显式引入声学结构信息的波束成形网络在抗失真性能上显著优于仅依赖隐式学习频谱-空间信息的方法。该文研究结果可为极端声学场景下的多通道语音增强方案提供参考。

来源:2025年第7期

《清华大学学报(自然科学版)》期刊编辑部

查看清华大学学报(自然科学版)杂志2025年第7期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:清华大学东门外学研大厦B座605A室
  • 电话:010-62788108
  • E-mail:xuebaost@tsinghua.edu.cn

咨询工作人员