关键词:
噪声环境
说话人确认
域对抗
坐标注意力机制
图卷积神经网络
摘要:
为了减弱背景噪声对说话人确认(Speaker Verification,SV)性能的影响,提出一种基于域对抗图卷积网络(Domain Adversarial Graph Convolution Network,DA⁃GCN)和坐标注意力(Coordinate Attention,CA)的SV方法来提升噪声环境下的SV性能。首先,针对噪声环境下局部特征变得不稳定这个问题,提出引入CA模块,将全局时间信息和全局频率信息编码到通道注意力中,以强调有用通道,提取鲁棒性的说话人特征。其次,提出构建DA⁃GCN来辅助主网络提取与噪声相关性更小的说话人特征来进行后续的分类。具体而言,将语音信号映射为图信号,利用GCN分别对干净语音图信号特征和含噪语音图信号特征进行聚合,通过域对抗(Domain Adversarial,DA)训练,辅助主网络提取干净语音域和含噪语音域共享的说话人特征,从而降低噪声对SV性能的影响。在VoxCeleb1数据集上的实验结果表明,所提CA⁃DA⁃GCN的性能优于基线模型ExU⁃Net且表现出良好的泛化能力。