首页|期刊导航|中南民族大学学报(自然科学版)|基于多粒度特征融合模型的多说话人声纹识别研究

基于多粒度特征融合模型的多说话人声纹识别研究OA

中文摘要

声纹识别是一种通过比对语音中的说话人特征来确认身份的技术.其流程包括从不定长的单人语音片段中提取声学特征,再由模型提取说话人特征,最后通过余弦相似度判断是否为同一说话人.多说话人声纹识别则需从包含多位说话人的音频中识别各自身份,该任务的关键在于提取具判别力的说话人特征.为此提出了多粒度特征融合模型(MGFF-TDNN),在MGFF-TDNN中,首先使用二维深度可分离卷积模块(DSM)作为前端特征提取器,以增强时频域特征的建模.其次,为了实现多粒度特征融合,设计了多粒度融合结构(M-TDNN),采用时延神经网络和音素级特征池化来捕获不同粒度的信息.在VoxCeleb数据集上的实验表明:MGFF-TDNN模型在使用了更少的参数量(4.78M)和计算资源(1.49G的浮点计算量)的情况下,仍表现出良好的性能.

李娅;周斌;胡波

中南民族大学计算机学院,武汉430074中南民族大学计算机学院,武汉430074武汉东信同邦信息技术有限公司,武汉430074

信息技术与安全科学

声纹识别多说话人多粒度特征融合深度可分离卷积

《中南民族大学学报(自然科学版)》 2026 (1)

P.77-85,9

湖北省技术创新专项基金资助项目(2019ADC071)中央高校基本科研业务费专项资金资助项目(CZY23006)。

10.20056/j.cnki.ZNMDZK.20250828

评论