说话人建模技术已展现出超越传统说话人识别领域的巨大应用价值,广泛渗透至语音识别、声纹转换、目标说话人语音处理等多元场景。这些新兴应用对说话人表征的精确性、鲁棒性与可解释性提出了全新要求。本报告系统阐述说话人建模技术的最新进展及其跨场景应用实践,为研究人员与工程师提供全景式的技术视野。
人脑的听觉系统具有强大的听觉感知能力,可以在复杂声学场景中只关注自己感兴趣的语音,同时忽略其他声音的干扰,这一现象被称为“鸡尾酒会问题”。现阶段智能语音交互技术很难达到类人水平,语音交互技术在复杂开放环境中表现不佳,制约着语音交互产品的推广应用。因此,让机器拥有类人的听觉处理功能,提升智能语音交互技术的鲁棒性具有重要的理论意义和应用价值。本报告主要围绕基于EEG信号的听觉注意力解码方法、神经导向语音分离方法等两个方面展开介绍。
我们此前发布的Zipformer架构在语音识别应用中具备业界领先性能,但其模型结构与训练流程的复杂性限制了广泛采用。全新“Zapformer”架构旨在简化Zipformer设计,并通过使用比以往架构调优更大规模的数据集进行架构与训练方法的优化。在自动语音识别任务中,Zapformer性能显著优于Zipformer(后者本身已超越Conformer及Transformer架构)。一项重要改进是取消了随机化组件(如随机dropout和层级随机dropout),转而通过引入辅助损失函数来实现模型稳定性与泛化能力的提升。
情感识别是一种让计算机识别和理解人类情感的技术,在众多领域都起着重要的作用,也是人工智能领域重要的发展方向。因此,梳理与归纳基于语音和文本的双模态情感识别的研究现状:首先,分类阐述情感表示空间;其次,按照情感数据库的情感表示空间对这些数据库进行分类,并总结常见的多模态情感数据库;再次,介绍基于语音和文本的双模态情感识别方法,包括特征提取、模态融合和决策分类,重点介绍模态融合方法并将这些方法分为特征级融合、决策级融合、模型级融合和多层次融合这4类;此外,比较和分析一系列语音和文本双模态情感识别方法的结果;最后,介绍情感识别的应用场景、面临的挑战与未来的发展方向。以上旨在对多模态情感识别,尤其是对基于语音和文本的双模态情感识别的相关工作进行分析与总结,并为情感识别提供有价值的参考。
语音唤醒作为实现人机交互的关键技术,一直是语音领域的研究热点。随着深度学习技术的发展,其研究方法的重心已从传统的大词汇连续语音识别(LVCSR)技术逐渐转向基于神经网络的技术,然而如何在小型设备上实现高效唤醒并利用有限的样本数据进行模型训练仍是低资源语音唤醒系统设计面临的挑战。首先,定义了语音唤醒中的低资源概念,区分了语音唤醒和语音识别以及相关术语,介绍了经典的语音唤醒模型及其适配场景,阐述了低资源语音唤醒的国内外研究现状。其次,从语音唤醒系统的结构组成的角度分别说明了声学特征提取与声学模型的主流技术和优化策略。然后,对语音唤醒模型的轻量化方法展开分析并对其优缺点进行比较,总结了数据低资源语音唤醒中常见的小样本学习、零样本学习、迁移学习等解决方法,并介绍了常见语音唤醒数据集和评价指标。最后,探讨并展望了低资源语音唤醒技术未来的研究方向。
近年来,市场对多功能音频理解解决方案的需求显著增长,其发展已超越自动语音识别等传统任务专用方法。当前的研究重心正转向通用音频理解领域,旨在构建能够处理广泛音频任务的统一模型。本次分享将具体探讨通用音频编码器的关键设计选择,以及数据和参数规模带来的相关挑战。此外,报告还将介绍面向通用音频理解的编码器-解码器训练框架,重点阐述如何将大型语言模型作为解码器进行集成。