
王海贤,博士,教授,主要研究方向为脑机接口、神经信息工程、工程教育学的理论方法和应用.E-mail:hxwang@seu.cn.
第二十八届中国科协年会学术论文
作者简介:
凌希蕾,硕士研究生,主要研究方向为脑机接口算法.E-mail:xlling10@foxmail.com.
在复杂听觉场景中,听障患者难以从多人混合语音中稳定跟踪目标语音流,且传统助听设备无法感知听者的主观注意目标,难以满足真实环境中的个性化听力辅助需求.近年来,基于脑电信号(Electroencephalogram, EEG)的听觉注意力解码技术为神经引导听力辅助提供新的研究路径.为此,文中聚焦听觉注意力解码问题,提出基于EEG听觉注意力线索解耦与跨模态对比学习的目标说话人识别方法(Target Speaker Identification Based on EEG Auditory Attention Cue Disentanglement and Cross-Modal Contrastive Learning, DCLNet).首先,结合听觉注意力的层级加工神经机理,基于静态-动态解耦变分表征学习模块,将EEG分解为表征说话人身份信息的静态潜变量与表征时序听觉跟踪信息的动态潜变量.然后,引入预训练说话人识别模型,作为外部身份先验,结合说话人感知的跨模态对比学习,对齐EEG与语音的身份表征.在DTU、KUL数据集上的实验表明,DCLNet能有效提升目标说话人识别性能,并增强EEG中身份表征的判别能力.
WANG Haixian, Ph.D., professor. His research interests include theoretical methodologies and applied research in brain-computer interfaces, neural information engineering, and engineering pedagogy.
Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology
About Author:
LING Xilei, Master student. Her research interests include brain-computer interface algorithms.
In complex acoustic environments, hearing-impaired listeners often struggle to reliably track a target speech stream from multi-talker mixtures. Conventional hearing aids can amplify speech, but fail to capture the listener's subjective attentional focus. Personalized hearing assistance requirements in realistic settings are therefore difficult to be met. Auditory attention decoding based on electroencephalogram(EEG) signals is a promising paradigm for neuro-steered hearing assistance. In this paper, a target speaker identification method based on EEG auditory attention cue disentanglement and cross-modal contrastive learning(DCLNet) is proposed for the auditory attention decoding problem. Motivated by the hierarchical neural processing mechanism of auditory attention, a static-dynamic disentangled representation learning framework is adopted. The EEG signal is factorized into a static latent variable for encoding speaker identity and a dynamic latent sequence for capturing time-varying auditory tracking cues. Then, a pre-trained speaker encoder is further incorporated as an external identity prior, and a speaker-aware bidirectional cross-modal contrastive learning is employed to align the identity representations between EEG and speech modalities. Experiments on the DTU and KUL datasets demonstrate that DCLNet consistently improves target speaker identification performance and yields more discriminative speaker-identity representations in EEG.
听力正常的人能轻松聚焦目标说话人的声音, 同时过滤背景噪音.相比之下, 听力障碍人群即便佩戴传统助听器, 也往往难以完成这一任务[1, 2].现有助听器的一大核心局限是:在缺乏可靠先验信息的情况下, 无法从复杂声音信号中自动识别目标语音.为了攻克这一难题, 新一代助听器正越来越多地集成多类传感器以采集多模态信息, 这为实现更智能的语音增强技术奠定基础[3, 4].这类方法通常存在前提假设:要么预先知晓目标说话人身份, 要么要求听力障碍者将视线或头部固定对准目标说话人, 无法依据人的主观听觉注意力自动分离说话人的语音.一旦目标说话人离开视线范围或佩戴口罩, 视觉线索便会被遮挡或缺失, 传感器采集的先验信息有效性也会随之下降.
由于听觉注意力与认知调控存在天然关联, 研究人员越发关注选择性听觉注意力背后的神经机制.相关研究[5, 6]表明, 神经信号会对目标语音的时域特征与空域特征产生偏好性响应, 这也印证基于脑电信号(Electroencephalogram, EEG)的听觉注意力检测(Auditory Attention Decoding, AAD)技术具备可行性.在各类AAD技术中, 基于EEG的方法凭借高时间分辨率、无创性及良好的可操作性表现突出[7], 尤其适用于研发神经引导式听觉辅助设备.
根据输入输出模态的不同, AAD可进一步细分为面向目标声源方位的解码与面向目标说话人识别的解码.面向目标声源方向的解码仅以EEG信号作为输入, 判断目标声源的空间方位, 实现注意方向解码, 但依赖后置波束成形获取目标语音流[8, 9], 当目标声源与干扰源的方位角较接近时, 空间分辨能力不足, 难以有效区分相邻方向上的声源[10, 11].面向目标说话人识别的解码同时以 EEG 信号与多段干净语音流作为输入, 计算EEG中注意语音表征与各候选干净语音流之间的相似度, 判断目标说话人身份.该类方法依赖前置语音分离以获得干净的候选语音流, 即使目标声源与干扰源在方位上高度接近, 仍可通过说话人身份线索进行区分, 为脑控辅助听觉设备在真实复杂声学环境下的应用提供更具潜力的技术路径[12, 13].然而, 现有方法在EEG表征的功能分工、语音侧的身份建模、跨模态监督设计这3个方面仍存在不足, 难以在EEG与候选语音之间建立稳定的身份层面对齐.
听觉注意力在脑内的层级加工过程为本文研究提供关键启发.本文提出对应的建模假设, 即EEG中蕴含的听觉注意力线索并非单一同质的信息载体, 而是可能由两类互补信息构成:一类是跨较长时间尺度的粗粒度目标说话人类别信息, 用于标识被注意说话人的身份特征; 另一类是随语音时序动态变化的细粒度跟踪线索, 用于匹配目标语音的瞬时声学特征.基于该假设, 本文提出基于EEG听觉注意力线索解耦与跨模态对比学习的目标说话人识别方法(Target Speaker Identification Based on EEG Au-ditory Attention Cue Disentanglement and Cross-Modal Contrastive Learning, DCLNet).首先, 设计多尺度时序特征提取模块, 单独处理每个EEG通道, 通过补丁卷积块与细粒度卷积块同时捕获细粒度短时波动与长周期时序趋势, 经通道自适应融合模块将各通道的多尺度时序特征映射至统一表征空间.再设计脑电静态-动态解耦变分表征学习模块(Static-Dynamic Disentangled Representation Learning Module, SDDM).在多尺度时序特征提取器作为EEG前置编码器的基础上, 利用时序解耦变分自编码器将EEG解耦为静态潜变量与动态潜变量, 分别编码目标说话人身份信息与时变的听觉跟踪线索.然后, 引入预训练说话人识别模型, 构建外部说话人身份先验表征空间, 选择在大规模说话人识别任务上完成预训练的模型作为身份锚点, 并通过轻量可训练适配器将输入的目标语音与干扰语音映射至与脑电静态潜变量一致的公共表征空间.最后, 提出说话人感知的跨模态对比学习损失.以脑电静态潜变量作为参照锚点, 拉近对应的听觉注意力目标说话人身份表征、推离干扰说话人身份表征, 并以语音表征为锚构造对称正则项, 实现EEG特征在说话人层面的聚类约束.
面向目标说话人识别的听觉注意力解码(Speaker Identification-Based Auditory Attention Decoding, SI-AAD)旨在从多说话人场景中, 根据EEG判别被试当前关注的目标语音流.SI-AAD依赖前置盲源分离器获取干净的语音流, 再识别当前听者关注的说话人, 最终通过听力辅助设备将该说话人语音放大, 呈现给听者.
早期SI-AAD研究利用线性模型建立EEG与语音包络之间的映射.O'Sullivan等[14]提出后向刺激重构方法, 从EEG中重构关注语音的包络, 再与候选语音包络计算相关系数, 判定目标说话人.与之对应的前向模型[15]则以语音特征预测神经响应.在此基础上, de Cheveigne等[16]引入典型相关分析(Ca-nonical Correlation Analysis, CCA), 将EEG与语音投影至最大相关子空间, 在10 s决策窗口上可取得较稳定的结果, 但当决策窗口缩短至1~2 s时, 准确率降至60%, 难以满足助听场景对注意切换响应速度的要求.
针对线性模型的局限, de Taillez等[17]建立EEG到语音包络的非线性映射, 验证非线性模型的建模优势.Kuruvila等[18]结合卷积神经网络(Convolu-tional Neural Network, CNN)与长短期记忆网络(Long Short-Term Memory, LSTM), 将多通道EEG与多说话人语谱图同时输入网络, 在多语言数据集上验证模型的有效性.Cai等[19]提出CMAA(Cross-Modal Attention-Based AAD), 通过双向跨模态注意力, 在时间维度上实现EEG与语音特征的交互.Cai等[20]提出频率-通道注意力模型, 为不同频段和电极分配可学习权重, 提升短窗时长下的识别稳定性.然而, 上述方法大多以语音包络或语谱图作为参考表征, 难以充分反映大脑对语音的高级认知加工过程.Han等[13]将自监督预训练语音模型WavLM的中间表征作为重构目标, 相比语音包络与语谱图, 层级语义表征可获得更高的解码准确率, 并且在注意切换场景中响应更快.
在此基础上, 对比学习被引入SI-AAD任务, 将同个听觉场景中的EEG与关注语音视为正样本对, 与未关注语音视为负样本对, 在共享嵌入空间中拉近正样本、推离负样本, 学习判别表征.Chen等[21]在多视角变分自编码器框架下提出任务相关多视角对比学习, 借助缺失视角机制近似得到与注意任务相关的融合表征.Ding等[22]针对现有数据集不足, 构建含5种设备模拟条件的MS-AAD数据集(Mixed-Speech AAD Dataset), 并通过对比学习、音色辅助监督及频率-通道-时间联合EEG编码策略, 提升复杂听辅场景中EEG-语音对齐与目标说话人识别效果.近期, Chen等[23]进一步将神经科学先验引入对比学习框架, 采用EEGViT与WavLM, 分别提取多层次EEG与语音表征, 通过层级对比学习实现细粒度对齐, 并引入层级互信息最小化, 表征层面解耦关注成分与未关注成分.
综上所述, 现有SI-AAD方法在EEG表征、语音身份建模与跨模态监督机制这3个方面仍存在显著不足.首先, 多数方法将承载多类听觉注意力线索的EEG信号视作单一表征进行处理, 缺乏显式的功能划分, 容易导致目标说话人身份相关神经成分被其它神经活动掩盖, 进而增加EEG与语音特征的匹配难度.其次, 在语音侧, 现有方法多采用与EEG结构同构的编码器, 或基于梅尔频谱、Wav2vec(Wave to Vector)等细粒度声学表征与语义表征进行跨模态对齐, 不仅难以逾越两种模态间的固有采样频率差异, 也不符合SI-AAD任务解码说话人稳态身份表征的核心需求.此外, 部分方法直接通过分类头输出身份索引, 未对判别空间与身份信息的一致性施加显式约束, 并且现有基于对比学习方法多以同批次内样本级正负对构建监督信号, 难以在脑电侧形成稳定的说话人级特征聚类结构.
设当前听觉场景中存在K位说话人同时讲话, 对应的干净语音流为
$\hat{y}=f_{\theta}\left(\boldsymbol{e}, \left\{\boldsymbol{a}^{(k)}\right\}_{k=1}^{K}\right), $
其中, θ 表示可学习参数, fθ (· )表示互信息估计辅助网络, 通过EEG分支与语音分支的协同表征学习, 从环境说话人候选集上匹配与EEG注意线索最相符的说话人索引
需要说明的是, 上述建模方式对说话人数K不做限制.本文实验中使用的2个公开数据集均为双说话人混合场景, 即数据集由实际呈现的两段独立纯净语音构成, 分别对应说话人A与说话人B.该闭集二分类实验设置不会约束算法本身的适用范围, 本文设计的损失函数可直接拓展至更多候选说话人的识别场景.
本文提出基于脑电听觉注意力线索解耦与跨模态对比学习的目标说话人识别方法(DCLNet), 整体架构如图1所示.
针对当前研究中存在的神经编码冗余、语音身份特异性表征缺失、双模态特征匹配不足问题, 分别设计脑电静态-动态解耦变分表征学习模块、基于预训练ECAPA-TDNN(Emphasized Channel Attention, Propagation and Aggregation in Time Delay Neural Network Based Speaker Verification)[24]与可训练适配器的语音身份编码器, 以及说话人感知的跨模态对比学习损失.DCLNet以多通道EEG信号e与各说话人对应的干净语音流
在EEG分支中, SDDM先通过EEG前置编码器对原始EEG进行多粒度时序建模与通道重要性加权, 获得紧凑的脑电信号e1∶ T.再利用时序解耦变分自编码器将e1∶ T显式分解为静态潜变量zs与动态潜变量zd, 1∶ T, 其中, zs编码相对稳定的目标说话人身份信息, zd, 1∶ T编码随语音时序动态变化的听觉注意力跟踪线索.动态潜变量与解码器仅在训练阶段用于建立静态-动态功能分工.
具体而言, 解码器被约束为同时利用静态潜变量与动态潜变量重建EEG紧凑特征, 使静态分支更集中地编码跨时间稳定的目标说话人身份信息, 而动态分支承担随语音时序变化的听觉注意力跟踪线索建模.推理阶段仅保留前置编码器与静态编码器, 动态编码器、解码器及互信息辅助网络均被丢弃, 因此该设计不会增加实际部署时的前向计算开销.SDDM学习过程由解耦变分表示学习损失LSDDM进行监督.
在语音分支中, 每段候选干净语音a(k)先经预训练ECAPA-TDNN主干提取整段级说话人嵌入, 再由一个轻量可训练适配器映射至与zs维度一致、度量空间统一的公共表征空间, 得到身份表征v(k).在此基础上, 说话人感知的跨模态对比学习损失LCL以zs为锚, 拉近其与目标说话人语音身份表征的距离, 并推远与其它干扰说话人身份表征的距离.同时以v(k)为锚, 在批次内对共享同一目标说话人的zs施加对称的聚类约束, 抑制跨样本说话人身份偏移.整体训练目标为LSDDM与LCL的加权.
在推理阶段中, 模型参数固定, 仅利用前置编码器与静态编码器输出zs, 并以zs与各候选语音身份表征的余弦相似度作为匹配得分, 选取得分最高者为预测目标说话人.
DCLNet各模块功能如表1所示.
| 表1 DCLNet各模块功能 Table 1 Functions of each module in DCLNet |
时序解耦变分自编码器以序列变分自编码器(Sequential Variational Autoencoder, SVAE)[25]为理论基础, 通过静态分支与动态分支的协同建模, 将序列信号中的时不变属性与时变动态过程分离, 其有效性已在语音转换、目标语音提取等语音信号处理任务中得到验证.受听觉注意力层级加工机制启发, 本文将时序解耦变分自编码器引入脑电听觉注意力建模, 将EEG中蕴含的注意力线索显式分解为两类互补成分:1)跨决策窗口相对稳定的目标说话人身份信息, 由静态潜变量编码; 2)随语音时序动态演化的听觉注意力跟踪线索, 由动态潜变量编码.
引入动态潜变量与解码器的目的并非是在推理阶段重建EEG, 而是在训练阶段为静态潜变量提供解耦约束.若仅使用静态编码器, 模型容易将说话人身份信息与时变声学跟踪线索共同压缩至同一表征中, 导致静态表征承担过多的动态信息, 削弱其与语音身份嵌入的跨模态匹配能力.因此, 本文要求解码器同时利用与重建前置编码器输出的EEG紧凑特征:动态分支负责补偿静态表征无法覆盖的时序变化, 静态分支保留重建所需的全局身份属性.同时, 互信息上界约束进一步抑制两类潜变量之间的信息泄漏, 避免重建目标导致冗余编码.完成训练后, 动态编码器、解码器与互信息辅助网络均不参与推理, 仅用于目标说话人匹配.
2.3.1 脑电前置编码器
脑电前置编码器FEnce由多尺度时序特征提取器(Multi-scale Temporal Feature Extractor, MsTFE)、通道注意力模块(Squeeze-and-Excitation, SE)与二维深度可分离卷积(DWConv2D)组成, 将原始EEG转换为紧凑表征, 具体架构如图2所示.
考虑到EEG同时包含跨周期的长时趋势与瞬时短时动态, 首先采用MsTFE提取时序特征.MsTFE由两条并行分支构成:补丁卷积分支建模跨周期变化, 细粒度卷积分支提取局部短时动态.具体而言, 对于长度为Te的EEG, 预设分块尺寸列表{l1, l2, …, lN}.对于第n个分块尺寸ln, 将信号在时间维度上重构为
其中, DWConv2D(· )表示二维深度可分离卷积, PWConv(· )表示逐点卷积, BN(· )表示批归一化, σ (· )表示LeakyReLU(Leaky Rectified Linear Unit)激活函数.最后将各尺度二维卷积输出重构回一维序列并沿特征维度拼接, 得到补丁分支输出信号em.细粒度卷积分支由两个串行一维卷积构成, 先采用核尺寸为3的一维卷积扩展特征维度, 再采用核尺寸为8的一维卷积压缩维度, 在平衡特征丰富度与计算效率的同时捕获多尺度局部时序模式:
ef=σ (BN(Conv1D(σ (BN(Conv1D(e)))))),
其中Conv1D(· )表示一维卷积.
补丁卷积分支输出与细粒度卷积分支输出在特征维度拼接后, 经过一组深度可分离卷积进行自适应融合, 得到EEG多尺度融合信号e'∈
e1∶ T=(e1, e2, …, eT)∈
其中et∈ RD表示第t帧脑电信号.
2.3.2 时序解耦变分自编码器
时序解耦变分自编码器将e1∶ T映射为两组相互独立的潜变量.1)静态潜变量zs.编码与目标说话人身份相关的稳定注意偏向信息, 不受时序变化影响.2)动态潜变量zd, 1∶ T.捕获随时间动态演化的听觉注意力追踪状态及其时序特征.
基于静态-动态解耦的生成假设, 联合分布可解耦为:
p(e1∶ T, zs, zd, 1∶ T)=p(zs)
其中, p(zs)表示静态潜变量先验分布, p(zd, t)表示动态潜变量先验分布, p(et|zs, zd, t)表示真实后验分布.
为了降低模型复杂度, 参照先前工作的通用设定[27, 28], 将动态潜变量的先验约束建模为时间独立的标准高斯分布, 舍弃时序建模中常用的关联约束, 但动态性仍可通过后验编码器的时序依赖与解码器的序列建模得以保留.
由于真实后验分布不可解析求解, 需采用变分推断法, 引入变分分布近似真实后验.为了实现静动态解耦目标, 变分后验分布可分解为静态潜变量与动态潜变量后验的乘积形式:
$\begin{array}{l} q_{\phi}\left(\boldsymbol{z}_{s}, \boldsymbol{z}_{d, 1: T} \mid \boldsymbol{e}_{1: T}\right)= \\ \quad q_{\phi_{s}}\left(\boldsymbol{z}_{s} \mid \boldsymbol{e}_{1: T}\right) \prod_{t=1}^{T} q_{\phi_{d}}\left(\boldsymbol{z}_{d, t} \mid \boldsymbol{z}_{d, < t}, \boldsymbol{e}_{1: T}\right) . \end{array}$
其中:静态潜变量后验分布
均值 μ s与方差σ s由静态编码器Es输出; 动态潜变量后验分布
均值 μ d, t由动态编码器Ed结合历史潜变量zd, < t与脑电信号e1∶ T给出, 方差固定为单位矩阵以简化训练.
两组潜变量均采用重参数化技巧实现可微采样, 并通过最大化证据下界ELBO(Evidence Lower Bound)近似最大化数据对数似然.训练时等价于最小化负ELBO, 其损失表示为:
$ \begin{aligned} L_{\mathrm{ELBO}}= & -E_{q_{\phi}}\left[\sum_{t=1}^{T} \ln p\left(\boldsymbol{e}_{t} \mid \boldsymbol{z}_{s}, \boldsymbol{z}_{d, t}\right)\right]+ \\ & D_{\mathrm{KL}}^{s}\left[q_{\phi_{s}}\left(\boldsymbol{z}_{s} \mid \boldsymbol{e}_{1: T}\right) \| p\left(\boldsymbol{z}_{s}\right)\right]+ \\ & \sum_{t=1}^{T} D_{\mathrm{KL}}^{d}\left[q_{\phi_{d}}\left(\boldsymbol{z}_{d, t} \mid \boldsymbol{z}_{d, < t}, \boldsymbol{e}_{1: T}\right) \| p\left(\boldsymbol{z}_{d, t}\right)\right] . \end{aligned} $
上式第1项为重建损失, 本节采用均方误差
Lrec=
实现, 确保静动态潜变量保留原始信号的有效注意力线索信息, 其中
LSDDM=Lrec+
其中, LMI表示静动态潜变量之间的互信息上界, β 表示其权重.
2.3.3 最小化互信息上界
I(zs, zd, 1∶ T)=
由于高维表示上的互信息通常难以直接计算, 本节利用vCLUB(Variational Form of Contrastive Log-Ratio Upper Bound)进行可微近似[29].引入辅助变分网络qθ (zd, t|zd, < t, zs)对真实条件分布进行拟合, 序列互信息的vCLUB上界损失为:
$ \begin{aligned} L_{\mathrm{MI}}= & \frac{1}{B} \sum_{t=1}^{T} \sum_{i=1}^{B}\left[\ln q_{\theta}\left(z_{d, t}^{(i)} \mid z_{d, < t}^{(i)}, z_{s}^{(i)}\right)-\frac{1}{B} \sum_{j=1}^{B} \ln q_{\theta}\left(z_{d, t}^{(j)} \mid z_{d, < t}^{(j)}, z_{s}^{(i)}\right)\right], \end{aligned} $
其中B表示批次大小.上式第1项对应配对样本的条件对数似然, 第2项在批次内打乱zs与zd, 1∶ T的配对, 近似边缘乘积期望.最小化LMI有助于降低zs与zd, 1∶ T之间的统计依赖.
vCLUB仅在qθ (· )足够逼近真实条件后验时才能作为有效上界, 否则可能低估甚至输出负值.因此qθ (· )以最大化条件对数似然为目标进行独立优化:
LLLD=-
该互信息估计辅助网络qθ (· )采用多层感知机实现, 并输出条件高斯分布的均值与对数方差, 以此近似zd, t关于zd, < t与zs的条件分布.训练时LLLD仅更新qθ (· )的参数θ , 不回传至主干编码器; LMI在更新主干时需对qθ (· )施加梯度截断[28], 提升vCLUB的无偏性上界估计的稳定性.
2.3.4 脑电静态-动态编解码器
2.3.2节在概念上将zs与zd, 1∶ T视作相互独立的两组潜变量, 但是, 如果两分支共用一组编码参数, 时序动态模式极易泄漏至静态分支中.因此, 本节在SDDM主干中采用相互独立的静态编码器Es与动态编码器Ed, 分别建模静态潜变量后验
静态编码器Es以前置脑电编码器输出的紧凑信号e1∶ T为输入, 输出静态潜变量的后验参数( μ s, ln
动态编码器Ed与上文Es共享输入信号e1∶ T, 但结构上侧重对时序演化的建模.输入先经一层一维卷积与LeakyReLU激活得到局部特征, 再输入一个两层双向长短期记忆网络(Bidirectional Long Short-Term Memory, Bi-LSTM)捕获长程时序依赖.为了增强浅层特征传递与梯度流动, 在卷积输出与Bi-LSTM输出之间引入残差连接.融合特征经一层全连接与LeakyReLU激活后得到均值 μ d, 1∶ T, 结合动态后验方差固定为单位矩阵的设定, 可通过重参数化采样得到动态潜变量序列zd, 1∶ T.
解码器De负责将zs与zd, 1∶ T融合以重构e1∶ T, 整体采用动态分支提供时变骨架、静态分支以条件仿射调制持续注入全局属性的设计.zd, 1∶ T先经Bi-LSTM进一步建模时序依赖, 得到初始解码特征, 作为第1个A3MLN(Auditory Attention Adaptive Mo-dulation Layer Normalization)调制块的输入.再串联4个结构相同、参数独立的A3MLN调制块, 完成静态-动态协同重构.
对于第l(l=1, 2, 3, 4)个调制块, 记其输入特征为
γ (l)=Conv1Dγ (
其中Conv1Dγ (· )、Conv1Dβ (· )表示相应一维卷积核.
然后在每个时间步上对
其中LayerNorm(· )表示层归一化.
如上所述, 动态分支将始终处理细粒度的时变信息流, 静态分支则以条件调制的形式在每层持续注入时间不变的全局属性.经过4个A3MLN调制块后, 末层输出通过一个卷积层投影回D维, 得到重构特征
语音身份编码器由预训练ECAPA-TDNN与轻量可训练适配器构成, 为当前声学场景中的每位候选说话人提取稳定、可区分且与脑电静态潜变量维度一致的身份表征.ECAPA-TDNN是说话人识别领域经典的整段级表征模型, 通过多尺度SE-Res2Block(Squeeze-and-Excitation Res2Net Block)与通道注意力池化聚合长时语音信息, 能突出说话人身份相关的稳定声学属性, 并弱化语义内容与短时声学动态的干扰.
本文选用在VoxCeleb数据集上预训练的ECAPA-TDNN作为语音侧身份先验编码器.大规模说话人识别预训练使其获得较强的说话人判别表征能力, ECAPA-TDNN可将训练阶段未出现的新说话人语音映射至连续嵌入空间中, 并保持同一说话人嵌入相近、不同说话人嵌入相离的判别结构.因此, 在推理阶段, 模型仅需对当前场景中实际存在的候选干净语音流提取身份嵌入, 经适配器映射后与EEG静态潜变量计算余弦相似度, 即可完成目标说话人匹配.该过程无需预先注册目标说话人身份, 也不依赖固定说话人类别标签, 因此能适配真实助听场景中面向陌生说话人的开集识别需求.
对于与第i个脑电样本同步呈现的第k段候选语音a(i, k), 首先通过部分微调的预训练ECAPA-TDNN主干网络得到说话人嵌入:
u(i, k)=fECAPA-TDNN(a(i, k); θ ECAPA)∈
其中, θ ECAPA表示ECAPA-TDNN主干网络参数, da表示ECAPA-TDNN输出维度.由于da通常与静态潜变量维度D不一致, 本节在ECAPA-TDNN后引入轻量可训练适配器, 将其映射至统一的公共表征空间.为了兼顾非线性映射能力与原始说话人空间结构保持, 适配器采用带残差的轻量MLP(Multi-layer Perceptron)结构, 输出为:
v(i, k)=W2(RELU(W1u(i, k)))+Wru(i, k)∈ RD,
其中, RELU(· )表示激活函数, W1与W2构成非线性分支, Wr为残差投影分支, D表示特征维度.然后对第i个脑电样本静态潜变量
为了使脑电静态潜变量zs仅编码目标说话人身份信息, 即既与目标说话人的语音身份表征相近, 又与其他说话人的语音身份表征相远, 本节设计说话人感知的双向对比学习损失, 其中:样本级损失以单次试次内的候选语音集合为候选集, 提供逐样本的细粒度判别信号; 跨样本监督对称正则利用批次内的目标说话人标签, 在脑电侧显式施加说话人级聚类约束.
2.5.1 样本级对比学习损失
对于每个样本i, 当前注意的目标说话人标签为y(i), 对应的语音身份表征为
Lz→ v=-
其中, τ 表示温度系数, 用于调节相似度分布的锐度.该损失直接将
2.5.2 跨样本监督对称正则
仅有Lz→ v时, 每个样本i的监督只发生在同切片时刻的K段候选之间, EEG静态潜变量
P(i)={j∈ {1, 2, …, B}∶ y(j)=y(i)},
其中, 索引p∈ P(i)对应的
$\begin{array}{l} L_{v \rightarrow z}= -\frac{1}{B} \sum_{i=1}^{B}\left(\frac{1}{|P(i)|} \sum_{p \in P(i)}\left(\ln \left(\frac{\exp \left(\frac{\widetilde{\boldsymbol{v}}^{\left(i, y^{(i)}\ \right) \mathrm{T}} \ \ \widetilde{\boldsymbol{z}}_{s}^{(p)}}{\tau}\right)}{\sum_{j=1}^{B} \exp \left(\frac{\widetilde{\boldsymbol{v}}^{\left(i, y^{(i)}\ \right)^{\ \mathrm{T}}} \ \widetilde{\boldsymbol{z}}_{s}^{(j)}}{\tau}\right)}\right)\right)\right) . \end{array}$
Lv→ z利用批次内的说话人标签信息, 在EEG空间侧显式建模说话人级聚类结构, 保证同一目标说话人下的EEG静态潜变量被聚为一簇, 不同目标说话人对应的簇在公共表征空间中相互分离.最终的说话人感知的跨模态对比学习损失定义为两方向损失的均值:
LCL=
DCLNet的整体训练目标LSI由脑电解耦变分表示学习损失LSDDM与说话人感知对比学习损失LCL加权组成:
LSI=LSDDM+λ CLLCL
其中λ CL表示对比学习损失的权重.LSI通过LSDDM保证EEG静态表征与动态表征的有效解耦, 使静态潜变量zs更专注于稳定的目标说话人身份信息, 并通过LCL将zs与对应目标说话人的语音身份表征拉近、与其余非注意说话人的身份表征拉远, 显著增强静态潜变量的跨模态身份对齐能力.
DCLNet涉及如下3类参数:
1)EEG支路参数Θ EEG={θ E,
2)语音支路参数Θ Sp={θ ECAPA, θ Adapter}, 其中θ ECAPA表示ECAPA-TDNN主干网络参数, θ Adapter表示适配器参数.
3)互信息估计辅助网络参数θ q.
由于vCLUB上界的有效性依赖qθ 对真实条件后验的精准拟合, 而预训练ECAPA-TDNN与随机初始化的EEG分支在优化特性上差异较大, 本节采用三阶段训练策略, 分阶段引入对比学习与说话人主干的微调, 兼顾解耦学习的稳定性与预训练说话人表征的迁移效果.
1)阶段1:SDDM预热与MI估计器交替优化.该阶段仅使用Θ EEG与LLLD, 暂不启用对比学习损失LCL, 语音支路参数Θ Sp全部冻结.目标是在引入说话人监督前, 先让EEG分支建立起初步的静动态解耦结构.在每次迭代内执行如下两步交替:先固定Θ EEG, 以LLLD为目标独立更新θ q, 使辅助网络能适配当前EEG分支输出的(zs, zd, 1∶ T)分布; 再固定θ q, 以LSDDM为目标更新Θ EEG, 此时对LMI计算图中的qθ 施加梯度截断, 避免vCLUB估计误差通过辅助网络错误回传至主干编码器.为了避免训练初期不稳定的qθ 输出扰乱主干的表征学习, β 采用指数预热策略:
$\beta(t)=\beta_{\max }\left(1-\exp \left(\frac{-\eta t}{T_{1}}\right)\right)$,
其中, t表示当前迭代步数, T1表示阶段1总迭代步数, η 控制预热速度.这样可保证解耦约束在qθ 尚未稳定的训练早期只给出较弱的监督信号, 随着训练深入逐步增强至目标权重.
2)阶段2:冻结ECAPA-TDNN主干的跨模态身份对齐训练.在阶段1结束、EEG分支已获得初步解耦能力后, 引入跨模态对比学习损失, 将静态潜变量zs显式约束到与语音身份一致的公共空间.该阶段仍冻结ECAPA-TDNN主干参数θ ECAPA, 可训练参数扩展为Θ EEG∪ {θ Adapter}.训练目标为联合损失LSI, 并继续按阶段1的方式与主干交替更新θ q并保持梯度截断机制.冻结ECAPA-TDNN主干而仅训练适配器, 该设计可在保持大规模预训练说话人先验空间稳定的同时, 避免跨模态对齐早期的梯度噪声对预训练语音主干造成破坏性更新.LCL在阶段2保持阶段1结束时的目标值不再变化.
3)阶段3:解冻ECAPA-TDNN末端层的小学习率联合微调.在阶段2收敛后, 为了进一步缓解预训练说话人空间与脑电-语音目标任务之间的域差异, 解冻ECAPA-TDNN主干的最后两个残差块及统计池化与全连接投影层, 其余层保持冻结.该阶段采用分组学习率策略:解冻层的学习率设置为阶段2学习率的0.1倍, 其余可训练参数沿用阶段2学习率.损失函数与θ q交替优化策略与阶段2完全一致.较小的学习率既可让ECAPA-TDNN的高层表征适配当前脑电-语音匹配任务, 又能避免其整体说话人判别空间被破坏.
经过上述三阶段训练后, 全部参数固定.推理阶段仅保留EEG支路的前置编码器与静态编码器(不再使用动态编码器、解码器与qθ ), 以及语音支路的ECAPA-TDNN主干与适配器.对于给定的测试脑电片段etest及其同步呈现的环境说话人语音流$\left\{\boldsymbol{a}^{(k)}\right\}_{k=1}^{K}$, 先利用EEG前置编码器与SDDM, 得到测试样本静态潜变量的归一化结果:
$\tilde{\boldsymbol{z}}_{s, \text { test }}=\frac{\boldsymbol{z}_{s, \text { test }}}{\left\|\boldsymbol{z}_{s, \text { test }}\right\|_{2}} .$
然后利用预训练ECAPA-TDNN与适配器得到每位候选说话人的归一化身份表征
$sim^{(k)}=\tilde{\boldsymbol{z}}_{s, \text { test }}^{\mathrm{T}} \tilde{\boldsymbol{v}}^{(k)} .$
最终预测被注意说话人索引:
$\hat{y}=\arg \max _{k} sim^{(k)}$
本文在DTU[30]、KUL[15]这2个公开听觉注意力脑电数据集上验证DCLNet的有效性.DTU数据集源自丹麦技术大学(Technical University of Den-mark), 包含18名被试, 听觉刺激由1名男性发言人与1名女性发言人同时讲丹麦语构成, 2组语音分别从左右± 60° 方向播放, 采用64通道BioSemi系统记录, 原始采样率为512 Hz, 针对每位被试共采集约50 min数据.KUL数据集源自比利时鲁汶大学(Katholieke Universiteit Leuven), 包含16名被试, 听觉刺激由2位男性讲述的多篇荷兰语故事构成, 2组语音分别从左右± 90° 方向通过耳机播放, 采用64通道BioSemi系统在隔音电磁屏蔽室内记录, 原始采样率为8 192 Hz, 面向每位被试共采集约48 min数据.DTU、KUL数据集在说话人性别构成、空间分离角度与混响条件上存在显著差异, 可在性别可分与同性别两类典型场景中进行鲁棒性实验.
为了消除噪声干扰、统一输入格式并避免信息泄漏, 在2个数据集上执行完全一致的预处理流程.针对EEG信号, 先进行共同平均参考, 降低共模噪声与基线漂移.
再利用1~50 Hz带通滤波器, 保留与听觉注意加工高度相关的神经振荡成分, 滤除直流偏移、工频干扰与高频肌电等噪声.然后统一降采样至128 Hz, 降低计算复杂度.最后将每个试次按0.5 s、1 s、1.5 s这3种无重叠窗口切割, 覆盖低延迟到中等延迟的不同决策场景.在语音端将原始语音流采样率从44.1 kHz下采样至14.7 kHz, 以此匹配ECAPA-TDNN的输入要求并控制前向计算开销.EEG与对应的多段干净语音流按相同时间索引同步裁剪为对应窗长的切片, 每个切片同时包含一段多通道脑电信号与各候选说话人的同步干净语音流, 作为方法的一组输入样本.
为了确保方法性能评估结果稳健无偏, 按被试分别开展跨试次验证, 将同一试次样本严格分隔在训练集、验证集与测试集之间, 避免因试次内数据复用引发的潜在信息泄露.
实验模型基于PyTorch深度学习框架搭建, 在Ubuntu 20.04.6操作系统上运行, 计算硬件采用单块NVIDIA RTX 3090 GPU.每名被试的EEG数据按照8∶ 1∶ 1的比例划分训练集、验证集和测试集.选用Adam(Adaptive Moment Estimation)优化器, 设定初始学习率为0.000 3, 权重衰减系数为0.000 5, 最大训练轮数为300轮, 批次大小为32.
互信息上界LMI的计算采用指数预热策略, 最终权重β max=0.1、预热速率η =5.说话人感知对比学习损失权重λ CL经验证集网格搜索后设置为1.0, 对比学习温度系数τ =0.1.三阶段训练轮数比例设置为15%、70%、15%.上述方案基于如下考虑:阶段1只需让qθ 适配上主干分布并完成β 指数预热, 且仅有LSDDM一个监督目标, 收敛较快; 阶段2同步开展跨模态对比对齐、SDDM持续优化与qθ 持续跟踪三项任务, 是方法完成主要表征重塑的重要阶段, 因此分配最长训练时间; 阶段3仅对ECAPA-TDNN末端两个SE-Res2Block及统计池化、全连接投影层进行小学习率微调, 时间过长容易破坏阶段2已建立的跨模态对齐结构.在阶段3中, ECAPA-TDNN解冻层学习率为阶段2学习率的0.1倍, 其余可训练参数沿用0.000 3.
在方法结构中, 为了适配不同决策窗长, MsTFE针对0.5 s、1 s、1.5 s这3种决策窗长采用差异化的分块列表与卷积核尺寸, 对应输入序列长度分别为64、128、192, 分块尺寸列表统一选自{2, 4, 8, 16, 32, 64}的子集, 深度卷积核大小列表对应为{2, 4, 8, 8, 4, 2}.基于VoxCeleb数据集预训练的开源ECAPA-TDNN对短时语音具有良好鲁棒性, 支持0.1~5 s的短语音段输入, 输出维度da=192, 适配器将其映射至D=256的公共表征空间, 与EEG静态潜变量维度保持一致.EEG前置编码器输出维度D=256, 静态编码器内置两层无位置编码的Transformer的隐层维度为256、注意力头数为8, 动态编码器由隐层维度为128、dropout为0.2的两层Bi-LSTM构成, 解码器内置两层LSTM与4个串联的A3MLN调制块.互信息估计辅助网络qθ (· )由3层多层感知机构成, 隐层维度为256.
评价指标采用所有被试上的平均分类准确率± 标准差.
为了全面验证DCLNet的有效性, 与当前主流的EEG目标说话人识别方法进行系统对比, 包括文献[16]方法、基于频带与通道注意力的CNN-FC(Con-volutional Neural Network with Frequency and Channel Neural Attention)[20]、基于跨模态对齐的CMAA[19]、模拟大脑听觉信息渐进式整合的EEGViT[23]、基于卷积滤波器组与对比学习的SincAlignNet[31].实验结果均引自原文献.
各方法在DTU、KUL数据集上不同决策窗口下的分类准确率如表2所示.
| 表2 各方法在不同决策窗长下的分类准确率对比 Table 2 Comparison of classification accuracy among different methods under different decision window lengths |
由表2可见, DCLNet在2个数据集上均取得最优的分类准确率.在KUL数据集上, DCLNet在0.5 s、1 s和1.5 s决策窗口下的分类准确率分别达到64.9%、67.4%和68.2%.在DTU数据集上, 分类准确率也达到75.8%、81.9%和82.8%.由此可见, SDDM将脑电特征显式解耦为静态潜变量与动态潜变量, 仅以静态潜变量参与跨模态匹配, 从源头上抑制身份无关时序波动对匹配阶段的干扰.预训练ECAPA-TDNN提供的外部说话人身份先验为脑电侧的对比学习提供结构稳定、判别性强的锚定目标, 相比SincAlignNet、CMAA所用的语音包络或自学习语音表征, ECAPA-TDNN更契合身份判别本质.同时, 跨模态对比学习损失在样本级与说话人级两个尺度上同时约束静态潜变量, 与解耦设计形成互补, 使其在公共表征空间中按说话人有序组织.
此外, 在DTU数据集上的分类准确率都高于在KUL数据集上的结果, 这是由于DTU数据集的音频刺激来自2位不同性别的说话人, 不同性别语音在基频、频谱与时间精细结构上差异显著[32, 33], 因此其语音流之间的可区分度更高.KUL数据集上语音均来自2位男性说话人, 声学特征重叠度较高, 语音流间的掩蔽效应较强, 可区分度相对较低[34].
在听觉注意目标说话人识别任务中, 不同EEG通道捕获的信息存在差异.为了探究通道权重关系, 在多尺度特征融合后引入SE模块, 通过自适应权重实现脑电通道空间相关性与重要性的有效建模.现绘制DTU、KUL数据集上各被试脑区权重图(图3 (a)、(b))及2个数据集上被试平均脑区权重图(图3 (c)、(d)).
由图3可见, 前额叶与顶枕叶为权重优势核心脑区.在多数被试的脑区权重图中均能清晰观察到高权重区域, 在2个数据集的平均权重图中也有明显体现, 具有较好的数据集通用性.已有研究表明, 前额叶是实现注意控制与选择的关键脑区[35, 36], 该脑区的高权重说明SE模块能有效强化其关键信息, 为被试完成目标语音的注意选择提供支持.右侧顶枕叶与多模态整合过程相关[37], 其显著的权重特征表明该脑区参与本次任务中的多模态整合过程.上述实验结果与听觉注意力脑电机制的相关研究结论一致, 由此验证SE模块在脑电通道权重建模中的有效性.
为了验证SDDM对DCLNet性能的独立贡献, 设计如下4个变体进行对比.
1)变体1.移除SDDM, 直接使用前置编码器输出的全局脑电特征引导主干网络.
2)变体2.保留SDDM, 但将静态编码器中的Transformer替换为一维卷积和全局平均池化.
3)变体3.保留SDDM, 但将动态编码器中的Bi-LSTM替换为纯卷积网络.
4)变体4.保留SDDM, 但在训练阶段去除联合损失函数中的互信息上界惩罚项.
SDDM的消融实验结果如表3所示.
| 表3 SDDM的消融实验结果 Table 3 Ablation experiment results of SDDM |
由表3可知, 变体1的性能下降最显著, 表明将脑电特征解耦为身份静态潜变量与时变动态潜变量有助于提升目标说话人识别性能.静态编码器替换Transformer和动态编码器去除Bi-LSTM均导致分类效果明显退化, 表明Transformer和Bi-LSTM在当前框架下分别有助于静态全局信息建模与动态时序信息建模.变体4的结果进一步说明, 互信息约束增强静态潜变量与动态潜变量的表示分工, 分别和语音表征进行跨模态匹配, 有助于建立稳定可靠的脑电-语音关联映射关系.
为了验证本文引入的外部语音身份先验设计的合理性, 设计3组对照实验, 对比不同身份建模方式对最终目标说话人识别性能的影响.
1)实验1:可学习嵌入表.构造可学习参数矩阵s∈ R2× D, 其中每行对应一个候选说话人的可学习身份向量.训练损失与Lz→ v保持一致, 仅将语音身份表征
2)实验2:预训练ECAPA-TDNN+适配器.即2.4节所述结构, 由预训练说话人编码器提供身份先验, 再通过轻量适配器映射至与EEG静态潜变量一致的公共空间.
3)实验3:二分类头.去掉语音身份编码器和跨模态对齐, 仅在zs上接入全连接层与sigmoid, 直接输出被注意说话人的标签概率:
训练时使用二元交叉熵损失, 推理时按$\hat{p}_{i}$是否大于0.5进行二分类.
3种身份建模方式的分类准确率对比如图4所示.
| 图4 1 s决策窗长下不同身份建模方式的分类准确率对比Fig.4 Comparison of classification accuracy of different identity modeling methods at a decision window length of 1 s |
由图4可见, 预训练ECAPA-TDNN+适配器方案在2个数据集上均取得最优值, 说明引入具有说话人判别先验的外部身份空间, 能更有效地将EEG静态潜变量约束至一致的跨模态身份匹配空间中, 从而提升目标说话人识别的准确性.相比之下, 可学习嵌入虽然也能为不同类别提供锚点, 但其向量完全由当前任务监督端到端学习得到, 缺乏大规模说话人识别任务形成的结构化身份先验, 因此更容易退化为仅适配当前任务标签的相关表征.直接二分类头的优化目标更接近标签分类而非候选说话人匹配, 因此与推理阶段基于余弦相似度进行候选选择的范式并不一致.此外, 该设置在训练阶段完全移除语音模态及跨模态约束, 原有表征空间更容易退化为仅服务于当前任务标签的任意二分类判别空间.由此可见, DCLNet的有效性并非来源于任意二分类边界的学习, 而在于借助外部说话人先验提供的结构化身份空间, 引导EEG表征学习更符合目标说话人识别任务本质的跨模态身份一致性.
为了对SDDM的解耦假设进行功能性验证, 进一步设计探针实验, 考察zs中判别说话人身份的信息含量.实验在1 s决策窗长下进行, 沿用主实验的数据集划分原则, 冻结DCLNet主干, 对各子集(数据集划分后)样本经前向传播得到静态潜变量zs与动态潜变量zd, 1∶ T, 将被试当前注意的说话人索引y∈ {A, B}作为监督信号, 在训练集潜变量上训练一个两层MLP分类器, 优化目标为标准交叉熵损失.
在该探针上, 本节对照测试如下3组输入.
1)输入1:静态潜变量zs.
2)输入2:动态潜变量沿时间维平均后得到的
3)输入3:移除SDDM后前置编码器的输出e1∶ T平均池化后的结果
需要指出的是, 输入1中基于静态潜变量的实验结果并不等同于本文主任务结果.前者是在完整DCLNet训练完成后, 冻结已接受语音身份先验与跨模态对比学习约束的静态潜变量, 并在其上附加轻量分类器得到的表征分类结果.后者是在完整跨模态匹配框架下, 结合候选语音身份表征完成目标说话人识别.因此, 探针实验主要用于说明静态潜变量中是否富含可直接读出的身份判别信息, 而不是用于替代主任务性能评价.
3种输入表征上的探针分类结果如图5所示.由图可观察到, zs上的分类准确率显著高于
为了进一步探究超参数对DCL-Net性能的影响, 在DTU数据集上基于1 s决策窗长开展参数敏感性分析, 分别对三阶段训练轮数比例、说话人感知的跨模态对比学习损失权重λ 、温度系数τ 进行对比实验.实验过程中仅改变当前待分析参数, 其余训练设置均与实现细节保持一致.
三阶段训练比例对DCLNet性能的影响如表4所示.
| 表4 三阶段训练比例对DCLNet性能的影响 Table 4 Effect of three-stage training ratio on DCLNet performance % |
由表4可见, 不同三阶段训练轮数比例对应的分类准确率最大相差1.3%, 说明DCLNet性能对三阶段训练轮数配比并不敏感, 其中(15%, 70%, 15%)的配比取得最高准确率.若第1阶段占比仅为10%, SDDM预热与互信息估计器拟合不充分, 方法还未学习稳定的解耦表征, 就提前进入跨模态联合优化阶段.若增大阶段1和阶段3占比, 阶段2训练轮数会相应减少.阶段2需要同步完成静态潜变量与语音身份表征对齐、SDDM持续优化、互信息估计器跟踪等任务, 训练不足会导致跨模态身份空间无法充分构建.因此采用(15%, 70%, 15%)的三阶段训练比例, 有助于同时完成EEG解耦表征学习、跨模态身份对齐与语音编码器末端微调.
将三阶段训练轮数比例固定为(15%, 70%, 15%)、温度系数τ =0.1, 进一步探究说话人感知的跨模态对比学习损失权重λ 对DCLNet的影响.当λ =0.1, 0.5, 1.0, 2.0, 5.0时, 分类准确率依次为79.2%± 5.1%, 81.1%± 4.5%, 81.9%± 4.2%, 81.4%± 4.3%, 79.8%± 4.9%.当λ 处于0.5到2.0之间时, DCLNet性能变化较小, 并在λ =1.0时取得最优值.较小的λ 难以对EEG静态潜变量施加充分的跨模态身份约束, 不利于其与预训练语音身份空间的对齐, 而较大的λ 会使联合优化过程过度偏向跨模态对比目标, 削弱重建损失与解耦约束对EEG学习的作用.实验表明, 设置λ =1.0可平衡静态-动态表征解耦与跨模态身份对齐两项任务.
在λ =1.0的基础上, 进一步分析温度系数τ 对DCLNet性能的影响.当τ =0.05, 0.1, 0.2, 0.5时, 分类准确率依次为80.3%± 4.7%, 81.9%± 4.2%, 81.0%± 4.5%, 78.6%± 5.3%.τ =0.1时性能最优.温度系数较大时, 相似度分布趋于平滑, 正负样本之间的差异被削弱, 导致跨模态对比学习提供的判别性监督不足; 温度系数过小时, 相似度分布过于尖锐, 梯度主要集中于少数困难样本, 容易增加方法优化过程中的不稳定性.因此, 本文将温度系数τ 设为0.1.
本文针对复杂听觉场景中的目标说话人识别问题, 提出基于EEG听觉注意力线索解耦与跨模态对比学习的目标说话人识别方法(DCLNet).脑电侧设计静态-动态解耦变分表征学习模块, 将EEG显式分解为编码说话人身份信息的静态潜变量与刻画时变听觉跟踪线索的动态潜变量.在语音侧引入预训练ECAPA-TDNN与轻量适配器, 将候选语音映射至与EEG静态潜变量一致的公共表征空间.在跨模态对齐侧设计说话人感知的跨模态对比学习损失, 在样本级与说话人级两个尺度上同时约束静态潜变量.三者通过三阶段交替优化训练策略协同优化, 兼顾解耦学习的稳定性与预训练说话人表征的迁移效果.在DTU、KUL数据集上的实验表明, DCLNet在不同决策窗长下性能均较优.消融实验与探针实验进一步表明, 静态-动态解耦切实增强静态表征中与目标说话人身份相关的信息含量.相比直接二分类和可学习嵌入, 预训练ECAPA-TDNN提供的结构化身份空间更利于构建稳定的脑电-语音跨模态匹配关系.脑电通道权重可视化显示, 前额叶与顶枕叶在该任务中表现出较高的重要性, 与已有关于注意控制和多模态整合的研究结论一致.
本文研究仍存在若干局限性, 有待进一步改进.在前置处理方面, DCLNet提供高质量的候选干净语音流, 语音分离质量直接影响说话人嵌入提取的准确性并产生级联影响, 并且在强混响、高度重叠或低信噪比等极端声学条件下, 分离误差可能导致显著性能退化, 未来应探索语音分离模块与AAD框架的端到端联合优化.在时序建模方面, DCLNet对各决策窗口独立推理, 未显式利用历史决策信息.由于听觉注意力在时间上具有一定惯性, 引入跨窗口时序平滑机制, 有望在保持注意切换响应速度的同时进一步抑制偶发误判, 是重要改进方向之一.在抗噪能力方面, 现有实验在理想化安静采集环境下完成, 未对真实使用中的环境噪声、头动伪迹等干扰进行系统评估, 未来需在添加不同类型与强度噪声干扰的条件下系统测试方法抗噪能力, 并探索数据增强或鲁棒性训练策略以提升方法在嘈杂真实助听场景中的可靠性.在多说话人场景的适用性方面, 尽管DCLNet在结构上可扩展至更多的候选说话人, 但其在三人及以上复杂声学场景中的性能退化规律和实时鲁棒性尚未得到系统验证, 未来将结合真实助听场景开展多说话人条件下的进一步研究.在部署适配方面, 当前方案尚未针对助听器芯片进行模型剪枝、量化及存储优化等端侧适配工作, 真正集成至穿戴式设备仍需进一步的工程化落地工作.
本文责任编委 兰旭光
Recommended by Associate Editor LAN Xuguang
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|
| [31] |
|
| [32] |
|
| [33] |
|
| [34] |
|
| [35] |
|
| [36] |
|
| [37] |
|
| [38] |
|

