知识驱动的多尺度时空言语脑机接口解码网络
贾志宏1, 伍冬睿1, 曾源2
1.华中科技大学 人工智能与自动化学院 武汉 430074
2.华中科技大学 未来技术学院 武汉 430074
通信作者:

伍冬睿,博士,教授,主要研究方向为脑机接口、机器学习、情感计算.E-mail:drwu@hust.edu.cn.

作者简介:

贾志宏,硕士研究生,主要研究方向为言语脑机接口.E-mail:jiazhihong@hust.edu.cn.

曾 源,本科生.E-mail:15171926727@163.com.

第二十八届中国科协年会学术论文

摘要

针对通用解码模型缺乏言语专用建模机制的问题,提出知识驱动的多尺度时空言语脑机接口解码网络(Knowledge-Driven Multi-scale Spatial-Temporal Decoding Network for Speech Brain-Computer Interfaces, KMST-Former),依据言语相关神经活动的低频调制特性,构建调制频率驱动的多尺度时域卷积模块,捕获不同时间尺度下的神经动态模式.同时,在各分支引入尺度特异性通道注意力机制,自适应建模空间协同关系.最后,设计两阶段多尺度特征融合模块,整合跨尺度与跨通道信息,并利用Transformer编码器捕获长程时序依赖.实验表明,KMST-Former总体性能较优,表明结合言语先验知识的多尺度时空建模能有效增强神经特征判别能力.

关键词: 脑机接口; 言语解码; 知识驱动; 多尺度卷积; 注意力机制
中图分类号:TP391.4
Knowledge-Driven Multi-scale Spatial-Temporal Decoding Network for Speech Brain-Computer Interfaces
JIA Zhihong1, WU Dongrui1, ZENG Yuan2
1. School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074
2. School of Future Technology, Huazhong University of Science and Technology, Wuhan 430074
Corresponding author: WU Dongrui, Ph.D., professor. His research interests include brain-computer interface, machine learning and affec-tive computing.

About Author:
JIA Zhihong, Master student. Her research interests include speech brain-compu-ter interface.
ZENG Yuan, Undergraduate student.

Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology

Abstract

To address the lack of speech-specific modeling mechanisms in general decoding models, a knowledge-driven multi-scale spatio-temporal decoding network for speech brain-computer interfaces(KMST-Former) is proposed. Based on the low-frequency modulation characteristics of speech-related neural activity, parallel multi-scale temporal branches are constructed to capture neural dynamic patterns at different temporal scales. Scale-specific channel attention mechanisms are introduced into each branch to adaptively model spatial coordination. A two-stage spatio-temporal fusion module is then employed to integrate cross-scale and cross-channel information into unified representations. Finally, a Transformer encoder is used to capture long-range temporal dependencies. Experiments demonstrate the superior overall performance of KMST-Former. The effectiveness of multi-scale spatio-temporal modeling guided by speech prior knowledge for enhancing neural feature discrimination is verified.

Key words: Key Words Brain-Computer Interface; Speech Decoding; Knowledge-Driven; Multi-scale Convolution; Attention Mechanism

脑机接口(Brain-Computer Interface, BCI)在大脑与外部设备之间建立直接的信息通路, 解析神经信号, 实现对电子设备或计算机的意图驱动控制[1].

BCI采集大脑神经信号并通过算法解析为控制指令, 从而操控计算机、机械臂或轮椅等设备, 或反向刺激大脑以恢复感觉功能, 在医疗康复、神经科学研究及人机交互领域具有重要应用前景[2, 3].

当前主流的脑机接口范式有稳态视觉诱发电位(Steady State Visually Evoked Potential, SSVEP)、事件相关电位(Event-Related Potentials, ERP)及运动想象(Motor Imagery, MI)三类[4].

SSVEP与ERP范式通常依赖持续的外部视觉刺激, 长时间使用容易引发疲劳.MI虽然不依赖外部刺激依赖, 但往往需要较长的训练过程, 且支持的交互指令相对受限.此外, 部分被试还存在无法有效驱动脑机接口的“ 脑机接口盲” 现象[5].上述现象表明, 有必要探索一种更自然、舒适、高效的新型脑机接口范式.

言语脑机接口作为一种新兴的脑机接口范式, 核心思路是借助解码算法将与言语意图相关的神经活动直接映射为可用的交流信号[6].解码后的信号能转换为文本或语音信号[7].该范式无需对用户进行训练, 不依赖长时间的视觉注视, 能直接反映用户的言语意图, 具有自发性强、无需外部刺激、对被试友好等优势.区别于传统范式, 言语脑机接口支持的交互指令更丰富, 可更有效地实现用户与外界的沟通或对设备的精细控制, 为重度言语障碍患者带来新的康复希望[8].

脑电图(Electroencephalogram, EEG)作为一种非侵入式的神经信号记录手段, 凭借其较高的时间分辨率、无创性及易于部署等优势, 在脑机接口研究中占据重要地位.

基于EEG的解码技术现已成为辅助交流障碍群体的有效方法之一[9].早期的研究多基于传统机器学习算法, 依赖人工特征提取, 流程繁琐、耗时较长, 对专业领域知识具有高度依赖性[10].言语脑机接口领域起步相对较晚, 现有研究积累尚不充分, 单纯依赖手工特征可能造成潜在判别信息的遗漏.端到端深度神经网络能直接从原始脑电信号中自动学习层次化特征表示, 在降低人工依赖程度的同时有效处理高维非线性数据, 捕获脑电信号中的复杂时空模式与语义信息[11].

随着深度学习技术的发展, 深度学习模型在脑机接口范式中展现出显著的性能优势.以EEG- Net[12]为代表的卷积神经网络(Convolutional Neural Network, CNN)方法, 凭借其高效的时空特征提取能力, 在运动想象、情绪识别与认知等多类任务中得到广泛验证.Schirrmeister等[13]提出Deep Conv-Net(Deep Learning with Convolutional Neural Net-works)和Shallow ConvNet(Shallow Convolutional Neural Networks).Deep ConvNet通过多层堆叠的深层网络结构提取EEG信号的层次化全局特征; Shallow ConvNet通过浅层卷积架构针对性捕获时空频带功率特征, 实现对原始脑电信号的端到端表征学习.

近年来, Transformer在计算机视觉与自然语言处理领域取得的突破性进展, 进一步推动其面向脑电信号解码领域的应用.以EEG Conformer[14]为代表的CNN-Transformer混合架构相继被提出, 借助自注意力机制强化对长程序列依赖关系的建模, 进一步提升解码精度.然而, 现有方法大多以通用时序建模为核心框架, 对言语相关神经活动的领域先验知识缺乏显式建模与结构化整合.

鉴于上述研究背景, 本文提出知识驱动的多尺度时空言语脑机接口解码网络(Knowledge-Driven Multi-scale Spatial-Temporal Decoding Network for Speech Brain-Computer Interfaces, KMST-Former), 以言语相关神经活动的先验知识为指导构建专用解码网络, 提升解码性能与模型可解释性.首先, 构建调制频率驱动的多尺度时域卷积模块, 依据言语相关神经信号的低频调制特性构建多尺度时间感受野, 实现对不同时间层级神经动态信息的有效捕获.然后, 设计尺度特异性通道注意力机制, 并结合CNN-Transformer混合架构建模全局时序依赖, 在各时间尺度分支自适应学习通道权重, 同时通过Trans-former编码器捕获长时序列依赖关系, 提升网络对空间表征与时序动态的联合建模能力.最后, 在被试内分类、混合被试分类及跨被试微调分类三类典型任务上进行系统对比实验, 结果表明, KMST-Former具备较优的个体判别能力、群体建模能力与跨被试泛化能力, 充分验证该网络的可靠性与优越性.

1 相关工作
1.1 基于多尺度与多视角的特征建模

传统脑机接口解码网络通常采用固定的单一时间卷积与空间卷积结构[12, 13].然而, 由于EEG信号固有的复杂时空结构及多频带特性, 固定尺度的特征提取策略难以实现充分建模.为了应对上述挑战, 多尺度与多视角神经网络在多个时间尺度或频率尺度上并行提取特征, 更全面刻画EEG信号的复杂时序动态与频谱特性, 提升分类解码性能.

Mane等[15]提出FBCNet(Filter-Bank Convolu-tional Network), 借助多视角分支, 分别对各频带的EEG信号进行表征学习, 实现跨频段与跨空间判别特征的协同提取, 在多个MI数据集上取得超越传统深度学习基线方法的解码性能.Wang等[16]提出IFNet(Interactive Frequency Convolutional Neural Net-work), 设计交互式频域卷积模块, 建立不同频率分量间的信息交互, 有效增强网络对关键频带特征的感知能力, 显著提升MI任务的解码准确率.Thuwajit等[17]提出EEGWaveNet, 采用多尺度卷积结构, 对EEG信号进行时空特征提取, 通过不同感受野的卷积核捕获多尺度时序模式, 在癫痫检测任务上展现出良好的解码效果.Tao等[18]提出ADFCNN(Atten-tion-Based Dual-Scale Fusion Convolutional Neural Network), 采用双尺度卷积结构, 分别提取不同时间尺度的EEG特征, 并结合自注意力机制, 对多尺度特征进行自适应融合, 同时捕获局部与全局的时空信息, 显著提升MI任务的分类性能.Zhao等[19]提出MSCFormer(Multi-scale Convolutional Transfor-mer), 设计多尺度卷积模块, 提取局部时序特征, 并引入Transformer, 对长程依赖关系进行建模, 实现跨尺度时序信息的有效整合, 进一步提升MI任务的分类性能.

1.2 基于通道注意力机制的空间建模

为了进一步提升方法对关键脑区空间特征的表征能力, 近年来已有研究者将通道注意力机制引入EEG解码模型, 自适应学习不同电极通道的贡献权重, 提升空间特征表达能力.

Altuwaijri等[20]提出MBEEGSE(Multi-branch EEGNet with Squeeze-and-Excitation Blocks), 在多分支卷积神经网络框架中嵌入SE(Squeeze-and-Excitation)通道注意力模块, 对通道特征进行压缩与重标定, 自适应调整各脑区信号的贡献权重, 在多个MI数据集上性能较优.Tong等[21]提出基于ECA(Efficient Channel Attention)的EEG通道选择方法, 将轻量化通道注意力模块嵌入卷积网络, 建模通道间的依赖关系, 实现对关键电极通道的自适应选取, 在MI任务上取得较好的分类效果.Liao等[22]提出CIACNet(Composite Improved Attention Convolutional Network), 将CBAM(Convolutional Block Attention Module)结构引入卷积网络, 对通道注意力与空间注意力联合建模, 强化关键特征表达, 在多个MI数据集上实现稳定可靠的性能提升.Jiang等[23]提出CTA-CNN-Bi-LSTM, 采用通道时间联合注意力机制, 同时学习关键通道与关键时间点的权重, 在EEG情绪识别任务中取得较优的识别性能.

1.3 基于CNN-Transformer的序列建模

近年来, 随着Transformer在序列建模领域的广泛应用, 相关研究逐步尝试将CNN与Transformer架构加以融合, 实现对EEG信号局部时空特征与长程依赖关系的协同建模.

Song等[14]提出EEG Conformer, 使用卷积层提取EEG的局部时空特征, 并借助自注意力机制对全局依赖关系进行建模, 在运动想象与情绪识别等任务上取得较优的解码性能.Ding等[24]提出EEG-Deformer, 在卷积与注意力融合框架中引入分层时间特征建模方式, 逐步捕获不同时间尺度的神经动态模式, 在认知注意、驾驶疲劳及工作负荷等多类任务中取得良好的解码效果.Zhao等[25]提出CTNet(Convolutional Transformer Network), 使用轻量卷积完成底层特征提取, 并通过注意力模块建模高层特征的全局关联, 在多个MI数据集上展现出具有竞争力的分类性能.Liu等[26]提出MSVTNet(Multi-scale Vision Transformer Neural Network), 采用多尺度卷积, 分别提取不同时间与频率尺度的特征表示, 并结合注意力机制进行联合建模, 在多模态心理意象解码任务中取得有效的性能提升.Zhao等[27]提出TMSA-Net(Temporal Multi-scale Attention-Net), 在卷积与注意力融合框架中引入改进的注意力机制, 强化局部特征与全局特征之间的信息交互, 在多个 MI数据集上取得稳定的性能提升.Wang等[28]提出DBConformer(Dual-Branch Convolutional Transformer), 针对Conformer单路径特征提取的固有局限, 设计双分支并行结构, 分别对时间动态特征与通道空间关系进行专项建模, 在运动想象和癫痫检测等任务上性能较优.Jiang等[29]提出FAST(Functional Areas Spatio-Temporal Transformer), 依据脑区功能划分EEG通道, 提取局部时空特征, 并利用Transformer对时序依赖关系建模, 在言语EEG解码任务上取得较优性能.

上述建模思路已在运动想象、情绪识别等多类EEG应用范式中得到充分验证.尽管已有研究开始针对言语解码任务设计专项网络[29], 但整体而言, 现有方法仍主要依赖通用EEG建模范式, 对言语相关神经调制特性及时空组织规律的专属利用仍相对有限.因此, 有必要进一步探索面向言语解码任务特点的专用网络.

2 知识驱动的多尺度时空言语脑机接口解码网络
2.1 整体架构

本文提出知识驱动的多尺度时空言语脑机接口解码网络(KMST-Former), 整体架构如图1所示.

图1 KMST-Former整体架构Fig.1 Overall KMST-Former architecture

首先, 针对人类言语在音素、亚音节和音节等不同层级上呈现的固有时间节律, 构建调制频率驱动的多尺度时域卷积模块, 依据言语相关神经活动的低频调制特性, 设置多个不同时间感受野的并行卷积分支, 提取多时间尺度下的局部神经动态模式, 构建多粒度时域特征表示.然后, 为了强化空间维度的特征建模, 在各尺度分支上独立施加尺度特异性通道注意力机制, 旨在模拟大脑皮层的空间动态激活规律, 对通道权重进行自适应学习与特征重标定, 使网络可在不同时间尺度下突出关键电极信息, 捕获尺度敏感的通道协同关系与电极交互特性.

在此基础上, 设计两阶段多尺度时空融合模块, 系统整合跨尺度与跨通道信息, 映射至统一维度的嵌入空间, 实现时空神经表征的联合编码.沿时间轴对嵌入特征进行分段Token化, 将连续时序表示划分为离散Token序列.考虑到人类言语表达包含具有长程上下文依赖的语义与语法信息的连续序列, 进一步引入Transformer编码器, 捕获长程时序依赖与全局上下文信息, 最终由分类头输出预测结果.

总之, KMST-Former综合运用多尺度时域信息与尺度相关空间特征表示, 并借助Transformer的全局序列建模能力刻画言语相关神经活动的长程时序依赖.

表1给出KMST-Former的网络细节配置, B表示批次大小, C表示通道数量, T表示采样点数, E表示嵌入维度, W表示块大小, P=「T/W⌉, 表示Token数量, 其中「· ⌉表示向下取整运算, Pmax表示Token最大数量, L表示Transformer编码器的层数, H表示自注意力机制的头数, Ncls表示类别数量, k(C)表示根据通道数C自适应计算得到的ECA卷积核大小.

表1 KMST-Former细节配置 Table 1 Detailed configurations of KMST-Former
2.2 调制频率驱动的多尺度时域卷积模块

言语相关神经活动在高频段通常呈现出与任务密切相关的振幅调制现象, 表现为神经信号幅值随时间的规律性起伏.为了刻画高频神经活动随时间的起伏特征, 本文采用希尔伯特变换提取信号的瞬时包络.对于滤波后的信号x(t), 解析信号定义如下:

z(t)=x(t)=jH{x(t)}

其中, H{· }表示希尔伯特变换, j表示虚数单位.由解析信号可得到高频神经活动的瞬时幅值包络:

a(t)=|z(t)|.

尽管载波频率位于高频段, 包络信号通常表现为随时间缓慢变化的低频成分, 可视为高频神经振荡受低频调制后的幅值轨迹, 能有效表征言语产生过程的时间层级组织结构.语音感知在很大程度上依赖于语音信号的低频时间包络调制.研究表明, 语音调制谱中的大部分语言信息主要集中在约16 Hz以下的调制频率范围内[30] , 各调制频段通常与不同层级的语言结构单位对应:16 Hz左右的调制频率主要反映快速的音素级变化与瞬态语音过渡; 8 Hz左右的调制频率对应亚音节层级的时间结构; 4 Hz左右的调制频率与言语中的典型音节节律一致; 低于2 Hz的慢速调制对应言语中的韵律组织或短语级语言单位[31, 32].

近年来的神经科学研究进一步表明, 人脑在语音感知和言语加工过程中会对不同频段的语音包络调制产生选择性跟踪, 不同频率范围的神经响应反映不同层级语言信息的加工过程 [31, 32].因此, 语音调制谱反映的层级时间结构不仅存在于声学信号中, 也在脑电神经响应中有所体现.对于言语脑机接口解码任务而言, 仅依赖单一时间尺度的特征提取难以同时捕获不同层级语言单位对应的神经表征, 从而限制方法对言语相关脑电活动的建模能力.

基于上述认知神经科学发现, 本文将语音调制谱中的时间层级结构作为模型设计的领域先验知识, 并据此构建多尺度时域卷积模块.具体而言, 针对音素级、亚音节级和音节级信息分别设计面向不同时间感受野的卷积核, 使网络能在多个时间尺度上同时提取与言语加工相关的神经调制特征.与现有多尺度卷积方法主要依赖经验设置参数的方式不同, 本文各个尺度卷积核的设计依据语音调制频率与语言结构层级之间的对应关系, 从而使网络具备更明确的神经生理学解释基础.

基于上述语音时间层级结构, 设计一组具有不同时间感受野的卷积核, 捕获神经包络中的层级时间结构.具体地, 为了在保证时间分辨率的同时稳定刻画对应频段的节律信息, 以两个周期作为各个尺度时间窗口的近似长度, 设置时间长度分别为125 ms、250 ms与500 ms的卷积核, 分别用于建模约16 Hz、8 Hz和4 Hz的调制频率成分, 从而提取与音素、亚音节结构及音节节律相关的时间信息.脑电信号采样频率为256 Hz, 对应的卷积核尺寸分别为32、64、128.同时, 为了保留更慢时间尺度上的语音结构信息, 进一步保留原始信号用于后续建模, 捕获低频调制成分, 表征与韵律和短语级语义结构相关的长时间尺度信息.

2.3 尺度特异性通道注意力机制

为了强化对言语相关空间表征的建模能力, KMST-Former在原始信号分支及每条多尺度卷积分支上均引入基于ECA的尺度特异性通道注意力机制, 对各个电极通道的贡献进行自适应重标定.区别于基于全连接层的通道注意力方法, ECA在通道维度上施加轻量级一维卷积, 显式建模局部通道依赖关系, 在几乎不增加参数与计算开销的前提下实现高效的通道选择与特征增强.

在各个尺度分支中, 首先对时间维度执行全局平均池化, 得到通道级描述向量.然后在通道维度施加轻量一维卷积, 捕获局部通道依赖, 并经Sigmoid激活函数生成通道权重.最后将该权重与原始特征图相乘, 实现通道级重标定, 有效突出关键电极通道信息.

2.4 基于Transformer的时序建模

完成多尺度时域卷积与通道重标定后, 网络将各个尺度分支的输出在通道维度上进行拼接, 再经两阶段多尺度时空融合模块完成跨尺度信息整合.第一阶段采用分组一维卷积, 对各尺度内部特征进行对齐与压缩, 防止不同尺度特征的过早混叠; 第二阶段采用标准一维卷积, 实现跨尺度与跨通道的信息融合, 并将多尺度特征映射至统一的嵌入空间.

然后, 网络以固定窗口将连续序列切分为若干子段, 对时序表示沿时间维度进行分段Token化, 每个Token表征对应时间片段的局部嵌入特征.在Token序列首部追加可学习的[CLS]聚合标记, 并叠加位置编码信息, 构成Transformer编码器的输入序列.

Transformer编码器由多层多头自注意力模块与前馈神经网络堆叠而成, 并借助残差连接与层归一化机制确保训练过程的稳定性.最终以[CLS]Token对应的序列级全局表征作为高级语义特征, 经分类头映射后得到最终的类别预测结果.

3 实验及结果分析
3.1 实验环境

本文在BCI2020数据集(https://osf.io/pq7vb/overview)上开展实验.BCI2020数据集源自2020年世界机器人大赛脑机接口竞赛的言语想象专项赛题, 涵盖Hello、Help me、Stop、Thank you、Yes共5个类别, 共纳入15名健康被试, 旨在验证基于脑电信号完成基础语言交互的可行性.实验要求被试在完全无声、不伴有任何口部运动的条件下完成言语想象任务.脑电信号采用64导联电极进行采集, 依据国际10-20系统进行记录, 信号采样频率为256 Hz.在数据组织上, 每名被试的数据由300个试次的训练数据、50个试次的验证数据及50个试次的测试数据构成.

基于BCI2020数据集, 本文设计3种任务, 从多个维度系统评估网络的解码能力与泛化性能, 具体设置如图2所示.

图2 评估任务示意图Fig.2 Schematic diagram of evaluation tasks

1)任务1.被试内分类任务.每个被试被分别训练和评估, 即对每个被试分别使用训练集进行训练, 验证集用于模型选择与参数调节, 测试集用于最终性能评估.该任务主要用于评估模型在特定个体脑电信号模式下的解码能力, 适用于个性化脑机接口系统的设计.

2)任务2.混合被试分类任务.将所有被试数据合并训练以统一模型, 即以所有被试训练集的合并作为整体训练集, 所有被试的验证集构成整体验证集, 所有被试的测试集构成整体测试集.该任务旨在评估模型在多被试混合数据分布条件下的学习能力, 适用于无需个体校准的通用型脑机接口系统.

3)任务3.跨被试微调分类任务.该任务采用留一被试交叉验证策略:将某一被试设定为目标被试, 其余14名被试数据用于模型训练, 并从训练数据中随机抽取1/14作为验证集.训练完成后, 利用目标被试少量有标注数据(本文设置有标注数据占目标被试训练集的30%)对模型进行微调, 并在其测试集上评估性能.15名被试依次作为目标被试进行测试, 最终结果取所有目标被试实验结果的平均值.该任务模拟新用户仅凭少量校准数据即可接入系统的实际场景, 用于系统评估模型的跨被试迁移能力与快速个性化适应能力.

数据预处理流程主要包括如下环节.首先对原始信号进行去趋势与重参考处理, 减小信号中的慢漂移及参考电极带来的影响.为了突出与言语产生及运动过程相关的皮层高频神经活动, 对信号施加30 Hz高通滤波, 同时进行陷波滤波, 去除50 Hz工频噪声及其奇次谐波成分.滤波完成后, 对信号进行希尔伯特变换并提取瞬时幅值包络, 捕获信号幅值随时间变化的调制信息.提取的包络信号作为网络输入, 用于后续言语解码分析.

所有方法均采用Adam(Adaptive Moment Esti-mation)优化器进行训练, 初始学习率统一设为0.001.训练过程中采用早停机制防止过拟合, 最大训练轮数为250轮, 若连续50轮验证集性能无明显提升则终止训练, 并保存验证集上表现最优的模型权重.针对任务3的跨被试微调阶段, 初始学习率调整为0.000 5, 固定微调100轮次.综合考虑训练效率与显存开销, 任务1的批次大小设为64, 任务2与任务3因训练样本量较大, 批次大小均调整为128.为了降低随机性对评估结果的干扰, 所有实验均独立重复运行3次, 取平均性能作为最终值.在结构超参数方面, Transformer编码器的多头注意力头数设为8, 堆叠编码层数设为5.

3.2 评估指标

为了全方位评估方法性能, 选取如下指标进行综合评价:分类准确率(Accuracy, ACC)、宏平均F1分数(Macro-F1)、Cohen's Kappa系数(Kappa)及宏平均曲线下面积(Macro Area under Receiver Opera-ting Characteristic Curve, Macro-AUC).ACC反映整体分类的正确比例.Macro-F1量化方法在各个类别上的平均判别性能, 避免整体准确率掩盖个别类别识别性能不足的问题.Kappa系数在一致性度量中剔除随机一致性的干扰, 客观衡量预测标签与真实标签间的一致程度.Macro-AUC依据方法输出概率评价各个类别间的区分能力, 从概率层面综合反映方法的类别可分性与预测置信度.

为了评估方法性能的提升是否具有统计显著性, 首先计算配对t检验的p值, 再采用Benjamini-Hochberg假发现率校正方法对p值进行校正.

3.3 对比实验

本文选取如下具有代表性的脑电解码方法作为对比方法.1)传统CNN方法:EEGNet[12]、Deep Conv- Net[13]、Shallow ConvNet[13].2)多尺度与多视角卷积解码方法:FBCNet[15]、IFNet[16]、EEGWaveNet[17]、ADFCNN[18].3)基于Transformer结构的解码方法:EEG Conformer[14]、MSCFormer[19]、EEG-Deformer[24]、CTNet[25]、MSVTNet[26]、TMSA-Net[27]、DBConfor-mer[28]、FAST[29].

各方法在任务1上的全被试平均解码性能如表2所示, 表中黑体数字表示最优值.由表可见, KMST-Former在全部指标上均取得最优值, 由此表明其不仅在整体分类准确率上具有优势, 在类别均衡判别能力、预测一致性及类别可分性等维度上也具有明显优势.

表2 各方法在任务1上的性能对比 Table 2 Performance comparison of different methods on Task 1

从各类方法的建模特点来看:传统CNN方法侧重局部时空特征的提取; 多尺度卷积解码方法可在一定程度上刻画不同时间粒度下的局部神经模式; 基于Transformer结构的解码方法在长程时序依赖建模上具有明显优势.与上述方法相比, KMST-Former在保留多尺度时间建模能力的基础上, 引入言语相关的领域先验知识, 设计时间尺度, 能对言语产生过程中不同时间层级的神经调制模式进行显式建模, 同时, 借助通道注意力机制对各脑区的空间特征进行自适应加权, 突出与言语相关的关键电极.在此基础上, 模型结合Transformer实现全局时序关系的建模, 能同时捕获多尺度局部特征与长程时序依赖信息.KMST-Former取得的整体性能优势表明, 对于言语脑电解码任务, 单一类型的建模机制难以满足精准解码的需求.引入领域先验知识进行多尺度时空特征提取, 并结合长程时序依赖建模, 有助于提升方法对个体脑电模式判别能力, 获取更优的解码性能.

各方法在任务2上的整体解码性能如表3所示, 表中黑体数字表示最优值.由表可见, 在所有对比方法中, KMST-Former在4个指标上均取得最优值.相比表现次优的基线方法MSCFormer, KMST-Former在ACC、Macro-F1、Kappa、Macro-AUC指标上分别提升6.62%、0.064 0、0.082 8和0.039 2.

表3 各方法在任务2上的性能对比 Table 3 Performance comparison of different methods on Task 2

区别于被试内分类任务, 混合被试分类任务要求方法在所有被试的混合数据上进行统一训练, 需从中提炼具有群体共性的判别表征.在此设置下, KMST-Former在各指标上均呈现出显著领先, 表明其在多被试混合数据分布条件下具备更强的判别能力与泛化性.上述结果进一步印证, 在言语脑电解码任务中, 以领域先验知识为引导的多尺度时空特征提取, 结合全局时序依赖建模, 能有效增强方法在群体级数据上的整体解码性能.

各方法在任务3上的平均解码性能如表4所示, 表中黑体数字表示最优值.由表可看到, KMST-Former在ACC、Macro-F1、Kappa指标上均取得最优值, 在Macro-AUC指标上取得次优值, 相比最优结果, 仅相差0.000 5, 基本持平.

表4 各方法在任务3上的性能对比 Table 4 Performance comparison of different methods on Task 3

相比被试内分类任务与混合被试分类任务, 跨被试微调分类任务要求方法先在源域被试数据上完成预训练, 再以目标被试少量数据进行适配微调, 对跨被试迁移能力提出更高要求.在此条件下, KMST-Former在多项核心指标上保持领先, 表明其在跨被试微调场景中具有较强的适应性, 能借助少量目标被试数据实现高效的个性化迁移.上述结果表明, 领域先验知识驱动的多尺度时空特征提取结合全局时序依赖建模, 能有效提升方法在跨被试迁移场景中的泛化能力.

围绕三类任务, KMST-Former与对比方法在分类准确率上的校正p值对比结果如表5所示.

表5 KMST-Former与基线方法在分类准确率上的校正p值对比 Table 5 Comparison of corrected p-values between KMST-Former and baseline methods on classification accuracy

表5可见:KMST-Former在被试内分类任务和混合被试分类任务中均取得优于基线方法的解码性能; 在跨被试微调分类任务上, KMST-Former与多数基线方法对比时仍保持显著优势.从校正p值对比结果可看到, KMST-Former与绝大多数基线方法的对比达到统计显著水平, 表明其在个体判别、群体建模及跨被试迁移方面整体上具备较强的竞争力与泛化性.

3.4 可视化分析

被试8在不同方法上的混淆矩阵如图3所示.由图可看出, KMST-Former在各个类别上均表现出较清晰的对角结构, 针对各个类别的分类准确率均超过60%.这一结果表明, KMST-Former能对各个类别的脑电信号实现更稳定、均衡的区分, 有效抑制类间误分类, 提升整体分类性能.

图3 被试8在各方法上的混淆矩阵Fig.3 Confusion matrices of subject 8 under different methods

3.5 消融实验

为了考察KMST-Former中各模块的独立贡献, 分别去除调制频率驱动的多尺度时域卷积模块和尺度特异性通道注意力机制, 以及将两阶段多尺度时空融合模块退化为单阶段的消融变体.具体消融结果如表6所示.

表6 各模块消融实验结果 Table 6 Ablation experiment results of different modules

当移除多尺度时域卷积模块时, KMST-Former在3个任务中的性能均出现明显下滑, 特别是在任务2中, ACC指标降幅达9.46%.这表明针对脑电信号的非平稳特性, 多尺度时域卷积模块在捕获不同时间粒度的神经调制特征方面具有不可替代的作用.

去除通道注意力机制后, 各项指标的全面回落表明该机制能有效对不同脑区的电极进行自适应赋权, 强化关键空间特征的表达.取消两阶段多尺度时空融合模块, KMST-Former在任务3中解码性能骤降, 在任务1和任务2中也分别出现不同程度的性能衰退.这充分说明单一维度的特征拼接难以满足复杂任务的需求, 而两阶段多尺度时空融合模块能更深层次地实现时空特征的有效交互与整合.

3.6 参数敏感性分析

首先定义Transformer编码器多头注意力头数H=4, 8, 10, 分析其对KMST-Former解码性能的影响, 结果如图4所示.由图可见, 随着H的增加, 方法性能整体呈上升趋势.这表明在3个任务上, 增加头数有助于从多维视角捕获言语相关脑电信号中的时空依赖关系, 增强特征表征的丰富性与类别判别能力, 获得更优的解码性能.

图4 H对KMST-Former性能的影响Fig.4 Effect of H on KMST-Former performance

再定义Transformer编码器层数L=1, 3, 5, 7, 分析其对KMST-Former性能的影响, 结果如图5所示.由图可见, 解码性能并不随着层数的增加而单调递增, 层数过深时反而出现性能退化现象.

图5 L对KMST-Former性能的影响Fig.5 Effect of L on KMST-Former performance

由于脑电数据规模相对有限, 过深的网络结构容易引发过拟合, 对解码性能产生负面影响.因此, 相对轻量的网络结构更契合脑电数据的建模需求.

4 结束语

针对通用解码模型缺乏针对言语任务的专用建模机制的问题, 本文提出知识驱动的多尺度时空言语脑机接口解码网络(KMST-Former).网络将语音调制谱中的层级时间结构作为领域先验知识, 显式融入多尺度时域卷积模块中, 并结合尺度特异性通道注意力机制与Transformer, 构建知识驱动的局部时空与全局依赖联合建模框架.实验表明, KMST-Former在个体判别、群体建模及跨被试泛化能力上均表现优异, 有效提升言语脑电信号的特征表征能力和解码性能.

受客观条件限制, 当前实验评估主要基于单一公开数据集开展, 数据分布与样本规模相对有限.未来规划通过扩充公开数据集及引入自建数据队列, 执行更严格的跨数据集交叉验证, 全面提升方法在复杂数据分布下的鲁棒性与泛化性.此外, 本文现阶段主要针对离散词汇级言语范式进行验证, 对连续语句级解码及开放词汇表达场景的拓展仍需深入探究.后续计划深度融合预训练大模型与前沿的神经语音生成机制, 探索并构建直接由脑电特征映射至连续语义表达的端到端解码体系.

总之, 本文为言语脑机接口系统的精准解码提供一种兼具高性能与神经科学可解释性的新思路, 在辅助障碍群体交流、无声语音交互及智能脑机融合等场景中展现出重要的理论价值与广阔的应用前景.

本文责任编委 兰旭光

Recommended by Associate Editor LAN Xuguang

参考文献
[1] MRIDHA M F, DAS S C, KABIR M M, et al. Brain-Computer Interface: Advancement and Challenges. Sensors, 2021, 21(17). DOI: 10.3390/s21175746. [本文引用:1]
[2] 伍冬睿. 精准、安全、隐私保护的脑机接口. 中国人工智能学会通讯, 2025, 15(3): 29-35.
(WU D R. Precise, Safe, and Privacy-Preserving Brain-Computer Interfaces. Chinese Association for Artificial Intelligence, 2025, 15(3): 29-35.) [本文引用:1]
[3] 彭睿旻, 江军, 匡光涛, . 基于EEG的癫痫自动检测: 综述与展望. 自动化学报, 2022, 48(2): 335-350.
(PENG R M, JIANG J, KUANG G T, et al. EEG-Based Automatic Epilepsy Detection: Review and Outlook. Acta Automatica Sinica, 2022, 48(2): 335-350.) [本文引用:1]
[4] ABIRI R, BORHANI S, SELLERS E W, et al. A Comprehensive Review of EEG-Based Brain-Computer Interface Paradigms. Journal of Neural Engineering, 2019, 16(1). DOI: 10.1088/1741-2552/aaf12e. [本文引用:1]
[5] DICKHAUS T, SANNELLI C, MÜLLER K R, et al. Predicting BCI Performance to Study BCI Illiteracy. BMC Neuroscience, 2009, 10(S1). DOI: 10.1186/1471-2202-10-S1-P84. [本文引用:1]
[6] BRUMBERG J S, NIETO-CASTANON A, KENNEDY P R, et al. Brain-Computer Interfaces for Speech Communication. Speech Communication, 2010, 52(4): 367-379. [本文引用:1]
[7] SILVA A B, LITTLEJOHN K T, LIU J R, et al. The Speech Neuroprosthesis. Nature Reviews Neuroscience, 2024, 25(7): 473-492. [本文引用:1]
[8] ANUMANCHIPALLI G K, CHARTIER J, CHANG E F. Speech Synthesis from Neural Decoding of Spoken Sentences. Nature, 2019, 568(7753): 493-498. [本文引用:1]
[9] GU X T, CAO Z H, JOLFAEI A, et al. EEG-Based Brain-Compu-ter Interfaces(BCIs): A Survey of Recent Studies on Signal Sensing Technologies and Computational Intelligence Approaches and Their Applications. IEEE/ACM Transactions on Computational Biology and Bioinformatics, 2021, 18(5): 1645-1666. [本文引用:1]
[10] DASALLA C S, KAMBARA H, SATO M, et al. Single-Trial Cla-ssification of Vowel Speech Imagery Using Common Spatial Pa-tterns. Neural Networks, 2009, 22(9): 1334-1339. [本文引用:1]
[11] ZHANG L Y, ZHOU Y Y, GONG P L, et al. Speech Imagery Decoding Using EEG Signals and Deep Learning: A Survey. IEEE Transactions on Cognitive and Developmental Systems, 2025, 17(1): 22-39. [本文引用:1]
[12] LAWHERN V J, SOLON A J, WAYTOWICH N R, et al. EEGNet: A Compact Convolutional Neural Network for EEG-Based Brain-Computer Interfaces. Journal of Neural Engineering, 2018, 15(5). DOI: 10.1088/1741-2552/aace8c. [本文引用:3]
[13] SCHIRRMEISTER R T, SPRINGENBERG J T, FIEDERER L D J, et al. Deep Learning with Convolutional Neural Networks for EEG Decoding and Visualization. Human Brain Mapping, 2017, 38(11): 5391-5420. [本文引用:4]
[14] SONG Y H, ZHENG Q Q, LIU B C, et al. EEG Conformer: Convolutional Transformer for EEG Decoding and Visualization. IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2023, 31: 710-719. [本文引用:3]
[15] MANE R, ROBINSON N, VINOD A P, et al. A Multi-view CNN with Novel Variance Layer for Motor Imagery Brain Computer Interface // Proc of the 42nd Annual International Conference of the IEEE Engineering in Medicine and Biology Society. Washington, USA: IEEE, 2020: 2950-2953. [本文引用:2]
[16] WANG J H, YAO L, WANG Y M. IFNet: An Interactive Frequency Convolutional Neural Network for Enhancing Motor Imagery Decoding from EEG. IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2023, 31: 1900-1911. [本文引用:2]
[17] THUWAJIT P, RANGPONG P, SAWANGJAI P, et al. EEGWave-Net: Multiscale CNN-Based Spatiotemporal Feature Extraction for EEG Seizure Detection. IEEE Transactions on Industrial Informa-tics, 2022, 18(8): 5547-5557. [本文引用:2]
[18] TAO W, WANG Z, WONG C M, et al. ADFCNN: Attention-Based Dual-Scale Fusion Convolutional Neural Network for Motor Imagery Brain-Computer Interface. IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2024, 32: 154-165. [本文引用:2]
[19] ZHAO W, ZHANG B C, ZHOU H F, et al. Multi-scale Convolutional Transformer Network for Motor Imagery Brain-Computer Interface. Scientific Reports, 2025, 15(1). DOI: 10.1038/s41598-025-96611-5. [本文引用:2]
[20] ALTUWAIJRI G A, MUHAMMAD G, ALTAHERI H, et al. A Multi-branch Convolutional Neural Network with Squeeze-and -Excitation Attention Blocks for EEG-Based Motor Imagery Signals Classification. Diagnostics, 2022, 12(4). DOI: 10.3390/diagnostics12040995. [本文引用:1]
[21] TONG L N, QIAN Y H, PENG L, et al. A Learnable EEG Cha-nnel Selection Method for MI-BCI Using Efficient Channel Attention. Frontiers in Neuroscience, 2023, 17. DOI: 10.3389/fnins.2023.1276067. [本文引用:1]
[22] LIAO W Z, MIAO Z P, LIANG S B, et al. A Composite Improved Attention Convolutional Network for Motor Imagery EEG Classification. Frontiers in Neuroscience, 2025, 19. DOI: 10.3389/fnins.2025.1543508. [本文引用:1]
[23] JIANG L, SIRIARAYA P, CHOI D, et al. Electroencephalogram Signals Emotion Recognition Based on Convolutional Neural Network-Recurrent Neural Network Framework with Channel-Temporal Attention Mechanism for Older Adults. Frontiers in Aging Neuroscience, 2022, 14. DOI: 10.3389/fnagi.2022.945024. [本文引用:1]
[24] DING Y, LI Y, SUN H, et al. EEG-Deformer: A Dense Convolutio-nal Transformer for Brain-Computer Interfaces. IEEE Journal of Biomedical and Health Informatics, 2025, 29(3): 1909-1918. [本文引用:2]
[25] ZHAO W, JIANG X L, ZHANG B C, et al. CTNet: A Convolutional Transformer Network for EEG-Based Motor Imagery Classification. Scientific Reports, 2024, 14(1). DOI: 10.1038/s41598-024-71118-7. [本文引用:2]
[26] LIU K, YANG T, YU Z L, et al. MSVTNet: Multi-scale Vision Transformer Neural Network for EEG-Based Motor Imagery Decoding. IEEE Journal of Biomedical and Health Informatics, 2024, 28(12): 7126-7137. [本文引用:2]
[27] ZHAO Q, ZHU W N. TMSA-Net: A Novel Attention Mechanism for Improved Motor Imagery EEG Signal Processing. Biomedical Signal Processing and Control, 2025, 102. DOI: 10.1016/j.bspc.2024.107189. [本文引用:2]
[28] WANG Z W, WANG H B, JIA T W, et al. DBConformer: Dual-Branch Convolutional Transformer for EEG Decoding. IEEE Journal of Biomedical and Health Informatics, 2026, 30(5): 4134-4147. [本文引用:2]
[29] JIANG M Y, ZHANG W, DING Y, et al. Decoding Covert Speech from EEG by Functional Areas Spatio-Temporal Transformer. IEEE Journal of Biomedical and Health Informatics, 2026. DOI: 10.1109/JBHI.2026.3653025. [本文引用:3]
[30] STONE M A, FÜLLGRABE C, MOORE B C J . Relative Contribution to Speech Intelligibility of Different Envelope Modulation Rates within the Speech Dynamic Range. The Journal of the Acoustical Society of America, 2010, 128(4): 2127-2137. [本文引用:1]
[31] KEITEL A, GROSS J, KAYSER C. Perceptually Relevant Speech Tracking in Auditory and Motor Cortex Reflects Distinct Linguistic Features. PLoS Biology, 2018, 16(3). DOI: 10.1371/journal.pbio.2004473. [本文引用:2]
[32] LEONG V, GOSWAMI U. Acoustic-Emergent Phonology in the Am-plitude Envelope of Child-Directed Speech. PLoS One, 2015, 10(12). DOI: 10.1371/journal.pone.0144411. [本文引用:2]