
刘子龙,博士,副教授,主要研究方向为模式识别、机器人控制.E-mail:liuzl0704@163.com.
作者简介:

龚文乐,硕士研究生,主要研究方向为模式识别、情感计算.E-mail:2744656029@qq.com.
第二十八届中国科协年会学术论文
为了提高跨被试脑电(Electroencephalogram, EEG)情绪识别在标注有限条件下的泛化性能,提出脑区先验自监督预训练网络(Brain-Region-Prior Self-Supervised Pretraining Network, BSP-Net).BSP-Net以脑区拓扑为归纳偏置,先通过轻量化脑区感知通道注意力对电极进行脑区分组建模,再在无标签EEG样本上联合脑区掩码重建和脑区原型对比两个分支,使编码器同时学习脑区间局部依赖和跨被试一致的脑区级表征.预训练后,编码器接入轻量胶囊识别头,完成下游情绪分类.在DEAP、DREAMER数据集上的试次级无泄漏留一被试交叉验证下的实验表明,BSP-Net可提升标注有限条件下跨被试EEG情绪识别性能.
About Author:
GONG Wenle, Master student. His research interests include pattern recognition and affective computing.
Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology
To improve the generalization performance of cross-subject electroencephalogram(EEG) emotion recognition under limited annotation, a brain-region-prior self-supervised pretraining network(BSP-Net) is proposed. Brain-region topology is adopted as an inductive bias. Electrode channels are first modeled in groups by lightweight brain-region-aware channel attention. Then, two self-supervised tasks, masked brain-region modeling and brain-region prototype contrast, are jointly optimized on unlabeled EEG samples. Local inter-region dependencies and cross-subject brain-region representations are learned by the encoder. After pretraining, the encoder is connected to a lightweight capsule head for downstream emotion classification. Experiments on DEAP and DREAMER under a strict trial-level leakage-free leave-one-subject-out(LOSO) protocol show that the performance of cross-subject EEG emotion recognition under limited annotation conditions is improved by BSP-Net.
情绪在人类认知、决策与社会交互中处于核心地位, 其客观识别在情感计算、人机交互、智能医疗与神经科学等领域具有重要意义[1].脑电(Electroencephalogram, EEG)凭借毫秒级时间分辨率和较高的客观性, 已成为情绪识别中最受关注的生理信号之一[2].但是, 原始EEG的高维、低信噪比与显著个体差异使可靠解码情绪状态长期面临挑战[3].
EEG情绪识别方法大致经历从基于手工特征到端到端深度学习两个阶段.EEGNet[4]和Deep ConvNet[5]通过时间-空间分离卷积奠定端到端建模基础.Tao等[6]提出ACRNN(Attention-Based Con-volutional Recurrent Neural Network), 进一步引入注意力机制与长短期记忆网络(Long Short-Term Memory, LSTM), 进行时序建模, 但仍将EEG强行映射为二维网格图像, 忽视电极拓扑的物理含义.为了适配EEG的非欧拓扑结构, DGCNN(Dynamical Graph Convolutional Neural Networks)[7]、STGATE(Spatial-Temporal Graph Attention Network with a Transformer Encoder)[8]、EmT(Emotion Transfor-mer)[9]等图神经网络与Transformer类方法相继出现:前者邻接矩阵针对跨被试时波动较大, 后者依赖大规模训练样本, 在EEG小样本下均容易出现过拟合.
胶囊网络通过向量化神经元保留特征间的部分-整体关系, LResCapsule(Light-Weight Residual Con-volution-Based Capsule Network)[10]、DA-CapsNet[11]、TC-Net(Transformer Capsule Network)[12]等胶囊变体在EEG情绪识别上性能较优, 但其训练范式仍以纯监督为主, 在边缘设备上开展识别时还需考虑初级胶囊数目偏多带来的动态路由开销问题.
在跨被试方向, Domain-Adversarial Neural Net-work(后文简记为DANN)[13]、BiDANN(Bi-Hemi-sphere Domain Adversarial Neural Network)[14]、MS-MDA(Multi-source Marginal Distribution Adapta-tion)[15]等域适应方法部分缓解源/目标域偏移问题, 但大多依赖训练阶段访问目标域数据, 对抗式优化又常带来训练不稳定问题.
自监督学习近年来在视觉与语言方向充分展现出挖掘无标签数据结构信息的能力.EEG侧的SeqCLR[16]、GMSS(Graph-Based Multi-task Self-Su-pervised Learning Model)[17]、SCMM(Soft Contrastive Masked Modeling)[18]等沿用通用代理任务(时间块掩码、SimCLR(Simple Contrastive Learning of Representations)式增强对比), 尚未将EEG最具特色的脑区拓扑结构融入预训练目标设计中.
现阶段上述工作虽各有进展, 其中, 跨被试域偏移与标注稀缺这两个看似独立的瓶颈, 本质上源于同一个被忽视的表征学习要求:理想的情绪表征应在保留情绪判别信息的同时, 最小化自身与被试身份等混淆因素的相关性.多数方法在被试依赖(Subject-Dependent, SD)的设定下已普遍取得超过90%的准确率, 但在留一被试(Leave One Subject Out, LOSO)的设定下准确率通常下滑10%~25%, 表明学习特征仍与被试身份高度耦合.EEG情绪标注成本高昂, 数据规模长期停留在数十名被试量级, 进一步放大上述耦合问题.现有EEG自监督方法(如SeqCLR、GMSS、SCMM)多沿用通用代理任务(时间块掩码、SimCLR式增强对比), 尚未将EEG最具特色的脑区拓扑先验写入预训练目标.
针对上述问题, 本文提出两阶段轻量化EEG情绪识别框架— — 脑区先验自监督预训练网络(Brain-Region-Prior Self-Supervised Pretraining Net-work, BSP-Net), 将脑区生理先验从单纯的监督式注意力升级为自监督表征学习+胶囊微调的协同设计.整体上遵循预训练注重通用性、微调注重专用性、推理注重轻量化的原则:预训练阶段仅引入与脑区拓扑相关的通用先验, 微调阶段承担与具体任务和被试紧耦合的判别任务, 推理阶段丢弃所有辅助分支, 保持紧凑参数规模.
BSP-Net以脑区拓扑为统一归纳偏置, 在无标签EEG上联合局部脑区掩码重建(Masked Brain-Region Modeling, MBRM)与全局脑区原型对比(Brain-Region Prototype Contrast, BRPC)两条互补支路, 学习降低被试可分性、对情绪判别有效的表征.之后, 构建轻量化脑区感知通道注意力(Light-weight Brain-Region-Aware Channel Attention, L-BRCA), 将脑区拓扑先验编码融入通道表征学习.下游采用胶囊识别头, 并对比普通分类头, 明确解码结构的贡献边界.在DEAP[19]、DREAMER[20]数据集上的实验表明, BSP-Net可提升标注有限条件下跨被试EEG情绪识别性能.
设EEG样本x∈ RC× T, 其中, C表示电极通道数, T表示时间采样点数.本文聚焦DEAP、DREAMER数据集上二分类设置(K=2), 分别对效价(Va-lence)任务和唤醒度(Arousal)任务独立建模[21].
情绪识别任务可形式化为学习映射
f∶ RC× T→ {Ek|k=1, 2, …, K},
其中, K表示情绪类别数, Ek∈ R16表示第k类高级情绪胶囊, 模长‖ Ek‖ ∈ [0, 1]直接给出该类别的预测概率.
在自监督预训练阶段, 给定无标签EEG集合Du={xi}, 目标是学习共享编码器Eθ ∶ RC× T→ RT'× C'× D, 使其面对跨被试、跨样本时具有较高的稳定性与判别性, 其中, T'表示下采样后的时间长度, C'表示编码后的电极/空间通道数, D表示每个时空位置的特征维度.
在监督微调阶段, 给定有标签集合Dl={(xi, yi)}, 其中yi表示第i个样本的情绪类别标签.主配置以预训练共享编码器Eθ 初始化特征提取器, 并训练胶囊识别头gφ , 输出类别概率.整体预测过程可表示为先由Eθ 提取特征, 再由gφ 完成情绪分类.
本文提出脑区先验自监督预训练网络(BSP-Net), 整体框架如图1所示.
BSP-Net由两阶段构成.阶段A为脑区先验自监督预训练:原始EEG经数据增强生成两组视图x'与x″, 输入共享脑区编码器Eθ , 预训练同时优化MBRM分支与BRPC分支, 使编码器在无标签条件下学习脑区协同关系与跨视图不变表征, 得到预训练参数θ * .阶段B为监督微调:以θ * 初始化编码器, 主配置经胶囊识别头和动态路由输出K类情绪胶囊, 各类情绪胶囊的模长组成类别概率向量
P=[‖ E1‖ , E2‖ , …, ‖ EK‖ ],
本文设置K=2.
下面举例说明BSP-Net在DEAP数据集上的数据流变化, 具体如表1所示.
| 表1 DEAP数据集上BSP-Net数据流变化 Table 1 Data flow variation of BSP-Net on DEAP dataset |
跨被试情绪识别面临标注稀缺与被试间分布差异两重制约, 二者共同要求编码器在无标签数据上学习“ 被试无关、情绪相关” 的表征.
为此, 本文以脑区拓扑先验为统一归纳偏置, 构建自监督预训练编码器, 对共享脑区编码器与两条互补分支(局部脑区掩码重建(MBRM)分支与全局脑区原型对比(BRPC)分支)进行协同优化:前者侧重局部结构的可恢复性, 后者侧重全局语义的判别性.
1.2.1 共享脑区编码器
编码器是自监督表征学习的骨干网络, 需在有限的跨被试EEG样本下兼顾判别能力、轻量性与对电极空间拓扑的利用能力.直接套用深层通用骨干网络存在参数量大、在小样本跨被试场景中容易过拟合的问题, 更关键的是该通道建模方式是在全部电极上施加全局通道注意力, 计算开销随通道数增长, 并且会混合原本不相关的跨脑区信号, 学习的通道依赖在不同被试间波动较大、跨被试稳定性较差.情绪相关的神经活动主要由若干解剖上相对稳定的脑区主导(如额叶的趋近-退避不对称、中央-顶叶的唤醒相关活动), 这类脑区结构在个体间比逐通道模式更一致.为此, 本文采用轻量残差骨干网络提取时空特征, 并设计轻量化脑区感知通道注意力(L-BRCA).L-BRCA依据解剖脑区对通道分组, 仅在组内进行通道交互, 从而将跨被试相对稳定的脑区拓扑先验融入通道表征学习, 在控制参数规模并减少跨脑区无关交互的同时增强对情绪相关脑区结构的敏感性, 契合“ 被试无关、情绪相关” 的表征目标.
脑区编码器Eθ 采用Light-ResNet特征提取器和L-BRCA的组合, 构成轻量时空卷积+脑区分组通道注意力的紧凑结构.Light-ResNet由1个3× 3初始卷积层和4个残差块组成, 通道数从标准ResNet-18[22]的[64, 128, 256, 512]缩至[32, 64, 128, 256], 并使用步长卷积代替最大池化, 保留胶囊层需要的空间层级关系.骨干网络总参数量约为1.30 M, 相比ResNet-18减少约4/5.加入L-BRCA后编码器总参数量约为1.49 M.
这一设计中有3处关键考量.1)步长为2的卷积代替最大池化, 避免索引丢失对后续胶囊姿态参数学习的干扰.2)残差连接采用1× 1卷积进行通道升维, 维持梯度通畅.3)最后一层使用Layer Norma-lization(LN)而非Batch Normalization(BN), 原因在于EEG批次内被试身份混杂, BN的批统计量会引入跨被试干扰, LN按样本独立计算, 更契合EEG的数据特性.
在DEAP数据集上基于国际10-20系统, L-BRCA将EEG通道划分为5个脑区组(详见表2), 并参考ECA-Net[23]的高效通道注意力思想, 在组内通过一维卷积进行局部跨通道交互.
| 表2 DEAP数据集上基于10-20系统的脑区分组方案 Table 2 Brain-region grouping scheme based on 10-20 system on DEAP dataset |
对于输入特征x, Eθ (· )表示共享脑区编码器的映射, 则该映射的输出特征为:
F=Eθ (x)∈ RT'× C'× D.
给定编码器输出特征, L-BRCA首先沿时间维度对每个脑区组进行全局平均池化, 得到相应全局平均池化描述子:
$ \boldsymbol{z}_{g}(\boldsymbol{x})=\frac{1}{T^{\prime}\left|C_{g}\right|} \sum_{t=1}^{T^{\prime}} \sum_{c \in C_{g}} \boldsymbol{F}[t, c, :] .$
其中:Cg表示第g个脑区组包含通道索引集合, g=1, 2, …, 5; F[t, c, ∶ ]表示F在时间位置t、通道c处的D维特征向量.再通过自适应一维深度卷积生成组权重并广播回原通道.
组权重通过Sigmoid非线性激活后, 对原始特征图进行通道乘性加权, 得到加权后的精炼特征:
$ \widetilde{\boldsymbol{F}}=\boldsymbol{F} \odot M(\sigma(\operatorname{Conv} 1 D(z))) \in \mathbf{R}^{T \times C^{\prime} \times D}, $
其中, z表示各脑区描述子矩阵, Conv1D(· )表示组内一维卷积, σ (· )表示Sigmoid激活函数, M(· )表示将组权重广播至对应通道的掩码算子, ☉表示逐元素乘法.
L-BRCA参数量约为0.18 M, 主要通过组内一维卷积生成通道权重, 避免在全部电极之间建立全局注意力.L-BRCA以较低参数开销将脑区拓扑先验融入通道表征学习.
在DREAMER数据集上, 本文依据Emotiv-EPOC设备包含的14个EEG通道在10-20系统中的空间位置, 将其映射至与表2一致的5个脑区组:左额叶组{AF3, F3, F7, FC5}, 右额叶组{AF4, F4, F8, FC6}, 左颞叶组{T7}, 右颞叶组{T8}, 顶叶-中央组{P7, P8, O1, O2}.DREAMER数据集上未采集的DEAP通道不参与该数据集的组内注意力、脑区掩码和脑区原型计算; 各脑区组的池化与原型计算均仅在当前数据集实际存在的通道上进行.因此, DEAP、DREAMER数据集共享相同的脑区划分原则, 但使用各自可观测电极实例化脑区先验.
1.2.2 局部脑区掩码重建分支
要让编码器在无标签条件下有效建模EEG的空间组织, 需要一个能使其建模脑区间关系的代理任务.已有掩码式自监督学习多以时间块或随机通道为掩码单元, 编码器往往仅凭局部时序或通道填充完成重建, 难以捕捉跨脑区的协同关系.为此, 本文提出局部脑区掩码重建(MBRM), 以解剖脑区组为掩码单元, 要求由未遮蔽脑区预测被遮蔽脑区, 从而显式约束编码器, 建模跨脑区依赖.
为了构造既充分多样又语义保真的视图, 设计5类与脑电特性匹配的增强算子:1)时间裁剪(2 s窗口内随机截取重叠率大于等于80%的子序列并线性插值回原长度), 2)频带扰动(对θ 、α 、 β 、γ 这4个频段在[0.8, 1.2]范围内随机增益缩放), 3)通道独立掩码(随机将10%~20%通道置为0), 4)脑区掩码(默认脑区掩码率为0.5, 即每次在5个脑区组中随机遮蔽2~3组), 5)高斯噪声g(信噪比为20~25 dB).
针对每个样本, 在预训练阶段随机抽取两类不同算子, 组合形成正样本对:
x'=a1(x), x″=a2(x),
其中a1(· )、a2(· )表示用于采样的2个不同增强函数.具体增强函数如下:时间裁剪函数T(· ), 频带扰动函数F(· ), 通道独立掩码函数C(· ), 脑区掩码函数R(· ), 高斯噪声函数G(· ).
脑区掩码既作为BRPC的视图增强, 也作为MBRM的掩码方式, 使两种代理任务围绕同一脑区先验形成统一的归纳偏置.MBRM借鉴掩码语言/图像建模的思想, 但以脑区为基本掩码单元[24].给定原始信号x, 按脑区随机选择被掩码索引集合Bm, 默认脑区掩码率为0.5.由于本文将通道划分为5个脑区组, 实际每次随机遮蔽2~3个脑区组, 得到掩码后输入信号xm, 经共享编码器函数输出掩码视图的编码特征:
Fm=Eθ (xm),
再经轻量化重建头(两层一维转置卷积+1× 1卷积, 参数量约为0.55 M)恢复完整通道.
需特别说明的是, MBRM的重建对象不是未经处理的原始波形, 而是经过带通滤波、独立成分分析(Independent Component Analysis, ICA)和Z-score标准化后的clean EEG窗口.
记重建头输出信号
$ \hat{\boldsymbol{x}}=R\left(\boldsymbol{F}_{m}\right), $
其中R(· )表示轻量化重建头映射.
$ L_{\mathrm{MBRM}}=\frac{1}{\left|\Omega_{m}\right|} \sum_{(c, t) \in \Omega_{m}}\left\|\boldsymbol{x}_{c, t}-\hat{\boldsymbol{x}}_{c, t}\right\|_{2}^{2}, $
其中, Ω m表示被遮蔽脑区对应的(c, t)位置集合, xc, t、$ \hat{\boldsymbol{x}}_{c, t} $分别表示目标窗口和重建窗口在通道c、时间t处的信号值.
MBRM仅在被遮蔽脑区上计算重建损失, 若上述跨脑区约束有效, 将脑区掩码替换为时间块或通道随机掩码时跨被试性能应有所下降.
1.2.3 全局脑区原型对比分支
掩码重建侧重局部细节的可恢复性, 但仍需全局目标用于提升表征的判别性与跨被试一致性.区域无关的实例级对比以整段特征为对比单元, 易受个体差异主导且未利用脑区结构.为此, 本文提出全局脑区原型对比(BRPC):将编码器表征按解剖脑区池化, 与跨被试聚合的脑区原型对齐, 在原型层面进行判别, 从而在抹平被试个体信息的同时强化情绪相关的脑区级语义.
在预训练阶段, 脑区编码器Eθ 后面连接两层多层感知机投影头h, 将Eθ 输出的512维脑区级表征映射为128维单位归一化向量.该投影头参数量约为0.12 M, 仅用于脑区原型对比预训练, 在微调与推理阶段被移除[25].
对比分支以余弦相似度度量表征间的接近程度, 两投影向量的余弦相似度如下所示:
$ s_{i, j}=\frac{h\left(z_{i}^{\prime}\right)^{\mathrm{T}} h\left(z_{j}^{\prime \prime}\right)}{\left\|h\left(z_{i}^{\prime}\right)\right\| \cdot\left\|h\left(z_{j}^{\prime \prime}\right)\right\|}, $
其中, h(· )表示投影函数, z'i、z″j分别表示第i、 j个样本在2种增强视图下的脑区级表征.设置BRPC温度参数τ =0.1.从信息论角度上看, MBRM通过增强表征z与被掩码脑区信号x(x∈ Ω m)在未掩码脑区(V/Ω m)下的相关性, 约束编码器保留细粒度脑区结构信息.BRPC将各脑区表征拉近其解剖原型、推离其它脑区原型, 在原型层面进行判别, 使各脑区表示围绕共享原型对齐, 并与其它脑区原型充分分散(全局判别能力).两者在损失层面互补, 又共享同一编码器, 在局部恢复与全局判别之间达成平衡.本文通过验证集网格搜索确定权重.
相比常见的通用自监督对比或冗余约束方法, 本文的双任务组合更强调局部恢复与原型判别的互补约束, 有助于改善小批次和噪声条件下的训练稳定性:MBRM有助于避免编码器过度依赖低维抽象捷径, BRPC抑制与被试身份耦合的个体噪声, 两者共同收敛到对情绪识别有用的中间表征带.
对比分支采用区域感知的BRPC, 并以MBRM+BRPC作为最终预训练目标.具体地, 将编码器输出按脑区分组并池化, 得到输入x在第g个脑区上的表征:
zg(x)=pool(Fθ (x)[c∈ Gg]),
其中, pool(· )表示对指定脑区编码特征进行池化的函数, Fθ (x)表示编码器输出特征, Gg表示第g个脑区对应的通道索引集合.
维护跨全体被试聚合的脑区原型集合
P={p1, p2, …, pG},
其中pg表示第g个脑区原型, 并以指数滑动平均更新
$ \boldsymbol{p}_{g} \leftarrow m \boldsymbol{p}_{g}+(1-m) \frac{1}{|B|} \sum_{x \in B} \boldsymbol{z}_{g}(\boldsymbol{x}), $
其中, m表示动量系数, B表示当前小批次样本集合, |B|表示该集合样本数.更新时对原型采用停止梯度(Stop-Gradient)操作.
脑区级对比损失将同脑区表征拉近其原型、推离其它脑区原型, 相应公式如下:
$ L_{\mathrm{BRPC}}=-\frac{1}{G} \sum_{g=1}^{G} \log \left(\frac{\exp \left(\frac{\operatorname{sim}\left(z_{g}, p_{g}\right)}{\tau}\right)}{\sum_{g^{\prime}=1}^{G} \exp \left(\frac{\operatorname{sim}\left(z_{g}, p_{g^{\prime}}\right)}{\tau}\right)}\right) .$
BRPC与PCL(Prototypical Contrastive Lear-ning)[26]、SwAV(Swapping Assignments between Multi-ple Views)[27]等原型对比方法共享“ 原型+指数滑动平均(Exponential Moving Average, EMA)+跨样本对比” 的范式.与之不同的是, 本文原型并非由聚类在数据中发现的语义簇, 而是由脑区拓扑先验解剖学定义、跨被试聚合的脑区中心.因此本文主张收窄为“ 原型对比在脑区先验下的实例化” .为了防止表征塌缩, BRPC对原型施加Stop-Gradient、引入跨脑区推开项, 并与MBRM联合训练, 强制保留可重建信息.
最终预训练目标为两支损失的加权组合:
Lpre=α LMBRM+β LBRPC,
其中, α 表示LMBRM权重系数, β 表示LBRPC权重系数.
为了通过普通分类头对比, 分析胶囊识别头的独立贡献, 本文将胶囊识别头作为主配置解码器.
下游识别头需在编码器表征上区分情绪类别.普通分类头(softmax分类头)以单个激活值表示类别概率, 难以显式刻画情绪模式的层级与姿态结构.本文采用向量化胶囊识别头, 以胶囊模长表示情绪类别存在概率, 以方向编码模式姿态, 并通过动态路由聚合部分-整体关系.
微调阶段以预训练编码器E* θ 进行初始化, 主配置流程如下:
编码器E* θ → 胶囊识别头→ 动态路由→ 情绪胶囊.
预训练使用的MBRM分支和BRPC分支在微调与推理阶段均被丢弃.编码器输出F∈ RT'× C'× D经一组3× 3、步长为2的卷积操作压缩并重组为Np(Np=1 024)个8维初级胶囊, 每个胶囊以向量模长表示实体存在概率, 方向编码姿态参数.初级胶囊由Squash非线性激活, 确保模长落入[0, 1]区间.经Squash函数压缩后的第i个初级胶囊输出向量为:
$ v_{i}=\frac{\left\|s_{i}\right\|^{2}}{1+\left\|s_{i}\right\|^{2}} \cdot \frac{s_{i}}{\left\|s_{i}\right\|}, $
其中, si表示第i个初级胶囊的总输入向量.然后, 初级胶囊通过迭代式动态路由生成k(k=2)个高级情绪胶囊:
$ \boldsymbol{E}_{k}=\operatorname{Squash}\left(\sum_{i \in S} c_{i k} \boldsymbol{W}_{i k} \boldsymbol{v}_{i}\right) .$
其中:S表示进入动态路由的初级胶囊集合; cik表示初级胶囊i到第k类情绪胶囊的耦合系数, 由路由迭代中的对数先验经softmax归一化得到; Wik表示相应的可学习变换矩阵.分类损失采用Sabour等[28]提出的边际损失:
$ \begin{aligned} L_{\mathrm{cls}}= & \sum_{k=1}^{K} T_{k} \max \left(0, m^{+}-\left\|\boldsymbol{E}_{k}\right\|\right)^{2}+ \\ & \lambda\left(1-T_{k}\right) \max \left(0, \left\|\boldsymbol{E}_{k}\right\|-m^{-}\right)^{2}, \end{aligned}$
其中, Tk表示真实类别指示变量, m+、m-分别表示正负类别边际, λ 表示负类损失权重.Lcls对正确类别采用上界裕度, 对错误类别采用下界裕度, 可避免简单交叉熵在多类胶囊输出下的尺度漂移问题.
在参数与计算规模方面, BSP-Net预训练阶段总参数量约为2.15 M, 其中MBRM分支(约为0.55 M)与BRPC分支(约0.12 M)仅在预训练阶段参与计算.这两个分支在微调与推理阶段被丢弃.根据实际模型进行统计, 推理阶段保留的脑区编码器和胶囊识别头参数量分别约为1.49 M和0.65 M, 合计约为2.14 M, 采用普通分类头可降至1.54 M.预训练阶段的额外计算主要来自MBRM分支和BRPC分支, 但预训练只需进行一次, 即可服务SD、少样本和跨域等多种下游任务, 在多任务场景中具有一定复用价值.
本节仅从参数规模角度说明网络的紧凑性, 不将具体推理时延作为主要结论, 实际部署效率仍需结合硬件平台与实现方式进行进一步评估.
本文在DEAP[19]、DREAMER[20]这2个公开基准数据集上进行评测.DEAP数据集包含32名被试观看40段1 min音乐视频时的32通道EEG信号, 公开版本采样率为128 Hz, 去除前3 s基线后每个试次(trial)维度为32× 7 680, 被试在效价(Va- lence)、唤醒度(Arousal)上按1~9量表自评, 本文以5为阈值划分高、低类别.DREAMER数据集包含23名被试观看18段电影片段时的14通道EEG数据(EmotivEPOC设备, 128 Hz), 被试在效价任务和唤醒度任务上按1~5量表自评, 本文以3为阈值进行二分类.
数据预处理采用领域标准流程:信号降采样至128 Hz, 使用ICA去除眼电和肌电伪迹, 应用四阶Butterworth带通滤波(4~45 Hz), 采用2 s非重叠滑动窗口切分样本, 对每个样本进行Z-score标准化.所有基于时间窗的样本划分均以trial为最小独立单元, Z-score标准化的均值和方差仅由训练集样本估计, 测试集样本不参与模型训练、早停和超参数选择.
自监督预训练分别在DEAP、DREAMER数据集各自的无标签训练折窗口上进行.为了杜绝数据泄漏, 所有划分均以trial为最小独立单元并严格执行trial级独立准则:任一测试trial的任何窗口都不进入预训练与训练折.预训练优化器采用AdamW(Adaptive Moment Estimation with Weight Decay), 选择余弦退火策略, 设定lr=3× 10-4, 权重衰减系数为1× 10-2, 批量大小为128, 预训练80个轮次.联合目标与关键超参数设置如下:LMBRM权重系数α =1.0, LBRPC权重系数β =0.5, 温度τ =0.1, 脑区掩码率为0.5, 原型EMA动量m=0.99.监督微调采用Adam(Adaptive Moment Estimation), lr=1× 10-3, 权重衰减系数为1× 10-4, 批量大小为64, 采用余弦退火与早停策略, 早停耐心值设为10.
评估采用LOSO, 相应指标为准确率(Accuracy, ACC)与宏F1(Macro-F1).所有实验固定5个随机种子, 结果为5个随机种子的均值± 标准差, 辅以配对显著性检验(p< 0.05).
在NVIDIA RTX5070 GPU、PyTorch环境下运行实验.
本节选取监督学习、域适应和自监督学习这3类方法进行对比实验.监督学习方法包括EEGNet[4]和DGCNN[7]; 域适应方法包括DANN[13]; 自监督学习方法包括SeqCLR[16]、GMSS[17]和SCMM[18].EEGNet作为紧凑卷积监督基线网络.DGCNN代表图结构监督建模.DANN作为传导式(transductive)域适应参照, 每个LOSO折以训练被试有标签样本为源域, 仅使用留出被试的无标签EEG窗口构造域判别损失, 不使用留出被试情绪标签.SeqCLR、GMSS和EEG-SCMM用于对比同类EEG自监督表征学习方法.所有对比方法均在本文统一预处理、划分协议与训练设置下复现, 并采用原文献推荐超参数或验证集调参.因协议差异, 相关方法结果不直接等同于原文献报告值.
采用LOSO后, 各网络在DEAP-V、DEAP-A、DREAMER-V、DREAMER-A任务上指标值如表3所示, 在表中, V表示效价任务, A表示唤醒度任务, * 表示BSP-Net相比次优的SCMM的5个种子配对t检验达到p< 0.05.DANN为transductive域适应参照, 仅使用目标被试无标签窗口, 而不使用目标标签.除了DANN以外, 其余网络均不接触目标被试数据.BSP-Net采用自监督预训练编码器+胶囊识别头, 并在训练被试标注样本上完成监督微调.BSP-Net在DEAP-V、DEAP-A任务上准确率为68.2%和69.1%, 在DREAMER-V、DREAMER-A任务上准确率为67.0%, 67.9%, 4项任务上的平均准确率为68.1%, 相比次优的SCMM(平均准确率为66.3%)提升约1.8%.相比EEGNet和DGCNN, BSP-Net平均准确率提升7%~8%.BSP-Net在4项任务上均取得最高平均准确率, 其中在DEAP-V、DEAP-A与DREAMER-A上相对次优网络达到显著差异, 在DREAMER-V上虽均值最高但因跨种子方差较大, 未达到显著差异.可见3个最同源的EEG自监督学习方法(SeqCLR、GMSS、SCMM)整体性能优于监督学习与域适应方法, 印证自监督表征对跨被试泛化的价值.BSP-Net进一步的领先说明将脑区拓扑先验写入预训练目标可带来一致增益.
| 表3 各网络在4个任务上的跨被试性能对比 Table 3 Comparison of cross-subject performance among different networks on 4 tasks under LOSO protocol % |
由表3还可看出, 相比ACC指标, 各网络的Macro-F1值降低约0.8%~1.4%, 且排序基本一致, BSP-Net平均Macro-F1值为67.1%, 仍最优.需说明的是, 表3中BSP-Net均为仅采用自监督学习表征的主配置, 即自监督编码器+胶囊识别头, 下面各项实验也以该配置为准.
下面分别从少样本微调和冻结表征线性探测两个角度考察标注的高效性.
在DEAP-V任务上, 采用LOSO, BSP-Net和监督从头训练的少样本微调性能如图2所示, 其中, 监督从头训练表示不同标注比例下的端到端少样本微调结果.
由图2可见, 标注越稀缺增益越大.相比监督从头训练, 仅1%标注比例时, BSP-Net的准确率提升约6.7%, 当100%标注比例时, BSP-Net的准确率仍提升3.7%.这与“ 自监督表征标注高效” 的预期一致, 体现其在标注受限场景中的应用潜力.
从冻结表征线性探测角度出发, 选择随机初始化、有监督从头训练、BSP-Net三种表征, 相应准确率如表4所示.其中, 有监督从头训练仅作为线性探测设置下的从头训练参照, 由于与图2中监督从头训练设置不同, 因此数值不直接对应.由表可见, 在线性探测(冻结编码器+线性头)下, BSP-Net的准确率达到65.0%, 明显高于有监督从头训练的61.5%与随机初始化的52.5%, 表明表征本身已具判别力.
| 表4 冻结表征线性探测上的性能对比 Table 4 Performance comparison of linear probing on frozen representations % |
下面进行数据规范性验证, 对比窗口级与trial级两种划分协议, 相应准确率如表5所示.由表可见, 在窗口级划分下, 同一trial的窗口可能同时进入训练与测试, 存在数据泄漏隐患, 此时在DEAP-V、DEAP-A任务上的准确率分别为95.0%和95.4%, 在DREAMER-V、DREAMER-A任务上的准确率分别为95.8%和96.1%.采用trial级严格独立划分(任一测试trial的任何窗口均不进入预训练与训练折)后, 在DEAP-V、DEAP-A任务上的准确率分别为92.5%, 93.0%, 在DREAMER-V、DREAMER-A任务上的准确率分别为93.0%, 93.5%, 仍与文献同量级.
| 表5 不同划分与预训练协议下的性能对比 Table 5 Performance comparison under different splits and pre-training protocols % |
相比DEAP数据集, 方法基于DREAMER数据集在SD设置下的准确率略高而在LOSO设置下准确率略低, 说明其同被试内可分性尚可, 但14通道采集设备、通道数量和被试差异会使跨被试泛化更困难.这表明窗口级划分会高估性能, 严格的trial级协议是可靠评估的必要前提.进一步设置泄漏对照:LOSO下分别使用“ 仅训练折窗口预训练(严格无泄漏)” 与“ 全体trial窗口预训练(transductive)” , 二者准确率差异约为0.3%~0.4%, 表明在严格无泄漏协议下主结论(BSP-Net在严格LOSO设定下的性能增益不依赖目标被试数据参与预训练)仍成立.
下面给出机制三度量分析, 采用DEAP数据集, 均为冻结表征+线性探针.对比3类机制:被试身份探针、互信息估计(包括被试相关互信息与情绪相关互信息)、情绪探针, 结果如图3所示.
| 图3 BSP-Net表征中被试身份与情绪信息的探针及互信息分析Fig.3 Probe and mutual information analyses of subject identity and emotion information in BSP-Net representations |
被试身份探针采用冻结表征训练线性分类器, 以被试编号为预测目标, 并在训练折内按窗口划分训练集和验证集.准确率越低表示表征中可线性解码的被试身份信息越少.被试身份探针在LOSO训练折中为多被试身份分类, 随机机会水平约为1/31.因同一被试的窗口级EEG仍包含稳定个体特征, 随机初始化特征也可能被线性探针部分区分, 且训练、验证均来自训练折窗口, 因此被试身份探针仅用于同一设置下不同表征的相对对比.互信息采用基于线性探针预测概率的离散化近似估计, 即由探针输出分布计算表征与被试/情绪标签之间的经验互信息, 数值仅用于不同表征之间的对比.互信息采用自然对数, 单位为nat.以被试身份探针准确率衡量表征中残留的被试信息:随机初始化时准确率为42.0%, 有监督从头训练时准确率升至55.0%, 而BSP-Net的准确率降至36.5%.当自监督学习的被试可分性低于“ 有监督从头训练” 时, 更能支持被试信息抑制主要来自自监督预训练, 而非任意训练过程都会自然产生.与之一致的是, 互信息估计值由有监督从头训练的2.10降至1.42, 而情绪相关的互信息估计值由0.60升至0.66, 情绪探针的准确率由61.5%升至65.0%.三项度量共同表明学习表征在抑制被试身份的同时保留并增强情绪判别信息, 为“ 情绪相关、被试无关” 的目标提供可度量证据.
Scratch、SCMM[18]和BSP-Net的跨域双向迁移性能对比如表6所示, 其中Scratch为跨域迁移设置下按相同通道映射和训练折从头训练的直接参照, 与表4中冻结编码器线性探测设置不同.将DEAP数据集上自监督预训练的编码器迁至DREAMER数据集(跨库迁移时优先映射2个数据集共有或空间位置最近的10-20系统电极; 当DEAP→ DREA-MER时, DREAMER缺失的DEAP通道不参与目标库输入; 当DREAMER→ DEAP时, DEAP新增通道相关参数采用Xavier初始化, 其它层继承源库预训练权重)时, BSP-Net(V)、BSP-Net(A)的准确率分别达到65.4%和66.1%; 当DREAMER→ DEAP时, BSP-Net(V)、BSP-NetV(A)的准确率分别为64.7%和65.3%.
| 表6 跨域迁移上3种网络的性能对比 Table 6 Performance comparison of 3 networks on cross-domain transfer % |
双向迁移性能均优于各自从头训练和SCMM, 说明脑区先验自监督学习的结构信息具有跨语料可迁移性.由于两库采集范式差异较大, 迁移稳定性仍有待在更多数据集上验证.
以因子矩阵呈现MBRM、BRPC与解码头的消融实验结果.除特别说明外, 编码器均含L-BRCA.相应准确率如表7所示, 其中解码头包含胶囊识别头和普通分类头.由表可见, 在相同MBRM+BRPC编码器下, 在DEAP-V、DEAP-A、DREAMER-V、DREA-MER-A任务上, 胶囊识别头的准确率分别比普通分类头平均提升约0.5%.
| 表7 2个模块与解码头的消融实验结果 Table 7 Ablation experiment results of 2 modules and decoder head % |
相比之下, MBRM与BRPC带来的增益更大, 说明性能提升主要来自脑区先验自监督表征, 胶囊识别头提供额外解码收益.
以DEAP-V任务为例, MBRM与BRPC的联合增益(3.7%)略低于两个单支的线性叠加(1.8%+2.1%=3.9%), 说明两分支信息存在部分重叠.在其余任务上, 联合配置也均高于任一单支, 表明二者总体具有互补性.
在最终框架下逐一改动单个设计维度, 相应消融实验结果如表8所示.由表可见, 移除L-BRCA后, 在DEAP-V、DEAP-A、DREAMER-V、DREAMER-A任务上的准确率由68.2%、69.1%、67.0%、67.9%降至66.9%、68.0%、65.8%、66.7%.将正确脑区分组随机打乱后, 在DEAP-V、DEAP-A、DREAMER-V、DREAMER-A任务上的准确率降至66.4%、67.5%、65.1%、66.2%.以上情况说明脑区先验增益依赖真实脑区拓扑而非任意分组.将MBRM的脑区掩码替换为时间块掩码后, 在DEAP-V、DEAP-A、DREA- MER-V、DREAMER-A任务上的准确率为67.1%、68.0%、65.9%、66.8%, 替换为通道随机掩码后准确率为66.8%、67.8%、65.6%、66.6%.将BRPC的解剖脑区原型替换为k-means数据驱动原型后, 在DEAP-V、DEAP-A、DREAMER-V、DREAMER-A任务上的准确率降至67.0%、67.9%、65.7%、66.7%.由此可见, 在2个数据集、4个任务上下降方向一致.
| 表8 关键设计专项的消融实验结果 Table 8 Ablation experiment results of key designs % |
在参数规模方面, BSP-Net主配置(胶囊识别头)参数量约为2.14 M; 采用普通分类头后参数量可降至1.54 M.相比普通分类头, 胶囊识别头增加约0.6 M的参数量, 并带来平均约0.5%的性能提升.由此可见, 普通分类头可用作更轻量替代, 但若以识别性能为优先, 应采用胶囊识别头作为主配置.作为参照, EEGNet[4]、DGCNN[7]、SCMM[18]的参数量分别约为0.01 M、0.15 M和0.90 M.上述参数量均基于本文统一输入尺寸与实现统计, 不直接等同于原文献报告值.
相比同类自监督方法SCMM, BSP-Net以适度参数规模换取较高的跨被试精度, 从参数规模上看处于精度-规模较合理的折衷区.由于硬件、实现和批大小会显著影响推理时延, 本文不将推理速度作为主要结论.
综合表3~表8及参数规模分析可见, BSP-Net的优势集中体现在跨被试泛化与标注高效这2个维度, 而非以参数膨胀换取精度.其主要增益来自脑区先验自监督表征, 胶囊识别头提供小幅额外解码收益, 这一结论由因子矩阵消融实验与机制度量分析结果共同支撑.
本节从特征空间结构、脑区注意力分布进行可视化分析, 作为前述定量结果的补充与佐证.
基于严格LOSO测试折, 给出编码器和胶囊特征的t-SNE(t-Distributed Stochastic Neighbor Embe-dding)可视化结果, 具体如图4所示.由图可见, 监督从头训练的特征呈现明显的被试聚类, 表明特征与被试身份高度耦合.自监督预训练后被试间界限明显模糊, 正、负情绪类别初现分离.BSP-Net高级胶囊特征中正、负类别形成较紧致的两簇且跨被试样本相互嵌入.该定性趋势与图3的机制三度量结论一致.需指出的是, t-SNE的低维投影会损失高维全局几何关系, 上述分离度仅作定性指标.
基于训练完成的模型, 给出L-BRCA在效价任务与唤醒度任务上的脑区注意力热力图, 具体如图5所示.
由图5可见, 效价任务上左/右额叶组呈现明显不对称(左侧高于右侧), 这与额叶不对称理论[29]中左额叶指示趋近动机、右额叶指示退避动机的结论定性一致.唤醒度任务中顶叶-中央组权重相对更高, 与Zheng等[30]研究中情绪相关关键脑区与频带的发现相符.需要注意的是, 注意力分布反映模型内部关注, 并不直接等同于神经元层面的真实激活.
在DEAP-V任务上, 采用LOSO, 分析LMBRM权重系数α 、LBRPC权重系数β 、温度τ 和脑区掩码率的敏感性, 定义α =0.5, 1.0, 1.5, 2.0, β =0.1, 0.3, 0.5, 0.7, 1.0, τ =0.05, 0.1, 0.2, 0.5, 脑区掩码率为0.3, 0.5, 0.7, 0.9.
这4个超参数对BSP-Net性能的影响如图6所示.由图可见, 这4个超参数均在合理区间内表现相对平稳, 峰值分别位于α =1, 0, β =0.5, τ =0.1, 脑区掩码率为0.5.上述情况与2.1节设置一致.
LBRPC权重系数β 对被试可分性和情绪可分性的影响如图7所示.
由图7可见, 随着β 的增大, 被试身份探针的准确率持续下降, 而情绪探针的准确率先升后降, β =0.5时在抑制被试身份信息与保持情绪判别能力之间取得较好折衷.
LMBRM、LBRPC随预训练批次的变化曲线如图8所示.
| 图8 LMBRM和LBRPC随预训练批次变化的曲线Fig.8 Curves of LMBRM and LBRPC versus the number of pre-training iterations |
由图8可见, 两类预训练损失在前30个批次时快速下降, 在40~60个批次时趋稳, 在60~80个批次时缓慢下降.
采用LOSO, 下游DEAP-V任务上的准确率随预训练批次的变化曲线如图9所示.由图可见, 下游DEAP-V任务上的准确率在预训练批次为80时首次达到约68.2%并趋于稳定.
本文针对EEG情绪识别中跨被试域偏移较大、标注稀缺与生理先验利用不足的问题, 提出脑区先验自监督预训练网络(BSP-Net).BSP-Net脑区拓扑为统一归纳偏置, 联合脑区掩码重建(MBRM)与脑区原型对比(BRPC)两条互补支路, 在共享编码器上学习有效降低被试身份信息、对情绪判别有效的表征.在DEAP、DREAMER数据集上按trial级严格无泄漏协议评测, 采用LOSO, 相应跨被试准确率有所提升.线性探测显示学习表征具备较强判别性.少样本实验显示在DEAP-V任务上1%标注设置下, BSP-Net的准确率相比监督从头训练提升约6.7%.机制分析表明表征有效降低被试身份信息.消融实验表明, 脑区感知的BRPC及其解剖脑区先验带来方向一致的性能增益.模型主配置(胶囊识别头)推理参数约为2.14 M.采用普通分类头可将参数量降至1.54 M, 但准确率平均下降约0.5%, 因此胶囊识别头在性能优先设置下更适合作为主配置、普通分类头可作为轻量化替代.
当前工作仍存在若干局限:预训练数据仍局限于DEAP、DREAMER两个中小规模情绪EEG数据集, 未在更大规模异构EEG数据集上进行联合预训练与可扩展性验证; 当前评估仍以离线LOSO与少样本设置为主, 距离测试时适应和零校准在线识别仍有距离; 仅使用单模态EEG信号, 未利用心电图(Electrocardiogram, ECG)、眼电图(Electrooculo-gram, EOG)、皮肤电活动(Electrodermal Activity, EDA)等互补生理模态; 二分类高、低设置可能忽略中性情绪信息.围绕这些局限, 未来工作将沿如下4个方向推进:在更大规模异构EEG语料(如联合DEAP、DREAMER、SEED、SEED-IV数据集)上进行联合预训练, 构建通用EEG情绪基础表征模型; 将自监督预训练与测试时适应、少样本元学习结合, 探索零校准在线适应; 扩展至多模态生理信号联合自监督预训练, 进一步提升复杂情境下的鲁棒性; 探索情绪强度回归和连续情感空间建模, 使网络不仅识别离散类别, 还能定量刻画情绪强度的细微变化.这些方向有望提升EEG情绪识别在实际场景中的实用性.
本文责任编委 兰旭光
Recommended by Associate Editor LAN Xuguang
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|

