压缩引导双曲插值融合的视觉神经解码方法
张剀凡1, 刘军1, 季毓淇1, 何立火1
1.西安电子科技大学 电子工程学院 西安 710071
通信作者:

何立火,博士,教授,主要研究方向为信息感知、视觉计算、类脑智能.E-mail:lhhe@mail.xidian.edu.cn.

作者简介:

张剀凡,博士研究生,主要研究方向为视觉神经解码、人工智能.E-mail:kaifanzhang@stu.xidian.edu.cn.

刘 军,博士研究生,主要研究方向为目标检测、缺陷检测.E-mail:26021110022@stu.xidian.edu.cn.

季毓淇,博士研究生,主要研究方向为目标检测、域自适应开集目标检测、功能检测.E-mail:24021110955@stu.xidian.edu.cn.

第二十八届中国科协年会学术论文

摘要

基于脑电信号的视觉神经解码旨在从脑活动中检索受试者感知的图像.针对脑电信号信噪比低、视觉教师特征冗余及单一教师难以兼顾语义结构与感知细节等问题,文中提出压缩引导双曲插值融合的视觉神经解码方法(Compression-Guided Hyperbolic Interpolation Fusion Method for Visual Neural Decoding, CHIF).首先,在结构增强分支和外观保持分支上分别引入教师侧压缩适配器,对视觉表征进行压缩适配,降低高维视觉特征与EEG表征的模态差异.然后,设计双曲插值融合模块,将教师特征映射至双曲空间,通过测地线插值构造统一教师目标,并结合双曲距离和双向对比学习实现跨模态对齐.在10名被试EEG-图像检索数据集上的实验表明,CHIF取得有效的检索结果.

关键词: 脑电-图像检索; 视觉神经解码; 双曲插值融合; 跨模态对齐
中图分类号:TP391.4
Compression-Guided Hyperbolic Interpolation Fusion Method for Visual Neural Decoding
ZHANG Kaifan1, LIU Jun1, JI Yuqi1, HE Lihuo1
1. School of Electronic Engineering, Xidian University, Xi'an 710071
Corresponding author: HE Lihuo, Ph.D., professor. His research interests include infor-mation perception, visual computing and brain-inspired intelligence.

About Author:
ZHANG Kaifan, Ph.D. candidate. His research interests include visual neural decoding and artificial intelligence.
LIU Jun, Ph.D. candidate. His research interests include object detection and defect detection.
JI Yuqi, Ph.D. candidate. His research interests include object detection, domain-adaptive open-set object detection and functional testing.

Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology

Abstract

Visual neural decoding based on electroencephalography(EEG) is designed to retrieve images perceived by subjects from brain activity. To address the issues of low signal-to-noise ratio in EEG signals, redundancy in visual teacher features and the difficulty for a single teacher to simultaneously preserve both semantic structure and perceptual details, a compression-guided hyperbolic interpolation fusion method for visual neural decoding (CHIF) is proposed in this paper. First, lightweight compression modules are introduced into the structure-enhancement branch and the appearance-preservation branch to compress and adapt visual representations. Consequently, the modality gap between high-dimensional visual features and EEG representations is reduced. Second, a hyperbolic interpolation fusion module is designed. Teacher features are mapped into hyperbolic space. A unified teacher target is constructed through geodesic interpolation. Cross-modal alignment is achieved by combining hyperbolic distance and bidirectional contrastive learning. The experiments on an EEG-image retrieval dataset of 10 subjects demonstrate that CHIF achieves effective retrieval performance.

Key words: Key Words EEG-Based Image Retrieval; Visual Neural Decoding; Hyperbolic Interpolation Fusion; Cross-Modal Alignment

视觉对象识别是人类视觉系统的核心能力之一, 其神经计算机制长期受到认知神经科学与视觉认知计算研究的关注[1, 2].早期研究表明, 可从人脑活动中识别受试者观看的自然图像, 这为基于神经信号的视觉解码任务奠定基础[3].基于脑电信号(Electroencephalography, EEG)的视觉神经解码旨在根据受试者的EEG信号恢复其感知的视觉内容, 是脑机接口(Brain-Computer Interface, BCI)与认知计算中的新兴研究方向[4, 5].近年来, 随着深度学习、多模态表征学习与大规模视觉-语言预训练模型的发展, 研究者尝试将EEG表征与视觉特征空间对齐, 实现零样本脑电图像检索[6, 7].然而, EEG信号信噪比低、时序变化复杂、试次间差异较大, 如何从有限且噪声较强的EEG信号中提取稳定、可判别的视觉相关表示, 仍是该任务面临的核心挑战[8, 9].

现有研究通常借助预训练视觉模型引导EEG编码器学习视觉相关表征, 主流范式多采用对比学习直接对齐EEG特征与视觉特征[10].然而, 这一范式存在两个层面的局限:1)现有方法多依赖单一视觉表征, 难以同时刻画视觉内容的语义结构与感知细节[11, 12]; 2)EEG信号与视觉特征之间存在显著的分布差异与维度鸿沟, 直接使用未经适配的视觉目标进行对齐, 会加剧EEG编码器的优化负担, 导致对齐质量受限[13, 14].

针对上述局限, 相关研究主要沿两条思路展开.一类方法聚焦于视觉侧适配, 通过特征压缩或轻量模块将原始视觉表示变换为更紧凑的形式, 缓解跨模态不匹配的问题[13, 14].另一类方法引入多视角输入与多分支建模, 在更具结构性的空间中融合不同类型的视觉证据[10, 11].然而:前者通常仍局限于单路视觉表征设定, 未能充分利用多视角信息; 后者虽增强融合能力, 却较少关注视觉表征与EEG信号之间的适配效率, 直接使用高维视觉特征进行融合难以有效弥合跨模态鸿沟.因此, 现有方法尚缺少一个统一框架, 能同时兼顾视觉侧压缩与多分支几何融合两方面优势.

为此, 本文提出压缩引导双曲插值融合的视觉神经解码方法(Compression-Guided Hyperbolic Inter-polation Fusion Method for Visual Neural Decoding, CHIF), 实现低信噪比EEG信号与复杂视觉表征之间的高效跨模态对齐.首先, 在结构增强分支与外观保持分支上分别引入教师侧压缩适配器, 将原始高维视觉特征压缩为更紧凑、更适配EEG模态的表示, 缓解跨模态表征鸿沟.然后, 设计双曲插值融合模块, 将两路压缩后的特征映射至双曲空间, 并通过测地线插值实现融合.该设计的核心在于:先压缩、后融合.压缩负责弥合脑电信号与视觉表示之间的跨模态鸿沟, 融合负责建模语义信息与感知信息之间的互补关系, 二者形成功能互补.实验表明, CHIF取得有效的检索结果.进一步的消融实验显示, 教师侧压缩适配器与双曲插值融合模块能带来模块级增益.同时, 跨被试和跨域验证结果表明, CHIF的泛化稳定性仍需进一步提升.

1 相关工作

早期非侵入式脑机接口研究已开始探索利用EEG及辅助信号进行意图识别和动作分类, 为后续基于脑电信号的高层感知解码提供方法基础[15, 16].随着公开EEG数据集和大规模视觉表征模型的开发, 基于EEG信号的零样本图像检索与视觉解码已逐渐形成较稳定的研究范式[4, 6].这类工作通常以跨模态相似度学习为核心, 将EEG表征对齐到视觉教师空间, 用于检索、识别或进一步的图像重建[7, 17].相关研究表明, EEG信号中确实包含可恢复视觉语义的判别信息, 这也推动该方向的持续发展.但是, 现有路线仍多以单路视觉监督为主, 这类设定结构简洁, 却往往难以同时兼顾语义关系与感知细节.同时, 未经任务适配的高维视觉特征也会加重EEG分支的映射压力[12].

针对EEG与视觉特征分布不对称的问题, 近期研究通过特征压缩、特征筛选或引入轻量可学习模块, 对视觉教师特征进行任务适配, 再将适配后的特征作为EEG表征的对齐目标[13, 14].这类做法与适配器、提示微调等高效参数方法呼应, 强调在保留预训练知识的同时, 利用少量可学习模块调整特征结构[18].对EEG-图像检索而言, 教师侧适配不仅降低参数量, 还减轻EEG分支的表示迁移压力.然而, 现有相关工作大多仅对单一视觉教师进行适配, 多种视觉证据并存时是否需要分支化适配, 这些尚未充分探讨.

除了教师侧压缩之外, 另一条思路是通过多视角视觉输入或多证据融合提升EEG-视觉对齐能力[10, 11].这类研究的出发点在于:不同视觉特征往往承担不同职责, 语义级表征更适合描述类别与概念关系, 感知级表征更贴近纹理和局部外观[7, 8, 9, 10, 11, 12].因此, 多分支建模并不只是增加输入数量, 而是试图在统一框架中保留不同层次的视觉证据.但是, 现有工作更多关注后端融合策略, 对各分支在进入融合前是否需要先进行任务适配涉及较少.如果这一环节处理不当, 多证据建模的收益可能难以稳定释放.与此同时, 在表示空间的选择上, 双曲几何为建模层次关系和结构化融合提供新的思路.已有研究表明, 相比欧氏空间, 双曲空间更适合表达层级化语义结构, 并已被逐步引入视觉表征和视觉语言对齐任务中[19, 20].对EEG-图像检索而言, 这一方向同样具有吸引力, 因为视觉类别之间天然存在语义层次, 而EEG表征容量相对有限[21].从现有工作看, 双曲方法更多强调几何空间本身的表达优势, 对于“ 先适配、再融合” 的问题关注较少.

2 压缩引导双曲插值融合的视觉神经解码方法

本文重点关注零样本脑电图像检索场景中的EEG-图像跨模态表征对齐问题.现有方法通常依赖单一视觉监督信号, 难以同时刻画语义层面的类别关联与感知层面的视觉相似性.同时, 预训练视觉特征与EEG信号之间存在显著表征鸿沟, 直接对齐会进一步增加脑电分支的映射负担.围绕这一问题, 本文提出压缩引导双曲插值融合的视觉神经解码方法(CHIF), 整体框架如图1所示.

图1 CHIF整体框架图Fig.1 Overall framework of CHIF

CHIF主要包含如下4个阶段.首先, 通过脑电投影层将EEG信号映射至共享表示空间.其次, 在结构增强分支与外观保持分支中分别引入教师侧压缩适配器, 缓解视觉特征与脑电特征之间的尺度和结构差异.然后, 设计双曲插值融合模块, 将两路视觉表征映射至双曲空间, 并基于测地线插值构造统一的教师目标.最后, 利用双曲距离建立EEG表征与图像表征之间的跨模态匹配关系, 从而支持零样本脑电图像检索.

2.1 脑电投影层

EEG信号经通道选择与时间窗截取后, 原始维度与视觉表征空间并不一致, 因此需先通过脑电投影层映射至共享表征维度, 支撑后续跨模态对齐.本文保留17个来自枕叶O区与顶叶P区的通道, 并采用0~250 ms完整时间窗作为输入.

为了减少额外预处理选择对核心对齐机制分析的影响, 本文不进行子窗口划分或时频变换, 而将保留通道与完整时间窗作为一个整体时空模式输入脑电投影层.设脑电输入向量x∈ RC× T, 其中, C=17, T表示0~250 ms时间窗对应的采样点数.本文首先将二维EEG输入按通道展开为一维脑电向量:

$ \overline{\boldsymbol{x}}=\operatorname{vec}(\boldsymbol{x}) \in \mathbf{R}^{c \cdot T} .$

其中vec(· )表示按通道顺序将二维脑电矩阵展开为一维向量.

EEG分支采用全局时空投影结构, 将完整窗口内的跨通道响应统一映射至共享表征空间, 强调跨模态对齐目标下的整体判别模式学习.该结构保持较低的结构先验, 使EEG端以简洁形式学习与视觉教师空间匹配的判别表示.教师侧压缩适配器与双曲插值融合模块负责后续跨模态表征重整.

然后, 通过线性投影得到初始脑电表征:

$ \boldsymbol{u}_{e}=\boldsymbol{W}_{e} \overline{\boldsymbol{x}}+\boldsymbol{b}_{e} .$

其中, We表示脑电线性投影层的权重矩阵, be表示对应的偏置向量.

为了增强脑电表征的非线性建模能力, CHIF在初始投影后引入残差前馈映射, 并结合随机失活与层归一化, 得到脑电基础表征:

ze=LayerNorm(ue+Drop(re))∈ Rd,

其中,

re=We, 2ϕ (We, 1ue+be, 1)+be, 2,

表示残差前馈映射结果, We, 1We, 2表示残差前馈映射的权重矩阵, be, 1be, 2表示对应的偏置向量, ϕ (· )表示GeLU非线性函数, LayerNorm(· )表示层归一化, Drop(· )表示随机失活, d表示脑电表征与视觉教师表征共同采用的共享表征维度, 与后续视觉教师目标的共享表征维度保持一致.

在训练过程中, CLIP(Contrastive Language-Image Pre-training)图像编码器参数保持冻结, 压缩适配器、融合系数预测模块、曲率参数及EEG投影层参与训练.其中, 融合系数预测模块根据结构增强分支的视觉表征预测样本级融合系数t, 并据此动态调节外观, 保持分支在统一教师目标中的融合占比.视觉侧模块仅接收图像特征输入, 用于生成与EEG表征对齐的视觉教师目标.得到ze后, 进一步构造与其对齐的视觉教师表征.

2.2 教师侧压缩适配器

预训练CLIP图像编码器能提供丰富的视觉表征, 但输出特征主要面向通用视觉任务, 包含一定与EEG-图像对齐无关的冗余信息.为此, CHIF在冻结CLIP图像编码器的基础上构建结构增强分支和外观保持分支, 并分别引入教师侧压缩适配器, 对两类视觉特征进行筛选与重整, 生成更适合指导EEG表征学习的视觉教师目标.

两路视觉特征均来自预训练CLIP ResNet-50图像编码器, 原始视觉特征维度记为dv.二者区别在于输入图像的预处理方式.结构增强分支对图像施加注视区模糊(Fovea Blur), 突出图像主体及其全局结构线索[12]; 外观保持分支对图像施加轻度均匀高斯模糊, 保留颜色分布、整体轮廓与粗粒度外观统计.经过两次独立前向推理, 得到结构增强分支输出的原始视觉特征$ \boldsymbol{v}_{s} \in \mathbf{R}^{d_{v}}$与外观保持分支输出的原始视觉特征$ \boldsymbol{v}_{p} \in \mathbf{R}^{d_{v}}$.

对于结构增强分支, CHIF先对原始语义特征执行L2归一化, 得到相应结构增强特征:

$ \overline{\boldsymbol{v}}_{s}=\frac{\boldsymbol{v}_{s}}{\left\|\boldsymbol{v}_{s}\right\|_{2}}, $

其中‖ · ‖ 2表示L2范数.再将其输入语义压缩适配器, 得到适配后的结构增强教师表征:

$ \widetilde{\boldsymbol{v}}_{s}=\operatorname{LayerNorm}\left(\operatorname{Drop}\left(\boldsymbol{W}_{s, 2} \boldsymbol{h}_{s}^{(2)}+\boldsymbol{b}_{s, 2}\right)\right) \in \mathbf{R}^{d}, $

其中,

$ \boldsymbol{h}_{s}^{(2)}=\phi\left(\boldsymbol{h}_{s}^{(1)}\right), $

表示经GeLU激活后的中间特征,

$ \boldsymbol{h}_{s}^{(1)}=\boldsymbol{W}_{s, 1} \overline{\boldsymbol{v}}_{s}+\boldsymbol{b}_{s, 1}, $

表示降维线性映射后的中间特征, Ws, 1Ws, 2表示语义压缩适配器两层映射的权重矩阵, bs, 1bs, 2表示对应的偏置向量.适配器先将特征压缩至瓶颈维度db, 再回投至共享维度d.

对于外观保持分支, CHIF不进行L2归一化, 而是直接将原始感知特征输入对应的感知压缩适配器, 得到适配后的外观保持教师表征:

$ \widetilde{\boldsymbol{v}}_{p}=\operatorname{LayerNorm}\left(\operatorname{Drop}\left(\boldsymbol{W}_{p, 2} \boldsymbol{h}_{p}^{(2)}+\boldsymbol{b}_{p, 2}\right)\right) \in \mathbf{R}^{d}, $

其中,

$ \boldsymbol{h}_{p}^{(2)}=\phi\left(\boldsymbol{h}_{p}^{(1)}\right), $

表示经GeLU激活后的中间特征,

$ \boldsymbol{h}_{p}^{(1)}=\boldsymbol{W}_{p, 1} \boldsymbol{v}_{p}+\boldsymbol{b}_{p, 1}, $

表示降维线性映射后的中间特征, Wp, 1Wp, 2表示感知压缩适配器两层映射的权重矩阵, bp, 1bp, 2表示对应的偏置向量.

外观保持分支在进入适配器前不进行L2归一化, 使原始视觉特征中的幅值差异能参与适配器的非线性变换, 再通过LayerNorm稳定输出分布, 避免不同样本间尺度波动对后续融合造成过强影响.

两个分支在进入双曲空间前提供互补的视觉证据, 指导EEG表征的跨模态对齐:结构增强分支侧重图像主体、轮廓和全局结构线索; 外观保持分支补充颜色分布、粗粒度纹理和外观统计信息.

2.3 双曲插值融合模块

脑电图像检索中的类别关系具有层次性, 语义线索与感知线索又对应不同粒度的视觉证据.若直接在欧氏空间中对两路表征进行线性加权, 融合结果可能偏离原有结构, 难以保持类别间的层级关系.为此, CHIF设计双曲插值融合模块, 将脑侧表征与两路教师表征统一映射至双曲空间, 并在双曲流形上通过测地线插值构造统一教师目标.

本文采用洛伦兹模型表示双曲空间.给定可学习曲率参数c> 0, 曲率为-cd维洛伦兹双曲空间定义如下:

$ H_{c}^{d}=\left\{\hat{\boldsymbol{x}} \in \mathbf{R}^{d+1}:\langle\hat{\boldsymbol{x}}, \hat{\boldsymbol{x}}\rangle_{L}=-\frac{1}{c}, \hat{x}_{0}> 0\right\}, $

其中, $ \hat{\boldsymbol{x}}=\left(\hat{x}_{0}, \boldsymbol{x}_{1: d}\right)$表示双曲空间中的点, $ \hat{x}_{0} $表示时间分量, x1:d表示空间分量, c在训练过程中通过正值约束保证取值大于0.

洛伦兹内积定义为

$ \langle\hat{\boldsymbol{x}}, \hat{\boldsymbol{y}}\rangle_{L}=-x_{0} y_{0}+\boldsymbol{x}_{1: d}^{\mathrm{T}} \boldsymbol{y}_{1: d}, $

其中, $ \hat{\boldsymbol{y}}=\left(\hat{y}_{0}, \boldsymbol{y}_{1: d}\right)$表示另一双曲空间点, < · , · > 表示洛伦兹内积.

对于任意欧氏表征ξ ∈ Rd, CHIF将其视为洛伦兹原点切空间中的切向量[0, ξ ], 记

$ \boldsymbol{o}=\left[\frac{1}{\sqrt{c}}, 0, \cdots, 0\right]$

表示洛伦兹原点, 则以o为基点, 曲率参数为c的指数映射为:

$ \begin{array}{l} \operatorname{Exp}_{o}^{c}([0, \boldsymbol{\xi}])= \\ \quad\left[\frac{1}{\sqrt{c}} \cosh \left(\sqrt{c}\|\boldsymbol{\xi}\|_{2}\right), \frac{\sinh \left(\sqrt{c}\|\boldsymbol{\xi}\|_{2}\right)}{\sqrt{c}\|\boldsymbol{\xi}\|_{2}} \boldsymbol{\xi}\right] \cdot \end{array}$

当‖ ξ 2=0时, 空间项按其极限值处理.

由此脑电表征、结构增强教师表征和外观保持教师表征分别映射为

$ \begin{array}{l} \hat{\boldsymbol{h}}_{e}=\operatorname{Exp}_{o}^{c}\left(\left[0, z_{e}\right]\right), \hat{\boldsymbol{h}}_{s}=\operatorname{Exp}_{o}^{c}\left(\left[0, \widetilde{\boldsymbol{v}}_{s}\right]\right), \\ \hat{\boldsymbol{h}}_{p}=\operatorname{Exp}_{o}^{c}\left(\left[0, \widetilde{\boldsymbol{v}}_{p}\right]\right) . \end{array}$

在教师表征融合阶段, CHIF先由结构增强侧表征通过融合系数预测模块生成样本级门控权重, 即当前样本中外观保持分支的融合占比系数为:

$ t=\sigma\left(\boldsymbol{w}_{g}^{\mathrm{T}} \widetilde{\boldsymbol{v}}_{s}+b_{g}\right) \in(0, 1), $

其中, wg∈ Rd表示融合系数预测线性层的权重向量, bg∈ R表示对应的偏置项.

结构增强侧表征作为结构基准, 决定当前样本需要引入多少外观补充信息.然后, 在洛伦兹空间中沿语义端点$ \hat{\boldsymbol{h}}_{s}$与感知端点$ \hat{\boldsymbol{h}}_{p}$之间的测地线进行插值.设二者之间的测地距离参数为

$ \nu=\operatorname{arcosh}\left(-c\left\langle\hat{\boldsymbol{h}}_{s}, \hat{\boldsymbol{h}}_{p}\right\rangle_{L}\right), $

则统一教师目标为:

$ \hat{\boldsymbol{h}}_{t}=\left(\frac{\sinh ((1-t) \nu)}{\sinh (\nu)}\right) \hat{\boldsymbol{h}}_{s}+\left(\frac{\sinh (t \nu)}{\sinh (\nu)}\right) \hat{\boldsymbol{h}}_{p} .$

在实际应用中, 为了保证数值稳定, 对arcosh(· )的输入进行下界截断, 并在ν 接近0时直接令$ \hat{\boldsymbol{h}}_{t}=\hat{\boldsymbol{h}}_{s}$.插值后对$ \hat{\boldsymbol{h}}_{t}$重新进行洛伦兹归一化, 修正浮点误差导致的流形偏移.由定义可知, 融合占比系数t动态调节融合偏好:t越大, 教师目标引入的外观特征越多.相比欧氏加权, 测地线插值不仅保证融合过程始终受到双曲流形约束, 还有效保留异质视觉证据的层级几何结构, 输出的统一目标$ \hat{\boldsymbol{h}}_{t}$也直接用于后续与脑侧表征$ \hat{\boldsymbol{h}}_{e}$的跨模态对齐.

2.4 目标对齐与训练机制

CHIF以脑侧双曲表征与教师双曲表征之间的匹配关系作为训练依据.定义第i个脑电样本的双曲表征$ \hat{\boldsymbol{h}}_{e}^{i}$和第j个图像样本的教师双曲表征$ \hat{\boldsymbol{h}}_{t}^{j}$, 则二者之间的双曲距离为:

$d_{H}\left(\hat{\boldsymbol{h}}_{e}^{i}, \hat{\boldsymbol{h}}_{t}^{j}\right)=\frac{1}{\sqrt{c}} \operatorname{arcosh}\left(-c\left\langle\hat{\boldsymbol{h}}_{e}^{i}, \hat{\boldsymbol{h}}_{t}^{j}\right\rangle_{L}\right) .$

具体实现时对arcosh(· )的输入进行下界截断, 保证数值稳定.距离越小表示匹配越强, 由此得到批内脑电样本与图像样本之间的匹配得分矩阵Shyp, 相应第i行、第j列元素

$S_{i j}^{\mathrm{hyp}}=-\tau d_{H}\left(\hat{\boldsymbol{h}}_{e}^{i}, \hat{\boldsymbol{h}}_{t}^{j}\right), $

其中, τ > 0表示可学习尺度参数, 调节双曲距离到匹配得分的映射强度.

在此基础上, CHIF采用双向对比损失

$L_{\text {hyp }}=\frac{1}{2}\left[C E\left(\boldsymbol{S}^{\text {hyp }}, \boldsymbol{y}\right)+C E\left(\left(\boldsymbol{S}^{\text {hyp }}\right)^{\mathrm{T}}, \boldsymbol{y}\right)\right]$

完成训练, 其中, CE(· )表示交叉熵损失, y表示批内配对标签.

默认第i个EEG样本与第i个图像样本构成正样本对.该目标包含两个互补的检索视角:CE(Shyp, y)沿行施加Softmax处理, 以每个脑电样本为查询寻找对应图像; CE((Shyp)T, y)沿列施加Softmax处理, 以每幅图像为查询寻找对应脑电特征.联合优化两个方向可保证EEG到图像与图像到EEG检索视角的一致性.对比学习中的负样本来自当前批次内其余不匹配的样本对.

在测试阶段, 对每个脑电样本经投影层与双曲映射得到$\hat{\boldsymbol{h}}_{e}$.同时, 候选图像库中的每幅图像经两路视觉分支、压缩适配与双曲插值后, 离线预计算得到教师表征$\hat{\boldsymbol{h}}_{t}$.然后逐一计算脑侧表征与所有候选教师表征之间的双曲距离dH, 并按距离升序排列, 取Top-5作为最终检索结果.

3 实验及结果分析
3.1 实验设置

实验在标准的10名被试EEG-图像检索数据集[4]上进行.每名被试观看来自共享图像池的视觉刺激, 同时记录EEG信号.检索任务如下:根据测试阶段的EEG查询, 从候选图像集合中检索被试实际观看的图像.

本文采用Top-1、Top-5检索准确率作为核心指标, 分别衡量首名检索正确与前五名检索正确的比例.

本文保留17个后部视觉相关EEG通道作为方法输入, 通道主要位于枕叶O区与顶叶P区, 包括O1、Oz、O2、PO7、PO3、POz、PO4、PO8、P7、P5、P3、P1、Pz、P2、P4、P6和P8.时间窗设为0~250 ms完整窗口.方法不进行子窗口划分或时频变换, 而是将保留通道与完整时间窗按通道和时间维展平后输入全局时空投影分支.默认EEG分支由线性投影、两层残差前馈和LayerNorm组成, 并采用GeLU非线性激活和Dropout随机失活.该设置用于在较少额外结构先验下学习EEG信号中的整体判别模式, 并与后续视觉教师侧压缩适配器和双曲插值融合模块配合完成跨模态对齐.

使用AdamW(Adaptive Moment Estimation with Weight Decay)优化器.EEG投影层、压缩适配器与融合系数预测模块的学习率设为3× 10-4, 几何插值融合模块的学习率设为1× 10-4, 权重衰减系数设为1× 10-4.训练批次设为1 024、验证批次和测试批次设为200, 训练50个轮次.视觉骨干网络默认采用CLIP ResNet-50, 图像特征维度为1 024.

在训练过程中, CLIP图像编码器参数保持冻结, EEG投影层、结构增强分支与外观保持分支中的压缩适配器、融合系数预测模块及双曲空间曲率参数共同参与优化.训练目标采用对称双曲对比交叉熵.

3.2 对比实验

本文选择如下脑电-图像检索领域的多项代表性方法作为对比方法.1)NICE(Natural Image Con- trast EEG)[6].采用自监督对比学习, 实现自然图像的EEG解码.2)BraVL[7].通过脑、视觉和语言三模态特征学习进行视觉神经表征解码.3)Cognition- Capturer[11].利用多模态信息增强EEG表征学习.4)UBP(Uncertainty-Aware Blur Prior)[12].通过不确定性感知模糊先验缓解视觉-脑信号差异.5)ATS(Adaptive Teaching System)[13].通过自适应教师机制进行非对称EEG-视觉对齐.6)ATM(Adaptive Thinking Mapper)[17].将EEG表征映射至CLIP共享空间, 结合扩散模型, 用于视觉解码与重建.7)HyFI(Hyperbolic Feature Interpolation)[21].基于双曲特征插值的脑-视觉对齐方法.8)NeuroCLIP(Brain-Inspired Prompt Tuning for EEG-to-Image Multimodal Contrastive Learning)[22].引入面向EEG-图像对齐的提示调优.9)MindAlign[23].关注EEG、视觉和语言之间的零样本对齐.10)CognitionCapturerPro[24].进一步面向EEG/MEG的高保真视觉解码, 进行多模态与非对称对齐.

各方法在10名被试上的检索准确率如表1所示.在表中, CHIF与HyFI为重复实验均值, 其余结果引自原文献, 黑体数字表示最优值, 斜体数字表示次优值.

表1 各方法在10名被试上的检索准确率对比 Table 1 Comparison of retrieval accuracy among different methods on 10 subjects %

表1可见, CHIF在10名被试上取得68.06%的平均Top-1检索准确率和92.47%的平均Top-5检索准确率.相比HyFI, 两者的平均Top-1检索准确率基本持平, CHIF的平均Top-5检索准确率略高, 二者整体处于相近水平.

为了检验CHIF与HyFI在整体检索性能上的差异, 基于重复实验结果, 并以10名被试作为配对样本, 分别对Top-1与Top-5结果进行配对样本t检验, 相应统计结果如表2所示.在表中, 平均差异为CHIF平均检测准确率减去HyFI平均检测准确率的值, t(df=9)表示配对t检验统计量及自由度, p表示显著性水平.由表可见, CHIF与HyFI在整体Top-1与Top-5指标上的平均差异均未达到统计显著性:Top-1指标上的平均差异为-0.04%, Top-5指标上的平均差异为0.56%.配对检验结果表明, CHIF与HyFI在整体检索性能上处于相近水平.

表2 CHIF与HyFI的配对t检验结果 Table 2 Paired t-test results of CHIF and HyFI
3.3 消融实验

为了验证性能增益的来源, 对CHIF进行模块分解, 包含4种配置:Baseline(移除教师侧压缩适配器和双曲插值融合模块后的CHIF)、仅加入压缩适配器、仅引入双曲插值融合模块、CHIF, 具体检索准确率如表3所示, 表中黑体数字表示最优值, 斜体数字表示次优值.

表3 各模块在10名被试上的检索准确率对比 Table 3 Comparison of retrieval accuracy among different modules on 10 subjects %

表3可见, 各模块均能带来独立的性能增益, CHIF在Top-1、Top-5指标上均取得最优值.Baseline的平均Top-1检索准确率为51.05%, 平均Top-5检索准确率为81.40%.加入压缩适配器后两项指标提升至59.45%和85.95%, 表明将视觉教师压缩至与EEG表征匹配的容量可带来独立的性能增益.仅使用双曲插值融合模块时, 平均Top-1检索准确率为61.00%、平均Top-5检索准确率为82.00%, 说明双曲几何先验同样能独立提升检索性能.CHIF的相应指标值分别达到68.30%和92.15%, 优于两个单独模块配置.

不同EEG分支结构的性能对比如表4所示.该数据可分析脑电投影层在当前输入中的适配性.除了EEG分支结构以外, 其余训练协议与视觉教师设置保持一致.

表4 各EEG分支结构的检索准确率对比 Table 4 Comparison of retrieval accuracy among different EEG branch structures %

表4可见, 在相同设置下, 默认全局时空投影分支取得68.30%的Top-1检索准确率和92.15%的Top-5检索准确率, 分别高于时序-空间卷积EEG分支的51.45%和82.75%.时序-空间卷积EEG分支采用时间卷积与通道维空间卷积提取局部时序响应和跨通道空间模式, 用作对更强EEG专用结构先验的对照.该结果表明, 在当前17个通道、0~250 ms完整窗口和本文训练协议下, 默认全局时空投影分支与教师侧压缩适配器和双曲插值融合模块形成更好的配合关系.全局时空投影分支将完整窗口作为整体模式进行映射, 有助于学习与视觉教师空间匹配的判别表示.

为了进一步验证模块级性能提升的统计显著性, 在10名被试上, 对各配置的Top-1检索准确率进行配对样本t检验, 结果如表5所示, 表中配对样本t检验的n=10, df=9.由表可见, 所有模块级对比均具有统计显著性(p≤ 0.000 2).具体而言, 相对Baseline, CHIF提升17.25%; 相对加入压缩适配器, CHIF提升8.85%; 相对仅使用双曲插值融合模块, CHIF提升7.30%.此外, 相对Baseline, 仅加入压缩适配器使准确率提升8.40%, 仅使用双曲插值融合模块使准确率提升9.95%.这些结果表明, 压缩适配器与双曲插值融合模块均能独立提升性能, 并在完整模型中形成互补增益.

表5 各模块之间平均Top-1准确率的配对t检验结果 Table 5 Paired t-test results of mean Top-1 accuracy among different modules
3.4 敏感性分析

下面分析CHIF对视觉骨干网络的依赖程度.将默认的CLIP ResNet-50替换为更大规模的CLIP ViT-H-14, 并在除了视觉骨干网络及其对应特征维度适配以外, 保持其余训练设置一致, 具体检索准确率如表6所示.

表6 不同视觉骨干网络在10名被试上的检索准确率对比 Table 6 Comparison of retrieval accuracy among different visual backbone networks on 10 subjects %

表6可见, ViT-H-14变体仅取得39.65%的平均Top-1检索准确率和71.10%的平均Top-5检索准确率, 相比ResNet-50性能出现显著下降.这一结果表明, 视觉骨干网络规模、特征粒度与脑信号对齐效果之间具有任务相关的适配关系.

类似的情况在近期脑信号视觉解码研究中也有出现.例如:UBP在对比多种OpenCLIP视觉编码器时发现ResNet-50在THINGS-EEG检索任务中优于多种ViT系列骨干网络[12]; MindAlign中紧凑嵌入几何可优于更大规模的视觉骨干网络[23].这些现象表明, 脑电信号到视觉表征的对齐质量不仅受视觉编码器规模的影响, 也与视觉特征空间的粒度、分布和几何结构密切相关.

从机制上看, ViT-H-14的性能下降可能是因为如下3个方面.1)ResNet-50输出更接近全局图像向量, 可能更符合EEG信号中较粗粒度的视觉语义线索; ViT-H-14的表示更依赖块或词元级结构, 直接聚合后与EEG的整体语义表征之间可能存在粒度差异.2)当前压缩适配器的瓶颈比率、输出维度和归一化方式主要是在ResNet-50特征分布下形成有效配置, 替换成ViT-H-14后, 特征尺度、分布和冗余结构变化可能削弱既有配置的适配性.3)双曲插值融合模块依赖语义端点和感知端点在目标特征空间中的几何关系, ResNet-50的语义空间可能与当前双曲映射及门控插值形成更稳定的协同关系, 而ViT-H-14的特征空间需要重新评估融合权重、曲率和适配器容量.

当前实验主要验证CHIF在CLIP ResNet-50骨干网络下的适配效果, 跨视觉骨干网络的稳定适配仍需更系统的研究.后续可从骨干特异性适配器、视觉特征层选择、词元聚合方式及跨骨干超参数重调等方向进一步进行探索.

为了分析压缩适配器中容量设置对EEG-图像检索性能的影响, 考察不同输出维度与瓶颈比率组合下的平均Top-1检索准确率, 设置输出维度为256, 512, 768, 1 024, 瓶颈比率为1/8, 1/4, 1/2, 1/1, 相应结果如图2所示.由图可见, 无瓶颈配置(瓶颈比率为1/1)在输出维度增大时性能明显下降, 说明直接保留完整教师表征容量并不利于EEG表征对齐.相比之下, 适度压缩配置在高维度下表现更稳定, 其中瓶颈比率为1/4或1/2时, 在1 024维附近取得最优值或近最优值.该结果表明, 压缩适配器的性能收益主要来自输出维度与瓶颈比率之间的容量匹配.

图2 压缩适配器的容量敏感性分析Fig.2 Capacity sensitivity analysis of compression adapter

总之, 压缩适配器的设计是一个面向EEG信号容量约束的表征压缩问题.合适的瓶颈结构能抑制过高容量的视觉教师表征带来的对齐困难, 并为CHIF的默认超参数设置提供经验依据.

3.5 泛化性分析

为了进一步评估CHIF在未见被试和不同神经记录数据上的表现, 设计跨被试验证和THINGS-MEG验证.

跨被试验证采用留一被试设置, 每次将1名被试作为测试被试, 其余9名被试作为训练被试, 逐被试的检索准确率如表7所示.

表7 跨被试验证中逐被试的检索准确率对比 Table 7 Comparison of subject-wise retrieval accuracy in cross-subject validation %

表7可见, CHIF的平均Top-1检索准确率为11.05%、平均Top-5检索准确率为30.60%, 明显低于被试内主结果(表1中平均检索准确率), 说明跨被试泛化性仍然有限.该结果仍高于200路检索的随机水平(Top-1检索准确率为0.50%, Top-5检索准确率为2.50%).

THINGS-MEG验证采用4名被试的MEG数据, 输入为271通道、0~201 ms时间窗, 并使用ResNet-50视觉骨干网络进行被试内检索验证, 相应检索准确率如表8所示.由表可见, CHIF在THINGS-MEG上取得28.12%的平均Top-1检索准确率和55.00%的平均Top-5检索准确率, 其中不同被试的Top-1范围为14.00%~50.50%, 说明该跨数据集与跨神经记录模态验证仍存在明显个体差异.

表8 THINGS-MEG验证中逐被试的检索准确率对比 Table 8 Comparison of subject-wise retrieval accuracy in THINGS-MEG validation %
3.6 可视化分析

为了进一步验证CHIF学习的EEG表征是否具有可解释的语义结构, 对测试集上不同概念的EEG表征进行余弦相似度计算, 并将概念按照动物、食物、车辆、工具、其它这5个语义类别重新排列, 跨被试EEG表征相似性矩阵如图3所示.

图3 跨被试平均的EEG表征相似性矩阵Fig.3 Cross-subject average EEG representation similarity matrix

由图3可见, 矩阵呈现较明显的块状结构, 说明同一语义类别内的EEG表征具有更高的相似性.

部分测试样本的Top-1~Top-5检索结果如图4所示.

图4 部分测试样本的图像检索结果Fig.4 Image retrieval results for selected test samples

由图4可看到, CHIF在多个样例中能将原始图像检索为Top-1, 表明其学习的EEG表征能支持实例级图像匹配.同时, 部分非Top-1候选结果仍与原始图像保持一定的语义或视觉相关性.

图5进一步展示不同被试的EEG表征相似性矩阵.由图可看到, 该结构在多数被试上呈现出相似趋势, 说明CHIF学习的表征具有一定的跨被试一致性.

图5 不同被试的EEG表征相似性矩阵Fig.5 EEG representation similarity matrices for different subjects

上述结果说明, CHIF不仅提升定量检索性能, 也学习具有语义组织性的EEG-图像跨模态表征.

为了进一步理解CHIF在错检样本中的表现边界, 图6展示若干代表性失败样本及其前5个检索结果.以蜻蜓样本为例, CHIF返回的前两名候选结果包含明显的绿色植物和自然背景, 说明在昆虫主体响应较弱时, 检索结果容易受到背景颜色和局部形态线索的影响.对于锤子样本, CHIF返回锅铲等具有细长手柄和工具属性的候选结果; 对于低音管样本, 检索出现瑞士军刀、冰棍等细长或条状物体.由此表明CHIF在部分样本上能保留形状或材质等相关线索, 但这些局部线索可能引导检索结果偏离真实语义类别.旅行车样本的前5个候选结果与真实类别差异更大, 说明当单试次EEG信号中的类别相关信息较弱, 或候选集上存在干扰性较强的图像时, 可能产生较明显的语义偏移.

图6 错误样本的代表性检索结果Fig.6 Representative retrieval results for failed retrieval samples

这些现象反映出CHIF的若干边界.首先, 单试次EEG信号信噪比较低, 瞬时注意波动可能削弱与目标类别相关的神经响应, 使方法更多依赖颜色、轮廓或背景等较粗粒度线索.其次, 不同被试的视觉诱发响应和信号质量存在差异, 同类视觉刺激在不同被试上的可分性可能不同.再次, 视觉候选图像之间的外观相似性、局部形状相似性或背景相似性也会增加闭集检索难度.因此, CHIF在当前200选1检索协议下能取得有效匹配结果, 但在开放集识别、强视觉干扰和跨被试稳定泛化场景中仍需进一步提升鲁棒性.

3.7 几何行为分析

为了进一步分析CHIF中双曲插值融合模块的作用, 对不同表征在根节点距离上的分布及融合占比系数t的变化进行可视化分析.图7对比原始CLIP空间与双曲空间中的根节点距离分布.

图7 不同表征在两个空间中的根节点距离分布Fig.7 Distribution of distances to root node for different representations in 2 spaces

由图7可看到, 经过双曲映射后, 不同来源的表征在径向距离上呈现更清晰的层次化差异:融合教师表征更靠近根节点, 语义表征与感知表征位于中间区域, 脑电表征分布在相对外层区域.这表明双曲插值融合模块能将不同来源的表征重组到具有径向层次差异的空间结构中.

图8为融合占比系数t的分布及其对应示例.

图8 t的分布及High-t与Low-t样本示例Fig.8 Distribution of t and high-t and low-t samples

由图8可看到, t在一定范围内形成有偏分布, 说明CHIF能根据输入样本动态调整语义教师与感知教师之间的融合比例.

从示例来看, t值较高的样本通常具有更明显的材质、形状或局部视觉线索, 而t值较低的样本更多对应语义类别较清晰的对象.上述结果说明, CHIF的双曲插值融合模块不仅引入层次化的表征空间, 也实现样本相关的自适应教师融合.

4 结束语

本文面向零样本脑电图像检索任务, 提出压缩引导双曲插值融合的视觉神经解码方法(CHIF).首先, 在结构增强分支和外观保持分支分别引入教师侧压缩适配器, 缓解高维视觉特征与低信噪比EEG表征之间的模态差异.然后, 设计双曲插值融合模块, 在双曲空间中采用测地线插值, 构造统一教师目标, 实现语义结构信息与外观感知信息的层次化融合.实验表明, CHIF在10名被试EEG-图像检索数据集上取得有效检索结果.在整体Top-1、Top-5指标上与HyFI处于相近水平.模块级消融实验进一步表明, 压缩适配器和双曲插值融合模块均能提升方法性能, 并在完整框架中形成互补作用.进一步实验也揭示CHIF的适用边界.跨被试验证结果低于被试内主实验结果, 说明CHIF在未见被试上的泛化能力仍需提升.THINGS-MEG验证结果表明, CHIF在不同神经记录数据上具有一定的检索能力, 但不同被试之间仍存在明显差异.视觉骨干网络敏感性分析说明, CHIF性能与视觉特征空间之间存在任务相关的适配关系.未来工作将围绕更强的EEG时空建模结构、骨干网络特异性视觉适配、视觉特征层选择及跨被试和跨数据集泛化能力改进展开, 进一步提升视觉神经解码方法的稳定性和适用性.

本文责任编委 兰旭光

Recommended by Associate Editor LAN Xuguang

参考文献
[1] DICARLO J J, ZOCCOLAN D, RUST N C. How Does the Brain Solve Visual Object Recognition? Neuron, 2012, 73(3): 415-434. [本文引用:1]
[2] 黄凯奇, 谭铁牛. 视觉认知计算模型综述. 模式识别与人工智能, 2013, 26(10): 951-958.
(HUANG K Q, TAN T N. Review on Computational Model for Vision. Pattern Recognition and Artificial Intelligence, 2013, 26(10): 951-958.) [本文引用:1]
[3] KAY K N, NASELARIS T, PRENGER R J, et al. Identifying Na-tural Images from Human Brain Activity. Nature, 2008, 452(7185): 352-355. [本文引用:1]
[4] GIFFORD A T, DWIVEDI K, ROIG G, et al. A Large and Rich EEG Dataset for Modeling Human Visual Object Recognition. NeuroImage, 2022, 264. DOI: 10.1016/j.neuroimage.2022.119754. [本文引用:3]
[5] 《脑机接口关键科学问题、关键核心技术及其布局研究》项目组. 脑机接口技术发展现状及未来展望. 科学与社会, 2024, 14(3): 2-25.
(Project Team for the "Study of Key Scientific Issues, Key Core Technologies and Their Layout for Brain-Computer Interfaces". Brain-Computer Interface Technology: Current Development Status and Future Outlook. Science and Society, 2024, 14(3): 2-25.) [本文引用:1]
[6] SONG Y H, LIU B C, LI X, et al. Decoding Natural Images from EEG for Object Recognition[C/OL]. [2026-04-16]. https://arxiv.org/pdf/2308.13234. [本文引用:3]
[7] DU C D, FU K C, LI J P, et al. Decoding Visual Neural Representations by Multimodal Learning of Brain-Visual-Linguistic Features. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, 45(9): 10760-10777. [本文引用:4]
[8] SRINIVASAN R, WINTER W R, DING J, et al. EEG and MEG Coherence: Measures of Functional Connectivity at Distinct Spatial Scales of Neocortical Dynamics. Journal of Neuroscience Methods, 2007, 166(1): 41-52. [本文引用:2]
[9] LAWHERN V J, SOLON A J, WAYTOWICH N R, et al. EEGNet: A Compact Convolutional Neural Network for EEG-Based Brain-Computer Interfaces. Journal of Neural Engineering, 2018, 15(5). DOI: 10.1088/1741-2552/aace8c. [本文引用:2]
[10] WEI Y Y, CAO L, LI H, et al. MB2C: Multimodal Bidirectional Cycle Consistency for Learning Robust Visual Neural Representations // Proc of the 32nd ACM International Conference on Multimedia. New York, USA: ACM, 2024: 8992-9000. [本文引用:4]
[11] ZHANG K F, HE L H, JIANG X, et al. CognitionCapturer: Decoding Visual Stimuli from Human EEG Signal with Multimodal Information. Proceedings of the AAAI Conference on Artificial Intelligence, 2025, 39(13): 14486-14493. [本文引用:5]
[12] WU H T, LI Q, ZHANG C Q, et al. Bridging the Vision-Brain Gap with an Uncertainty-Aware Blur Prior // Proc of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2025: 2246-2257. [本文引用:6]
[13] WU L K, LI J, REN Z Q, et al. Shrinking the Teacher: An Adaptive Teaching Paradigm for Asymmetric EEG-Vision Alignment. Proceedings of the AAAI Conference on Artificial Intelligence, 2026, 40(21): 17859-17867. [本文引用:4]
[14] GAO P, GENG S J, ZHANG R R, et al. CLIP-Adapter: Better Vision-Language Models with Feature Adapters. International Journal of Computer Vision, 2024, 132(2): 581-595. [本文引用:3]
[15] 曹洪涛, 钟子平, 陈远方, . 非侵入式脑机接口控制策略的研究进展. 生物医学工程学杂志, 2022, 39(5): 1033-1040.
(CAO H T, JUNG T P, CHEN Y F, et al. Research Advances in Non-invasive Brain-Computer Interface Control Strategies. Journal of Biomedical Engineering, 2022, 39(5): 1033-1040.) [本文引用:1]
[16] 孟明, 罗志增. 基于眼动辅助脑电信号的手部动作分类方法. 模式识别与人工智能, 2012, 25(6): 1007-1012.
(MENG M, LUO Z Z. Hand Motion Classification Based on Eye-Moving Assisted EEG. Pattern Recognition and Artificial Intelligence, 2012, 25(6): 1007-1012.) [本文引用:1]
[17] LI D Y, WEI C, LI S Y, et al. Visual Decoding and Reconstruction via EEG Embeddings with Guided Diffusion // Proc of the 38th International Conference on Neural Information Processing Systems. Cambridge, USA: The MIT Press, 2024: 102822-102864. [本文引用:2]
[18] JIA M L, TANG L M, CHEN B C, et al. Visual Prompt Tuning // Proc of the 17th European Conference on Computer Vision. Berlin, Germany: Springer, 2022: 709-727. [本文引用:1]
[19] NICKEL M, KIELA D. Poincaré Embeddings for Learning Hierarchical Representations // Proc of the 31st International Conference on Neural Information Processing Systems. Cambridge, USA: MIT Press, 2017: 6341-6350. [本文引用:1]
[20] DESAI K, NICKEL M, RAJPUROHIT T, et al. Hyperbolic Image-Text Representations // Proc of the 40th International Conference on Machine Learning. San Diego, USA: JMLR: 7694-7731. [本文引用:1]
[21] JO S, JEONG W, HEO D W, et al. HyFI: Hyperbolic Feature Interpolation for Brain-Vision Alignment. Proceedings of the AAAI Conference on Artificial Intelligence, 2026, 40(7): 5575-5583. [本文引用:2]
[22] WANG J Y, ZHANG L, LIN H P, et al. NeuroCLIP: Brain-Inspired Prompt Tuning for EEG-to-Image Multimodal Contrastive Learning[C/OL]. [2026-04-16]. https://arxiv.org/pdf/2511.09250. [本文引用:1]
[23] CHEN Z X, LIU S C, LU R H, et al. MindAlign: Bridging EEG, Vision, and Language for Zero-Shot Visual Decoding[C/OL]. [2026-04-16]. https://arxiv.org/pdf/2605.24523. [本文引用:2]
[24] ZHANG K F, HE L H, KE J J, et al. CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment[C/OL]. [2026-04-16]. https://arxiv.org/pdf/2603.12722. [本文引用:1]