
李金海,博士,教授,主要研究方向为认知计算、粒计算、大数据分析、概念格、粗糙集.E-mail:jhlixjtu@163.com.
作者简介:

刘锶怡,博士研究生,主要研究方向为脑机接口、多模态融合、概念格.E-mail:liusiyiyi0201@163.com.

施水玲,博士研究生,主要研究方向为机器学习、宽度学习系统、计算智能、情感计算和复杂网络.E-mail:shishuiling0409@sina.com.

刘文奇,硕士,教授,主要研究方向为数据治理、脑与认知复杂系统.E-mail:liuwenq2215@sina.com.
第二十八届中国科协年会学术论文
多模态脑机接口的信号融合弱化单一模态在时空分辨率和信噪比上的固有缺陷,提升解码的准确性与鲁棒性,成为提升脑机接口性能的有效方法之一.文中旨在综合现有基于深度学习多模态脑机接口的研究成果,首先,根据模态数据的不同融合策略,系统性地将文献分为数据级融合方法、特征级融合方法、决策级融合方法和混合策略融合方法.然后,结合深度学习模型的特点,细分、解析各融合策略,归纳多模态脑机接口在运动想象与运动康复、认知负荷评估与分类、警觉度监测、情感识别和神经系统疾病的辅助诊断和功能评估等领域的应用场景.最后,总结现阶段信号融合方法及多模态深度学习面临的困难,并对未来研究方向进行探讨和展望.
About Author:
LIU Siyi, Ph.D.candidate. Her research interests include brain-computer interface, multi-modal fusion and concept lattice.
SHI Shuiling, Ph.D.candidate. Her research interests include machine learning, broad learning system, computational intelligence, affective computing and complex networks.
LIU Wenqi, Master, professor. His research interests include data governance, brain and cognitive complex systems.
Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology
The signal fusion of multimodal brain-computer interfaces significantly improves decoding accuracy and robustness by mitigating the inherent drawbacks of a single modality in spatiotemporal resolution and signal-to-noise ratio. It is considered as an effective method for improving the performance of brain-computer interfaces. This paper is intended to synthesize the existing research results of deep learning-based multimodal brain-computer interfaces. First, existing literature is systematically classified into four categories based on different fusion strategies for modal data: data-level fusion, feature-level fusion, decision-level fusion, and hybrid strategy fusion. Then, based on the characteristics of deep learning models, fusion strategies are further subdivided and analyzed. The application scenarios of multimodal brain-computer interfaces are summarized, including the fields of motor imagery and motor rehabilitation, assessment and classification of the cognitive load, vigilance monitoring, emotion recognition,and auxiliary diagnosis and functional evaluation of neurological diseases. Finally, the difficulties faced by current signal fusion methods and multimodal deep learning are summarized. The future research directions are discussed and the future prospects are outlined.
人的大脑是自然界中最复杂的系统之一, 不仅包含约860亿个神经元和百万亿个突触, 更在基因、微电路到宏观脑区等多个尺度上层层耦合.通过这种跨尺度的紧密交织, 最终构建一个具有高度非线性特征和复杂动力学行为的巨型网络系统[1].理解大脑的结构和功能, 是推动新一代人工智能与脑疾病诊治的关键突破口.在一系列尝试中, 脑机接口(Brain-Computer Interface, BCI)技术通过解码大脑产生的神经信号, 在不依赖外周神经与肌肉的情况下, 建立人脑和外部设备之间的直接交互通路[2].作为神经工程与人工智能交叉的前沿领域, 脑机接口技术在医疗康复[3, 4]、智能控制[5, 6, 7]、人机交互[8, 9]等领域展现出巨大的应用潜力.
近年来, 全球主要经济体正加速将脑机接口从基础科研推向产业化落地.我国政府2021年出台《中华人民共和国国民经济和社会发展第十四个五年规划和2035年远景目标纲要》, 该文件将脑科学纳入前沿领域, 实施前瞻性、战略性国家重大科技项目.2025年, 工信部等七部门相继出台《关于推动脑机接口产业创新发展的实施意见》, 制定加强基础软硬件攻关、打造高性能产品、推动技术成果应用、壮大创新主体、提升产业支撑能力和保障措施的六个发力点.
现阶段, 无论技术路线如何演进, 脑机接口面临的根本挑战始终未变:从有限、高维、低信噪比的神经信号中准确、实时、稳健地解码用户意图[10].鉴于单一模态的脑信号采集方法存在固有的局限性, 融合多模态数据, 将具有互补特性的多源信息进行整合, 弱化单一模态缺陷, 是提升解码准确性的有效途径.随着深度学习技术的快速发展, 端到端特征学习与复杂模式识别能力显著提升, 这为多模态脑信号融合提供全新的机遇.
尽管已有大量研究将深度学习应用于多模态脑机接口信号融合, 并取得较优效果, 然而与之匹配的系统性综述滞后[11], 不利于该领域的进一步发展与深入探索.因此, 本文针对多模态脑机接口领域, 结合深度学习网络架构的选择, 如循环神经网络(Recu-rrent Neural Network, RNN)[12]、卷积神经网络(Convolutional Neural Network, CNN)[13]、时序卷积网络(Temporal Convolutional Networks, TCNs)[14]、长短期记忆网络(Long Short-Term Memory, LSTM)[15]、双向长短期记忆网络(Bidirectional Long Short-Term Memory, Bi-LSTM)[16]、门控循环单元(Gated Recu-rrent Unit, GRU)[17]、图卷积网络(Graph Convolu- tional Network, GCN)[18]、图注意力网络(Graph Atten- tion Network, GAT)[19]、异质图卷积网络(Heteroge- neous Graph Convolutional Network, Hete-GCN)[20]、Transformer架构[21]及多种网络架构的混合, 对现有信号融合方法进行分类与研究, 在此基础上, 提出当前研究的技术瓶颈与关键挑战, 归纳基于深度学习的多模态脑机接口的应用场景, 并对未来的研究方向进行展望, 希望以此促进多模态脑机接口领域的快速发展.
脑机接口是一种连接人脑与外部设备(如计算机、轮椅、机器人等)的通信通道, 人们可通过脑电信号直接与外部设备进行交互, 大脑传出的这些信号包含用户的认知状态和意图信息[22].该技术在情绪识别与调节[23]、主动触觉探索[24]、神经康复[25]、机器人设备控制[26]、语音解码与合成[27]、肢体功能恢复[28]、自动驾驶[29]、意识评估[30]等领域具有广泛应用.
根据电极与脑组织的接触方式, 脑机接口可分为3类:非侵入式[31]、部分侵入式[32]和侵入式[33].后两者需要开颅植入传感器, 操作难度较大且风险较高, 而非侵入式脑机接口因其风险较低、易于日常生活使用、方便大量参与者的长期表现跟踪, 更受健康人群青睐.本文主要聚焦于非侵入式脑机接口的研究, 下文提及的脑机接口均表示非侵入式脑机接口.
脑机接口系统通常由信号采集、信号预处理、信号解码与分析、控制执行这4个模块组成.信号采集模块使用外接设备获取脑部信号.信号预处理模块对数据执行去噪、伪迹去除和数据标准化等操作.信号解码与分析模块使用机器学习算法先后进行特征提取与目标任务的实现.控制执行模块充当大脑与外部设备之间的桥梁, 把模型输出的抽象意图转译为外部设备能理解并落实的具体操作[34].
在脑机接口研究中, 常用的生理信号与成像模态各具特色, 核心差异主要体现在时空分辨率和测量的生理现象上.在多模态脑机接口中使用最多的组合模态是脑电图和功能性近红外光谱数据.表1列出17个常见的公开多模态数据集.表2归纳后续内容涉及的生理信号类型, 包括原理、检测对象与特点.
| 表1 多模态数据集 Table 1 Multimodal datasets |
| 表2 常见生理信号类型 Table 2 Common physiological signal categories |
1.2.1 脑电图
脑电图(EEG)通过头戴式电极记录头皮上的脑电活动, 因其操作简便、安全、成本低廉和非侵入式的特点成为脑机接口系统中最常用的输入方式之一, 其非侵入特性也使其可重复使用, 适合长期监测和康复应用[52].此外, 脑机接口系统需要快速检测和解码脑电信号, 以便与外部设备直接通信并执行指令, 而脑电图以其毫秒级的高时间分辨率, 非常适合捕捉大脑活动的快速变化, 实时监测脑部活动, 该特点使脑电图在需要即时响应的应用中发挥关键作用[53].
由于脑电图信号具有高度的复杂性和非平稳性, 需要引入诱发范式以精准获取大脑的特定认知活动.其诱发范式主要包括:事件相关电位(Event-Related Potential, ERP)、稳态视觉诱发电位(Steady-State Visual Evoked Potential, SSVEP)、运动想象(Mo-tor Imagery, MI)、听觉诱发电位(如ASSR(Auditory Steady-State Response)[54])、触觉诱发电位(如SSSEP(Steady-State Somatosensory Evoked Potential)[55]).每种范式通过不同类型的外部刺激或内部刺激诱发特定脑电反应, 在信号强度、抗干扰性和信息传输速率等方面各具优势和应用场景.下面简要介绍脑电图中常用的三种诱发范式.
事件相关电位是指在特定事件或刺激(如视觉、听觉、触觉等)发生时, 大脑皮层产生、并与事件紧密相关的电生理反应, 包括N200[56]、N2pc[57]、P300[58]等.其中, P300在脑机接口中最常见, 指在一组刺激中偶尔出现罕见目标时会诱发清晰的P300波形, 该波形是在刺激后约300 ms时出现的正向波.
稳态视觉诱发电位是一种在视觉刺激以恒定频率闪烁时, 大脑视觉皮层产生与刺激频率一致的稳定振荡电活动.稳态视觉诱发电位信号通常通过脑电图在枕叶区域检测, 表现为与外部视觉刺激频率同步的脑电波成分.稳态视觉诱发电位具有高信噪比、无需大量训练、响应速度快和对部分伪迹的耐受性强的特点[59].刺激方式包括屏幕的闪烁光刺激、二维码刺激、色彩、运动、空间分布等[60].通过检测稳态视觉诱发电位的频率成分可准确判断用户意图, 实现拼写、轮椅控制、虚拟现实互动等功能[61].
运动想象是指在无实际肢体动作时, 主观想象手、脚等肢体运动, 从而引发与真实运动类似的大脑皮层活动.用户想象特定运动任务, 在脑电图中产生特征性的节律变化, 主要表现为感觉运动皮层的μ 节律(8~13 Hz)和β 节律(13~30 Hz)发生事件相关去同步与事件相关同步现象[62].通过对这些时频特征的提取和分类, 运动想象脑机接口系统可实现对外部设备(如机器人、轮椅、假肢等)的意念控制, 并广泛用于神经康复(如卒中后上肢功能恢复)、辅助沟通、智能设备交互等领域[63].
1.2.2 功能性近红外光谱
功能性近红外光谱(fNIRS)是一种无创的光学脑成像技术, 测量近红外光在头皮和脑组织中的吸收与散射, 实时监测大脑皮层区域的血氧动力学变化, 反映神经活动引起的局部血流和血氧浓度变化[64].该项技术成本低、对运动伪迹不敏感, 适合认知、社交、运动和康复等在真实场景中的研究[65].
1.2.3 功能性磁共振成像
功能性磁共振成像(fMRI)是一种非侵入式脑成像技术, 检测脑区血流和血氧水平的动态变化, 间接反映神经元活动, 实现对人脑功能状态的空间和时间定位[66].fMRI利用神经元活动区局部血流增加、去氧血红蛋白下降带来的磁信号变化, 通过最常用的血氧水平依赖成像, 实现毫米级空间分辨率下的大脑功能活动图谱绘制, 具有高空间分辨率、全脑覆盖、无创伤、可重复的优点, 但在信号噪声、运动伪迹、标准化不足等方面面临挑战.fMRI在手术规划、神经疾病、认知、情感、语言和运动等研究中应用广泛[67].
单一模态的脑机接口受限于信号本身的物理特性, 获取的神经信息相对有限, 而多模态信号在时空分辨率、抗噪能力和响应机制上具有天然的互补性.多模态信号融合能为脑机接口解码提供更丰富的信息和鲁棒的特征.本节研究基于深度学习的多模态信号融合方法, 依据融合发生的层级将其分为数据级融合方法、特征级融合方法、决策级融合方法、混合策略融合方法.
数据级融合方法是指在对模态数据特征提取前, 对原始数据简单预处理后进行拼接的方法, 这样的数据融合方式能最大程度保留数据的细节信息, 也是多模态数据进入深度学习模型的最直接方式.
在数据级拼接中, 一类是对齐后直接拼接为向量.Olikkal等[68]提出基于Transformer的深度学习模型, 用于上肢运动分类, 将EEG和EMG数据沿通道维度垂直拼接形成融合数据, 经过分块和位置编码后输入单层Transformer编码器, 利用多头注意力机制捕获跨通道的时空模式, 最终通过全连接层完成分类任务.Ramirez等[69]提出基于LSTM的深度学习网络, 实现对消费者鞋类偏好的分类, 网络将EEG和fNIRS原始信号在输入层直接拼接形成多模态输入向量, 输入三层LSTM网络, 利用LSTM的门控机制隐式建模两种模态在时间维度上的动态关联.另一类先将多模态数据重构为保留空间拓扑结构的图像或类图像张量, 再利用卷积神经网络提取空间特征进行融合学习.Ghonchi等[70]提出深度循环卷积神经网络, 用于运动想象和心算任务, 将EEG和fNIRS信号重采样对齐后, 按电极空间位置转换为三维张量, 张量的两个面分别对应两种波长下的EEG和fNIRS融合数据, 再将滑动窗口切分后的张量先后输入CNN和LSTM网络, 用于后续任务.Chen等[71]提出MCFHNet(Multi-channel Fusion Hybrid Network), 用于多模态运动想象解码, 将EEG、HbO和HbR的空间分布分别编码为空间矩阵并压缩至统一尺寸, 拼接为三通道特征图, 再经深度卷积与通道注意力加权后输入双向LSTM, 完成时序建模.
数据级融合方法的最大优势在于信息保留完整, 能直接从原始信号中学习模态间最底层的互补关系, 但直接在数据级上融合会带来大量的噪声和伪迹, 同时对时间对齐精度要求严格.因此, 纯数据级融合的研究较少, 大量的研究集中于特征级融合或在混合融合框架中将数据级融合作为辅助支撑.
特征级融合方法是当前多模态脑机接口信号融合研究中应用最广泛、成果最丰富的一类方法.与数据级融合方法直接拼接原始信号不同, 特征级融合方法首先对每种模态独立进行特征提取, 获取模态特异性, 再在抽象层级上进行特征交互与整合.这种先分别提取特征再融合的策略有效平衡模态特异性与跨模态协同, 是多模态数据融合的首选方式.根据采用的深度学习架构的不同, 可将现有研究进一步细分为如下5类.
2.2.1 基于CNN的特征级融合方法
CNN是特征级融合中最早被广泛采用、最为基础的深度学习架构.这类方法通常遵循先独立提取, 再拼接, 最后联合决策的流程.根据CNN融合策略的技术特点, 可进一步细分为双分支拼接融合和图像化特征构建的融合方法.
双分支拼接融合是基于CNN的特征级融合方法中最常见的方法之一.它为每种模态设计独立的CNN编码器, 或从各模态中提取手工特征后进行拼接, 再由全连接层实现联合决策.He等[72]提出M2NN(Multimodal Multitask Neural Network), 利用双分支CNN分别提取EEG和fNIRS的时空特征, 将二者拼接后提取高阶特征, 通过多任务学习模块同时完成分类和特征度量学习.Borra等[73]提出基于双分支CNN架构的多模态解码器, 用于抓握动作解码.该模型采用滑动窗口策略, 从连续信号中提取时间片段, 将EEG和EMG片段分别输入基于EEG网络架构的双分支CNN, 针对两个分支的特征图展平拼接后进行实时分类, 模拟在线应用场景.Nour等[74]提出多带宽优化CNN的框架, 用于运动想象分类, 将EEG和HbO、HbR的多个频带信号分别输入独立的1D CNN分支, 进行时序特征提取, 各分支输出的特征向量在拼接层融合后, 经灰狼优化算法优化后输入全连接层进行分类.Jiang等[75]提出DFNN(Dual-Scale Fusion Neural Network), 用于肌肉疲劳状态下手部康复训练动作的识别, 通过多视图融合神经网络提取EMG的多尺度特征, 自适应并行分层神经网络负责提取EEG的分层特征, 将二者拼接后经由全连接层和Softmax函数进行分类.此外, 也有研究是先拼接各模态的手工特征, 再输入CNN中进行深度特征提取.Myrick等[76]提出多模态认知负荷评估框架, 融合EEG、皮肤电导和光电容积脉搏波三种信号, 将多个手工特征拼接后输入CNN进行认知负荷分类, 并采用SHAP(Shapley Additive Explanations)进行特征贡献分析.
图像化特征构建的融合方法将一维时序特征或信号重新组织为二维图像格式, 利用CNN在图像识别领域的技术优势进行多模态联合学习.Kim等[77]提出多模态融合的深度学习方法, 用于前臂截肢患者的手腕和手部运动识别, 先将EEG和EMG信号分别转换为频域图像后沿通道维度拼接, 然后采用迁移学习策略.具体步骤是先用多模态图像预训练CNN, 再冻结浅层, 仅训练顶层, 通过微调, 利用EMG特征增强EEG分类.Saadati等[78]提出基于CNN的混合模态方法, 将EEG和fNIRS信号数据处理后沿通道维度拼接为二维图像, 输入CNN进行分类.另外, 也有只使用单模态信息构建图像的情况.Bunterngchit等[79]提出MDNF(Multimodal DenseNet Fusion), EEG先经短时傅里叶变换转换为2D频谱图像, 再通过密集连接卷积网络变体提取深度特征, fNIRS经卷积处理后与EEG特征在中段拼接, 利用密集连接卷积网络的密集连接机制实现特征的高效复用与深度融合.此外, 可将上述先构建图像再拼接的方法先后顺序交换.Ramirez等[80]提出混合EEG-fNIRS方法, 先将EEG的Alpha和Theta频带功率谱密度特征与fNIRS的HbO和HbR浓度特征拼接, 按“ 时间点× 特征通道” 的方式构建二维灰度图像, 再输入CNN, 进行消费者偏好分类.
另外, 有的研究还系统性探究融合层级对方法性能的影响.Li等[81]提出Y型神经网络, 基于EEG网络架构设计EEG和fNIRS早期融合(在时域卷积之后及深度卷积之前进行拼接)、中期融合(在深度卷积之后及可分离卷积之前进行拼接)和晚期融合(在可分离卷积之后及分类任务之前进行拼接)3种策略, 在左右手运动想象任务中进行对比, 结果表明早期融合性能显著优于中、晚期融合.
尽管基于CNN的特征级融合方法结构简洁、方便实现, 已成为多数研究的基线选择, 但其简单的特征拼接难以建模模态间的时序依赖和非对称交互关系, 因此催生后续基于时序网络和注意力机制的融合方法.
2.2.2 基于LSTM/GRU/TCN的特征级融合方法
CNN在提取局部空间特征方面表现优异, 但在时序建模方面表现不足, 但脑机接口的多模态数据本质上是时间序列.为弥补纯CNN方法的不足以及使模型更适用于多模态数据, 研究者引入RNN变体及CNN变体.在这类方法中, 对于各种模态数据通常先利用CNN提取空间表征, 再进一步送入LSTM、GRU或TCN等学习跨模态的时序特征.
在LSTM路径中, Shelishiyah等[82]提出混合CNN和双向LSTM的深度学习模型, 首先, 利用共空间模式引导的稀疏独立成分分析提取EEG特征, 并将其与 fNIRS 的原始血红蛋白浓度变化特征进行拼接融合, 然后, 将融合特征输入CNN提取空间特征, 再经Bi-LSTM进行时序建模, 最终实现运动任务的分类.Mughal等[83]提出基于递归图的时间分布式卷积神经网络和长短期记忆算法, 引入递归图作为中间表征, 将EEG和fNIRS的递归图经时间分布式CNN提取空间特征后进行拼接, 再通过LSTM学习时序依赖.Zhang等[84]提出多模态车载警觉度估计架构, 将EEG功率谱密度等特征与EOG眼动统计特征进行拼接, 经三层LSTM捕获时序依赖, 再结合胶囊网络(含动态路由算法)实现注意力加权, 用于驾驶员警觉度估计.
GRU作为LSTM的轻量化变体能在保持LSTM性能的同时减少参数量.Cooney等[85]提出双模态深度神经网络架构, 用于外显与想象语音的解码, EEG和fNIRS经由并行卷积子网络处理后, 在后期进行特征拼接, 随后输入GRU和全连接层联合提取时序特征, 在统一训练过程中实现双模态特征的协同学习.
TCN作为CNN的变体, 能弥补CNN处理时序的不足.Gornale等[86]提出混合深度学习框架, 采用双分支TCN-LSTM网络, 分别处理EEG和ECG:TCN提取局部时序特征, LSTM捕获长程依赖, 最后拼接两分支输出特征, 用于多类情感分类.
基于CNN混合架构的方法可有效分离时空关系, 但特征拼接实现的模态间的交互仍是浅层的、静态的, 难以动态评估不同模态在不同时刻的重要性.
2.2.3 基于注意力机制与Transformer的特征级融合方法
随着深度学习研究的深入, 注意力机制和Trans- former架构的引入使特征静态拼接存在的问题得以解决.这类方法通过自注意力和交叉注意力机制, 动态评估不同模态特征在不同时间和通道维度上的重要性, 实现自适应的加权融合.根据注意力机制在融合过程中发挥的功能角色不同, 该问题的研究可细分为如下3类:自注意力通道重标定、跨模态对齐与交互、统一融合与决策.
在自注意力通道重标定中, 注意力作为混合模态内部的一种判别性通道加权机制, 对特征通道或时间维度进行自适应加权, 实现关键信息的增强与冗余信息的抑制.Zhang等[87]提出EEG-fNIRS双模态分类器设计方法.首先, 采用递归图将一维时序信号转换为二维图像特征.然后, 对比多种增强与融合方案并发现, 利用EEG与fNIRS通道的空间邻接关系进行点积运算生成增强特征, 并与原始特征拼接融合后效果最佳.最后, 构建CNN提取空间特征, 应用LSTM捕捉时序依赖, 并引入自注意力机制自适应调整通道权重, 有效实现任务的分类.
在跨模态对齐与交互中, 利用交叉注意力或模态引导机制, 显式实现不同模态之间的信息传递、时域对齐与双向互学习, 捕捉跨模态的互补特征.Zhang等[88]提出多模态运动想象解码网络, 用于EEG-fNIRS信号的五类运动想象分类, 先通过模态特定提取器分别获得EEG与fNIRS特征, 再利用交叉注意力机制实现双向时域特征加权融合, 并联合优化模态内和模态间对比损失.Qiu等[89]提出端到端的互学习融合网络, EEG分支先后经CNN和LSTM提取时序特征, fNIRS分支由Transformer编码器提取空间特征, 再对提取的特征使用并行交叉注意力进行双向互学习, 实现信息交互融合.针对EEG和fNIRS之间天然存在的时间延迟, Faisal等[90]提出STeCANet(Spatio-Temporal Cross Attention Network), 核心模块包含fNIRS引导的空间注意力子模块、EEG-fNIRS时序对齐子模块、自适应跨模态融合子模块, 通过域对抗训练增强跨会话和跨被试的鲁棒性.Cheng等[91]提出VigilanceNet, EEG由Transfor- mer编码, EOG经外积嵌入后输入CNN进行处理, 模态内通过预测损失学习自身映射, 模态间通过交叉注意力Transformer捕捉互补信息, 用于警觉度估计.
在统一融合与决策中, 多模态特征拼接后, 引入多头自注意力、Transformer或动态注意力头, 对融合整体进行全局特征交互、高阶建模与自适应决策.Shi等[92]提出时空卷积与双重注意力机制融合算法, EEG和fNIRS分别经时空卷积提取特征及拼接后, 输入多头自注意力模块进行全局特征交互, 再经通道注意力模块进行特征重标定, 增强重要特征, 抑制冗余信息.Ortega等[93]提出基于深度学习的多模态解码方法, 用于预测双手连续握力轨迹, 将EEG特征与fNIRS信号对齐拼接后, 通过主要由卷积层和注意力层组成的深度学习架构进行建模.在此基础上, Ding等[94]提出MSTFDN(Multimodal Spatial-Temporal Fusion Decoding Network), 对EEG和fNIRS分别构建多频带和多血红蛋白成分的大时间窗数据, 利用多尺度时间卷积提取不同时间尺度的时序特征, 再通过多头自注意力分别建模各自的空间关系.然后将EEG与fNIRS的特征沿空间维度拼接, 输入融合分支的多头自注意力层, 提取高阶混合空间特征, 并采用跨模块空间维度升降策略增强表达能力, 有效融合两种模态的互补信息.Zhang等[95]提出轻量级双模态解码框架, 对EEG和fNIRS提取特征后, 分别通过卷积层和卷积注意力模块(含通道注意力和空间注意力)增强局部表征, 将二者输出拼接后送入单编码器Transformer, 利用多头自注意力实现跨模态特征交互.He等[96]提出FACon-former.EEG分支先通过频带注意力模块提取关键频带信息, 再经多尺度卷积和独立通道卷积提取时空特征; EMG分支由1D卷积提取特征.最后, 将两分支输出拼接后经多头注意力融合, 实现跨模态深度交互.Zhao等[51]提出便携式多模态情绪分析框架, 将EEG频谱特征、fNIRS血氧浓度特征和PPG特征组合后输入结合CNN的Transformer模型, 在AI生成音乐情绪诱发评估中验证多模态融合方案的有效性.Guo等[97]提出用于帕金森病诊断的轻量级多模态融合框架, 使用模态专用编码器分别提取sMRI、fMRI和EEG的嵌入特征并拼接后, 再通过轻量级注意力头进行动态加权融合.
此外, 特征解耦与重平衡是该领域近年来出现的新方向.Xu等[98]提出EFDFNet(EEG-fNIRS Multi-modal Deep Fusion Network), EEG信号经EEG编码结构中的CNN模块提取基础特征后, 再经并行双分支Mamba模块提取高阶特征, 在解耦损失引导下分别优化为与fNIRS相关的共有特征和模态特有的私有特征.在融合阶段, 将共有特征与fNIRS基础特征拼接作为查询向量, EEG私有特征和基础特征拼接作为键值, 输入多头交叉注意力进行跨模态深度融合, 最后通过跨模态信息的动态交互实现高精度分类.Meng等[99]提出面向EEG-fNIRS的联合学习框架, 采用双解码器架构, 共享参数查询解码器提取通用特征, 独立键解码器提取特有特征, 并引入梯度重平衡策略, 在反向传播时降低主导模态的梯度贡献, 确保两种模态学习的平衡.
2.2.4 基于图神经网络的特征级融合方法
基于图神经网络的特征级融合方法将大脑的神经拓扑结构显式引入融合过程.CNN将多通道信号视为规则网格, 而图神经网络将EEG或fNIRS视为图的节点, 依据空间距离、功能连接或互信息构建邻接矩阵, 使特征融合遵循大脑的解剖或功能拓扑.根据多模态特征在图中被整合的层次与方式, 可分为特征级对齐建图、节点级拼接建图、边/节点级异质建图.
特征级对齐建图先将不同模态的特征映射至同一空间(特征级对齐), 再将对齐后的特征作为图节点或节点属性建图.Huang等[100]提出HNLDCNet(Lightweight Hierarchical Node-Wise Localized Diffu-sion-Convolutional Network), 先将EEG和fNIRS经时间卷积嵌入同一特征空间, 实现异构信号同质化, 并统一作为图节点特征.然后基于空间位置逐层聚类, 构建脑区图层次结构.最后采用可学习有向图传递节点间信息并利用扩散卷积提取判别特征.
节点级拼接建图分别提取各模态的特征, 在节点层面将多模态特征拼接成一个综合节点向量, 然后建图.Yuan等[101]提出EF-CapsDGCN(EEG-fNIRS Capsule Dynamic Graph Convolution Network), 共享卷积架构和动态路由, 利用EEG和fNIRS生成单模态胶囊, 拼接为多模态胶囊后作为图节点, 通过动态图卷积学习胶囊间的交互关系与隐藏特征, 最后将原始胶囊和隐藏特征拼接, 借助多头自注意力平衡特征后进行分类.
边/节点级异质建图在图中显式区分不同模态的节点类型或边类型, 分别处理模态内与模态间的关系.Li等[102]提出融合图同构网络的序列学习模型, 以EEG和EMG各通道功率谱密度为节点特征, 采用标准化排列互信息计算通道间的相关性, 构建异构图, 通过图同构网络学习图级嵌入, 结合时序集成学习实现中风康复中的运动意图识别与质量评估.在异质图融合方面, Zhao等[103]提出基于异构图卷积网络的双模态情感识别方法, 首先通过深度典型相关分析将EEG和fNIRS特征映射至同一超空间, 构建包含4种类型有向边的异质图, 采用多头自注意力计算边权重, 在特征聚合阶段对同模态节点信息和跨模态节点信息采用不同传播规则, 最后自适应加权融合更新节点特征.Rahimi等[104]提出TaGMF(Topology-Aware Graph-Based Multimodal Fu-sion), 用于分类肌萎缩侧索硬化症患者和健康受试者, 利用EEG和fNIRS特征构建包含受试者内连接、受试者间连接及组间连接的复合图结构, 对比早期融合与晚期融合两种策略, 结果表明晚期融合效果更优.
图神经网络在特征级融合上的独特之处在于它把神经生理学的先验知识真正融入模型设计中, 让融合过程贴合大脑的运作规律.同时, 它还能精准捕捉不同模态在大脑皮层上的空间对应关系, 为多模态脑网络分析构建一个高效的计算框架.
2.2.5 基于生成式模型及其它策略的特征级融合方法
除上述基于CNN、LSTM和Transformer等的深度学习架构, 生成式模型和少数特殊融合策略也在特征级融合中展现出独特价值.
基于生成式模型的融合方法主要解决数据稀缺和模态对齐问题.Chen等[105]提出基于去噪扩散概率模型的EEG-fNIRS数据增强框架, 用于增强混合BCI系统的性能, 在将两种模态映射至统一空间网格并拼接后, 采用条件去噪扩散概率模型生成多样化增强样本, 同时叠加高斯噪声, 提升鲁棒性, 最后将增强后的样本与原样本混合, 再输入包含注意力模块的分类网络进行分类.Cao等[106]提出2Mh- BCINet(Multi-modal Multitask Hybrid Brain-Computer Interface Net), 用于融合EEG和EMG信号的运动想象分类, 先利用变分自编码器分别对EEG和EMG进行无监督深度特征提取, 再通过通道注意力机制对融合特征进行自适应加权选择, 最后结合多任务学习策略联合优化分类、信号重构和特征度量学习.
此外, 还有少数特殊的特征级融合策略, 如多项式融合与双线性池化提供拼接以外的细粒度交互方式.Qian等[107]提出FB-Sinc-FusionNet (Filter Bank Sinc-Convolutional Fusion Network), 用于同一肢体不同关节的精细运动想象, 将EEG、HbO和HbR三组特征向量进行多项式融合, 即特征拼接后, 通过外积生成高阶交互张量, 再经权重张量降维得到融合特征, 最后进行分类, 整个过程采用两阶段混合训练策略缓解过拟合问题.Wang等[108]提出MVENet(Multi-modal Vigilance Estimating Network), 用于SSVEP脑机接口中用户警觉状态的实时监测, 采用因式分解双线性池化, 对图卷积提取的EEG时空表征和LSTM提取的EOG时序表征进行低秩双线性融合, 隐式捕获模态间所有元素的成对交互, 生成紧凑的联合表征.
决策级融合方法是多模态脑机接口中跨模态交互程度最低的一类方法, 与最大程度保留信息完整性的数据级融合方法和追求模态间深度交互的特征级融合方法不同, 模态独立性高, 不同模态在融合前的分类结果互不影响, 因此对异步采集和模态部分缺失的情况鲁棒性较强.在决策级融合方法中, 各模态信号经独立的预测模型处理后, 仅在最终决策层面实现预测结果的融合.方法的融合策略分为基于预测分数的加权融合、基于伪标签约束的融合和基于任务分工的串行融合.
基于预测分数的加权融合策略是最经典且应用最广泛的决策级融合策略之一, 各模态独立完成从特征提取到预测输出的完整推理后, 在预测分数层面进行加权融合.根据权重确定方式的不同, 可分为固定规则融合与自适应融合.在固定规则融合方面, Rabbani等[109]提出基于深度学习的决策级融合模型, 用于认知任务分类, 分别使用CNN、LSTM、GRU及其组合, 对EEG、HbO2和HbR, 或EEG和fNIRS进行独立分类, 通过最大似然估计将各模态的预测概率融合为最终决策, 并系统对比不同单模态网络组合对融合性能的影响.在自适应融合方面, Xia等[110]提出MSFL-RGF(Multi-stream Feature Learning and Region-Aware Graph Fusion), 用于准确解码, 从EEG和fNIRS中分别提取原始时序、能量和动态变化三种互补特征流, 经LSTM编码得到节点特征, 然后与自适应图连接模块优化后的脑图拓扑结合, 再将脑区内节点特征进行池化处理, 生成区域级表示, 最后通过可学习的模态权重进行概率加权融合.
基于伪标签约束的融合用于跨模态的知识迁移与交互学习.Miao等[111]提出DuMoNet, EEG和ECG分别使用独立网络开展训练和预测, 通过对比两个网络预测概率与真实标签的差异评估各自可靠性, 选择更可靠模态的预测结果作为伪标签, 约束另一模态的训练, 同时在各模态内部通过原始数据与加噪数据预测一致性实现正则化.DuMoNet将决策层面的对比反馈回训练过程, 实现模态间的间接知识迁移.
基于任务分工的串行融合将不同模态分配至不同任务阶段.Fu等[112]提出混合脑机接口框架, 用于脑卒中患者的手部康复训练, EEG先后通过GCN和LSTM解码运动意图, EMG通过CNN分类具体动作, 二者采用EEG检测意图和EMG识别动作的串行分工策略, 交替解码任务.这种设计充分利用EEG在运动准备期的高时间分辨率和EMG在运动执行期的高信噪比特性, 将决策融合转化为任务时序上的功能互补.
根据上述讨论可知, 决策级融合方法在模态独立性、异步采集和模态数据缺失鲁棒性上优于数据级融合方法和特征级融合方法, 模态间的功能分工与串行协作模式更接近人类决策机制.
数据级融合方法信息完整但抗噪能力较弱, 特征级融合方法灵活高效但交互深度受限于融合层级的选择, 决策级融合方法鲁棒性较强但缺乏底层交互信息.为了兼顾不同层级的优势, 学者们提出混合策略融合方法, 根据任务和模态数据特点, 在模型的不同阶段施行不同层级的融合, 形成多层级协同的融合范式.
特征-决策级协同融合策略是最常见的混合策略, 这类方法通常先在特征层面对多模态特征进行拼接或增强, 再将各分支的预测结果在决策层进行自适应加权融合, 实现特征级模态交互与决策级鲁棒性的优势互补.在输出预测结果的分支中, 由于EEG直接测量神经电活动, 响应延迟极短, EEG分支结果常与融合分支的结果进行加权融合.Yu等[113]提出(2+1)D双流CNN, 用于运动想象和心算分类.EEG流经下采样和残差块提取特征后, 通过3D卷积调整尺寸并与fNIRS流的下采样特征堆叠, 再经3D卷积融合, 融合后的特征送入fNIRS流的残差块继续提取.同时, EEG流仍保留独立的分类分支.最后将两个信号流的分类得分取平均值后输出为最终结果.Kwak等[114]提出FGANet(fNIRS-Gui-ded Attention Network), 先将EEG与fNIRS信号转为空间对齐的3D张量.在网络的融合分支中, 利用fNIRS特征生成空间注意力图, 对融合分支的特征进行加权处理, 并引入残差连接加入EEG特征, 保留其独立信息.最后自适应加权融合分支和EEG分支的预测.Li[115]提出DeepSyncNet(Deep Synchro-nized Fusion Network), 先将EEG和fNIRS信号转换为3D张量, 分别经感受野模块提取多尺度特征后进行拼接, 接着通过注意力融合模块的门控机制进行自适应加权融合, 再经特征聚合模块聚合特征、时空注意力模块增强时空注意力, 同时保留独立EEG分支, 最终通过可学习参数加权融合EEG分支与融合分支的输出结果.Zhu等[116]提出多模态图融合网络, 将EEG和fNIRS的多个通道作为图节点构建异构图, 并基于皮尔逊相关系数计算跨模态边权, 经图卷积网络学习节点间空间关系, 再通过fNIRS引导注意力模块, 利用fNIRS生成的空间注意力图对EEG特征进行加权增强, 同时引入可学习权重, 融合EEG分支和融合分支的预测结果.此外, 还有研究将fNIRS分支和融合分支的结果进行加权融合.Liu等[117]提出STA-Net(Spatial-Temporal Alignment Network), 在特征层面设计2个对齐模块.fNIRS引导的空间对齐层利用fNIRS特征生成空间注意力图, 对EEG特征进行空间加权, 并引入残差连接保留EEG信息.EEG引导的时间对齐层通过交叉注意力机制, 动态对齐fNIRS的延迟响应.完成时空双重对齐后, 通过可学习权重对融合分支与fNIRS分支的预测分数进行加权融合.除了双分支的决策结果融合, 还有部分研究融合三分支的结果.Si等[118]提出TSMMF(Temporal-Spatial Multimodal Fusion), 首先提取EEG和fNIRS的模态内时空特征, 并通过自注意力Transformer构建联合多模态表征, 实现模态对齐.然后, 采用双向跨模态Transformer, 将联合表征作为键值对、各模态特征作为查询, 进行双向深度交互与融合.最后, 通过注意力机制自适应加权融合时空特征, 并引入模态特定分支保留独有信息, 将融合分支与各模态特定分支的预测结果进行加权求和, 实现决策级融合, 有效提升情感识别性能.Qin等[119]提出ECA-FusionNet, 该模型通过包含高效通道注意力机制的卷积块分别提取EEG和fNIRS信号的时空特征, 然后进行特征级拼接, 同时保留各模态的独立分类分支, 最后将EEG、fNIRS及特征拼接分支三者的分类结果进行可学习的加权融合.
数据-特征级并行的混合融合在网络中分别捕获不同抽象层级的跨模态信息.Yuan等[120]提出IIMCNet(Intra- and Inter-Modality Correlation Network), 包含两条并行路径:Intra-net在特征级针对EEG、HbO、HbR将独立网络提取的模态内特征进行拼接融合; Inter-net在数据级将EEG-HbO、EEG-HbR、HbO-HbR三种配对信号经线性插值对齐后直接拼接, 输入基于空洞卷积的并行网络提取跨模态神经血管耦合特征.最终联合优化各模态特征、跨模态耦合特征与混合特征, 从数据层和特征层两个粒度同时捕获模态间的互补关系与耦合模式.
混合策略融合方法的发展体现多模态脑机接口信号融合不再拘泥于顾此失彼的单一融合方式, 而是根据模态特性和任务需求灵活组合多种策略, 为多模态数据融合提供新的研究思路.
通过大量文献的归纳分析发现, 多模态脑机接口信号融合具有诸多优点, 如时空分辨率互补、强抗噪能力、高效鲁棒、模态数据交互动态灵活等.因此, 多模态脑机接口的应用越来越广泛.下面列举四个方面的应用案例.
1)运动想象与运动康复.该方向是多模态脑机接口研究中应用最广泛、学术成果最丰富的领域之一.在常用的模态组合中, EEG对运动准备期的快速神经响应敏感, 而EMG能提供运动执行期的稳定血流动力学或肌电信息, 两者在时序上形成天然互补, 常用于运动想象与运动康复.Fu等[112]利用EEG检测运动意图、EMG识别具体动作的串行分工策略, 提高手部康复训练患者运动意图检测与动作识别的准确性.此外, 由于其成熟的实验流程和丰富的公开数据集, 运动想象成为验证多模态融合方法性能的首选, 如文献[73]~文献[75]、文献[79]、文献[80]、文献[113]等大量多模态研究工作均应用于运动想象.
2)多模态脑机接口在认知负荷评估与分类、警觉度监测中展现出显著优势.与运动想象不同, 这类应用通常需要长时间、连续监测认知状态变化.EEG对瞬时认知波动敏感但易受眼动和肌肉伪迹干扰, fNIRS则提供更稳定的皮层激活水平信息, 两者结合可提高长时间监测的可靠性.文献[76]、文献[78]和文献[109]在n-回溯任务中利用EEG-fNIRS融合进行认知负荷分类; 文献[84]和文献[91]在驾驶警觉度估计领域融合EEG与眼电信号, 实现多模态互补的警觉状态监测.
3)多模态情感识别是近年来快速发展的方向之一.情绪状态的神经表征涉及多个脑区和多种生理响应, 单一模态难以全面捕获情绪的复杂状况.EEG反映皮层快速的情绪相关电位变化, fNIRS记录前额叶等情绪相关脑区的持续激活水平, 而外周生理信号, 如皮肤电导、心率变异性等提供自主神经系统响应信息, 三者融合可从中枢到外周多层次描述情绪状态.文献[51]、文献[86]、文献[103]和文献[118]在情感分类任务中融合EEG、fNIRS与ECG等信号, 验证多模态在情感识别中的互补优势.
4)多模态融合在神经系统疾病的辅助诊断和功能评估中具有重要临床价值.不同模态对不同类型的神经病理改变敏感, 具有差异性.例如:EEG捕获皮层异常放电和节律紊乱, fMRI提供脑结构萎缩或功能连接改变的信息, fNIRS反映局部脑区的血流动力学异常状态.在截肢者运动意图识别中, Kim等[77]探索EEG-EMG的融合在前臂截肢患者中的应用.Guo等[97]融合sMRI、fMRI和EEG进行帕金森病诊断, 验证多模态在神经退行性疾病上的诊断潜力.此外, Rahimi等[104]提出TaGMF, 将通过EEG-fNIRS构建的拓扑感知图用于渐冻症患者与健康对照组的分类, 比单模态分类效果提升显著.
多模态脑机接口的应用版图正不断拓展至语音解码、神经营销等新兴领域.Ramirez等[69]将EEG-fNIRS融合用于消费者偏好分类, 体现多模态脑机接口的商业价值.Cooney等[85]探索EEG-fNIRS双模态在外显与想象语音解码中的应用, 为失语症等言语障碍患者提供潜在的神经替代通信方案.
在脑机接口领域, 由于数据采集成本高昂、跨被试迁移困难、临床实施困难和涉及伦理道德等原因, 过去的研究大多集中于单模态数据分析和应用.特别是EEG信号, 因其无创性、便携性及高时间分辨率等优势, 成为相关研究中应用最广泛的模态之一.然而, 随着现代认知神经科学与医学工程的发展, 单一模态在空间分辨率或信息维度上的局限性逐渐暴露.近年来, 基于深度学习的多模态脑机接口信号融合的研究热度攀升, 取得显著进展, 但从方法成熟度到实际部署应用仍面临诸多挑战.
数据级融合方法的困境在于保留原始数据信息与抑制底层噪声干扰之间的矛盾.在输入端将模态原始数据直接拼接虽然最大程度保留模态之间的底层交互信息, 但简单的预处理不能消除原始数据大量的噪声、伪迹和时间差, 导致模型高度敏感.以EEG和fNIRS数据为例, 两种模态的采样率差异可达数十倍, 预处理阶段的降采样或插值对齐导致的信息损失或时序畸变无法避免.此外, 高维拼接使模型的参数量急速上升, 使用深度学习方法处理脑机接口领域的小样本数据集, 极易产生过拟合.这些问题制约数据级融合方法的发展, 导致该类方法研究较少.
特征级融合方法是现阶段主流的多模态融合方法, 但融合策略的选择具有不确定性, 极度依赖研究者的经验, 从简单的特征拼接到跨模态注意力, 再到图拓扑传播, 融合操作的顺序、时空的融合策略灵活多样, 缺乏统一确定的标准.其次, 大部分方法仅在单一固定的层级进行融合, 未能充分利用不同层级的互补信息, 浅层特征包含丰富的细节但语义较弱, 深层特征语义明确但细节丢失, 如何协调利用多尺度和多层级特征是当前研究的难点.此外, 在特征解耦与对齐方面, 现有工作通过对比损失或解耦损失强制学习模态共有特征, 但如何判断所学共有特征真正捕获跨模态的共享特征而非表面的统计相关性, 仍缺乏有效的验证手段.
决策级融合方法的鲁棒性优于数据级融合方法和特征级融合方法, 但其代价是模态间的底层交互缺失, 模态间的潜在互补信息仅在最后的预测分数层面被利用, 原始的跨模态耦合关系几乎被完全忽略, 当单模态信息均不足以独立完成可靠决策时, 简单的决策融合难以弥补前期交互缺失的不足.另外, 现有决策融合策略多为静态加权或简单的可学习参数融合, 缺乏对模态在何时、何种条件下更可靠的动态评估, 模型无法显式建模, 更多依赖数据驱动, 导致可解释性较差.
混合策略融合方法试图对数据级融合方法、特征级融合方法和决策级融合方法取长补短, 但在具体运用方面面临模型复杂度与训练难度的双重挑战.一方面, 融合架构增加可训练参数和超参数的数量, 在小样本脑机接口场景中更容易出现过拟合和训练不稳定的问题.另一方面, 对于融合组合策略及不同层级融合的协同方式的选择, 目前缺乏理论依据, 多数情况下依据研究者的经验积累, 因此混合策略融合方法的效果具有随机性.
除了各融合方法自身的局限以外, 多模态脑机接口在深度学习的框架下进行研究也面临着其它一些问题, 如多模态融合方法的可解释性不足.深度学习模型本质上是黑箱模型, 尽管在脑机接口的相关应用中, 注意力权重可视化、SHAP等可解释性工具被用于分析和理解模型的结果, 但大部分研究仍属于面向结果的解释, 决策过程缺乏透明度.换言之, 模型为何在某一时刻更依赖某一种模态, 融合后的特征对应哪一种神经生理机制, 这些已成为脑机接口领域重点关注的问题, 目前尚未得到有效解决.因此, 当前脑机接口技术在临床应用中仍缺乏临床可信度, 限制其在高安全性场景中的应用与推广.
数据稀缺与跨模态迁移困难.一方面, 数据获取的门槛较高, 具体要求包括:多模态脑机接口数据同步采集需要兼容的硬件、实验前期的充足准备和受试者的高度配合, 以及在采集过程中还需确保多种传感器之间的时序同步.另一方面, 受限于受试者数量较少、实验次数不足、隐私安全和伦理审批等问题, 现有公开数据集普遍规模较小, 难以充分发挥Transformer这类需要大量数据参与训练的模型的优势.此外, 受试者之间脑电模式的个体差异性显著, 而跨被试和跨模态的知识迁移仍处于探索初期.
深度学习模型轻量化问题.脑机接口技术走向应用时, 模型的轻量化尤为重要.多模态脑机接口研究的最终目标是应用便携式或可穿戴设备服务用户, 需要对用户意图实时解码, 但高性能融合模型通常参数较多、推理延迟, 因此如何在保持融合性能的前提下实现模型的轻量化部署是脑机接口应用落地的关键.
1)数据增强与跨模态生成.针对多模态脑机接口数据采集成本较高、公开数据集规模较小的问题, 可利用生成对抗网络、扩散模型等生成式方法生成数据, 如Chen等[105]已初步验证条件扩散模型在EEG-fNIRS数据增强中的有效性.此外, 跨模态生成方法(即从一种模态到另一种模态的信号转换)也是缓解数据稀缺的有效方法之一.
2)跨被试与跨模态迁移学习.针对被试个体间存在差异、跨被试泛化困难的问题, 引入更先进的多模态无监督或半监督领域自适应技术, 使模态特征对齐, 提取跨被试、跨时间不变的域特征, 从而在跨被试训练中有效处理新的模态组合, 提高模型的学习性能.
3)融合架构自适应搜索.针对特征级和混合融合中融合策略依赖人工经验试错、缺乏系统性引导的问题, 引入大模型自动搜索架构方法, 根据任务特性和模态组合自动搜索最优的融合方法, 减少对人工设计的依赖.
4)模态权重自适应调整.针对脑机接口中4种融合方法普遍采用静态融合策略、无法根据模态信号质量动态调整的问题, 设计能根据输入模态信号质量、任务阶段实时调整融合权重的动态方法.例如:在检测到某一模态瞬时噪声增大时自动降低其参与度, 或在任务的不同认知阶段切换主导模态, 使融合具有类脑的“ 上下文感知” 能力.
5)模态缺失的鲁棒性与不确定性.针对现有方法对模态缺失敏感、在部分模态不可用时性能急剧下降的问题, 除了研究上述通过生成式模型补全缺失模态的方法, 还可学习模态不变的共享表征, 使模型在模态不完整时仍能维持基本性能.进一步地, 量化各模态不确定性, 提升模型预测能力, 使模型在面对分布外数据时, 能输出具有较高置信度的认知结果, 从而避免过度自信, 提升安全性和鲁棒性.
6)多尺度层次化融合网络.针对现有方法在单一固定层级融合、难以兼顾浅层细节与深层语义的问题, 构造多层次交互网络架构, 提取不同层次的时空特征和目标任务之间的关联特征, 实现浅层信息与深层信息的多层级互补和交互.
7)可解释多模态融合方法.针对深度学习融合模型可解释性较差、难以追溯决策过程的问题, 将神经科学先验知识更深入嵌入模型设计, 或直接设计能体现生理学机制的模型.
8)轻量化多模态网络.针对高性能融合模型参数众多、难以在便携设备实时运行的问题, 探索参数量较少与复杂度较低的模型.例如:利用深度可分离卷积降低图融合网络的参数量, 设计Transformer的高效变体减少自注意力的计算开销, 并且在保持融合性能的前提下实现实时解码.
9)闭环融合框架设计.针对现有方法仅关注从信号到指令的单向解码, 未能充分利用人体反馈信息形成闭环交互, 构建完整的闭环交互架构, 这是脑机接口领域研究的重要方向之一.
10)多模态脑机接口的临床应用.针对现阶段多模态脑机接口研究多集中于健康受试者的解码任务, 缺乏对真实患者的临床验证.因此, 将算法应用于脑卒中、帕金森病、肌萎缩侧索硬化等患者的康复训练中, 检验其在真实病理条件下的有效性和可靠性, 才能打破实验模拟与临床应用之间的壁垒.
现有多模态脑机接口的研究多集中于某一具体应用领域或局限于某两种模态, 本文主要针对基于深度学习的多模态脑机接口的数据融合方式、实际应用、现阶段困难及未来研究方向进行归纳整理和探讨.本文将多模态数据融合方法分为数据级融合方法、特征级融合方法、决策级融合方法和混合策略融合方法, 每类又根据深度学习方法的特点进行细化讨论.此外, 总结多模态脑机接口的应用领域, 指出现阶段研究困难与未来研究方向.需要指出的是, 本文仅是对基于深度学习的多模态脑机接口信号融合工作的总结, 并未涵盖该领域的所有工作.
基于深度学习的多模态脑机接口作为一个前沿的研究领域, 正面临迫切的应用场景落地的挑战.如何通过结合大模型等先进方法和技术, 增强方法的可迁移性、可解释性、安全性, 同时降低不确定性, 扩大脑机接口技术的应用场景和范围, 提高人机交互的效率, 都是重要的研究课题.这方面的技术成果既能造福神经性疾病患者, 也能为健康人群的生活提供更丰富的体验.
本文责任编委 兰旭光
Recommended by Associate Editor LAN Xuguang
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|
| [31] |
|
| [32] |
|
| [33] |
|
| [34] |
|
| [35] |
|
| [36] |
|
| [37] |
|
| [38] |
|
| [39] |
|
| [40] |
|
| [41] |
|
| [42] |
|
| [43] |
|
| [44] |
|
| [45] |
|
| [46] |
|
| [47] |
|
| [48] |
|
| [49] |
|
| [50] |
|
| [51] |
|
| [52] |
|
| [53] |
|
| [54] |
|
| [55] |
|
| [56] |
|
| [57] |
|
| [58] |
|
| [59] |
|
| [60] |
|
| [61] |
|
| [62] |
|
| [63] |
|
| [64] |
|
| [65] |
|
| [66] |
|
| [67] |
|
| [68] |
|
| [69] |
|
| [70] |
|
| [71] |
|
| [72] |
|
| [73] |
|
| [74] |
|
| [75] |
|
| [76] |
|
| [77] |
|
| [78] |
|
| [79] |
|
| [80] |
|
| [81] |
|
| [82] |
|
| [83] |
|
| [84] |
|
| [85] |
|
| [86] |
|
| [87] |
|
| [88] |
|
| [89] |
|
| [90] |
|
| [91] |
|
| [92] |
|
| [93] |
|
| [94] |
|
| [95] |
|
| [96] |
|
| [97] |
|
| [98] |
|
| [99] |
|
| [100] |
|
| [101] |
|
| [102] |
|
| [103] |
|
| [104] |
|
| [105] |
|
| [106] |
|
| [107] |
|
| [108] |
|
| [109] |
|
| [110] |
|
| [111] |
|
| [112] |
|
| [113] |
|
| [114] |
|
| [115] |
|
| [116] |
|
| [117] |
|
| [118] |
|
| [119] |
|
| [120] |
|

