
梅 杰,博士,助理研究员,主要研究方向为脑机接口、脑机交互.E-mail:chmeijie@tju.edu.cn.
作者简介:

何金洋,硕士研究生,主要研究方向为脑机接口、强化学习.E-mail:he_jy02@163.com.

黄文锲,博士研究生,主要研究方向为脑机接口、强化学习.E-maill:huangwenqie@tju.edu.cn.

陈卫泽,博士研究生,主要研究方向为脑机接口、脑控系统.E-mail:weizechen@tju.edu.cn.

肖晓琳,博士,副教授,主要研究方向为视觉型脑机接口.E-mail:xiaoxiao0@tju.edu.cn.

王 坤,博士,副教授,主要研究方向为脑机接口、运动意图脑电信号特征提取及其在神经康复中的应用.E-mail:flora_wk@tju.edu.cn.

许敏鹏,博士,教授,主要研究方向为脑机接口、神经信号处理、神经调控.E-mail:xmp52637@tju.edu.cn.
第二十八届中国科协年会学术论文
面向脑机接口实用化需求,推动系统由传统静态设计向人机动态适应设计转变,是克服神经信号非平稳性问题的关键方法之一,有助于提升系统的自适应能力与整体性能.文中从脑机接口与强化学习的基础理论出发,综述强化学习在脑机接口系统中的优化理论及其应用,重点涵盖非侵入式系统的数据采集、编解码与外设控制环节、侵入式系统解码与外设控制环节中的相关机制.在此基础上,深入剖析强化学习算法通过与环境动态交互实现系统参数、策略及控制过程在线优化的作用机制,阐明其在提升系统对用户状态波动、环境噪声干扰及动态复杂任务适应能力方面的核心价值.最后,分析当前面临的关键技术挑战并简述发展方向,为构建具备长期稳定性与自主适应能力的新一代脑机接口系统提供参考.
About Author:
HE Jinyang, Master student. His research interests include brain-computer interfaces and reinforcement learning.
HUANG Wenqie, Ph.D. candidate. His research interests include brain-computer interfaces and reinforcement learning.
CHEN Weize, Ph.D. candidate. His research interests include brain-computer interfaces and brain-controlled system.
XIAO Xiaolin, Ph.D., associate profe-ssor. Her research interests include vision-based brain-computer interface.
WANG Kun, Ph.D., associate professor. Her research interests include brain-computer interfaces, feature extraction of motor intention EEG signals, and their applications in neurorehabilitation.
XU Minpeng, Ph.D., professor. His research interests include brain-computer interfaces, neural signal processing and neuromo-dulation.
Academic Papers of the 28th Annual Meeting of the China Association for Science and Technology
To meet the practical requirements of brain-computer interfaces, the transformation of systems from traditional static design to human-machine dynamic adaptive design is regarded as one of the key methods to overcome the non-stationarity of neural signals. It contributes to the improvement of adaptive capability and overall performance of systems. Based on the fundamental theories of brain-computer interfaces and reinforcement learning, the optimization theories and applications of reinforcement learning in brain-computer interface systems are reviewed in this paper, focusing on the data acquisition, encoding/decoding and peripheral control links of non-invasive systems, as well as the relevant mechanisms for the decoding and peripheral control links of invasive systems. On the basis of the above, the online optimization mechanism of system parameters, strategies and control processes by reinforcement learning algorithms through the dynamic interaction with the environment is thoroughly investigated. The core value in enhancing the adaptability of the system to user state fluctuations, environmental noise interference and complex dynamic tasks is clarified. Finally, the current key technical challenges are analyzed and the development directions are briefly described, which provide a reference for constructing a new generation of brain-computer interface systems with long-term stability and autonomous adaptability.
脑机接口(Brain Computer Interface, BCI)在大脑与外部设备间建立直接的交流通路, 是一种大脑与机器闭环交互、动态协同适应的系统[1, 2], 核心应用涵盖运动功能重建、神经疾病治疗、认知能力增强等方面.神经科学与人工智能的深度融合有望推动BCI在医疗康复、教育科研、航空航天等领域实现跨越式发展.
然而, 由于用户策略调整和环境因素导致大脑信号出现变化, 传统BCI系统普遍采用静态规则或监督学习方法, 无法在较长时间维度上获得高质量信号和信号-意图的稳定映射关系, 难以实现高效输出控制.例如:信号采集过程通常固定电极通道和刺激方式, 无法根据信号质量或用户状态动态调整; 神经解码依赖离线标签数据训练静态解码器, 在线阶段无法更新, 难以适应大脑信号的时变性; 指令输出多采用固定映射关系, 难以满足复杂任务控制需求, 容易对用户造成较高认知负荷[3, 4].上述局限限制BCI系统在实际应用中的人机动态适应能力, 是其高效转化应用过程中的主要挑战.
为了应对上述挑战, 需将BCI系统原有的静态设计方法转变为符合其人机动态适应特性的动态设计方法.此方法核心在于:综合考虑系统的闭环交互、动态适应、当前决策影响未来状态等特性, 将其建模为序贯决策(Sequential Decision)过程, 即在时间序列中连续做出一系列相互关联决策的过程, 其中每个决策都会影响后续决策和最终结果.若将BCI系统形式化为一个序贯决策过程, 则其运行机制可被纳入马尔可夫决策过程(Markov Decision Pro-cess, MDP)进行系统建模与分析.系统在时间序列上持续执行数据采集、神经解码、指令输出的综合流程, 每个阶段都影响后续人机交互状态, 即当前神经信号与系统决策显著影响下一时刻神经状态与相应奖励信号, 包括分类性能、任务成败等关键指标.因此, BCI系统的动态适应序贯决策过程符合MDP的数学定义[5], 可通过求解MDP的方法获得BCI系统的动态适应能力.同时, 强化学习(Reinforcement Learning, RL)作为求解MDP的主要方法, 通过智能体与环境的动态交互, 将变化的神经信号或系统参数作为动态状态输入, 将用户或任务反馈、系统表现等作为奖励, 选择能最大化累积奖励期望的策略(如通道选择、解码输出、控制指令), 高度契合BCI系统中人机协同适应性的需求.因此, 将RL的奖励机制和策略优化引入BCI系统, 有助于系统更好地适应神经信号变化并根据任务需求进行策略调整[6], 减少对离线数据的依赖, 提升模型的实时响应能力和长期稳定性, 同时增强大脑可塑性并加快人机协同适应进程[7].
针对RL与BCI的闭环反馈协同适应机制, 已有综述从技术实现角度, 依据RL算法框架总结其在BCI神经解码器中的应用现状与方法, 但未涉及信号预处理和奖励函数建模等内容[8].相比已有综述, 本文涉及BCI系统全流程, 提出BCI系统的人机动态适应设计方法的概念, 并对其进行系统梳理与分析.动态适应设计方法将BCI系统的核心流程统一建模为序贯决策过程, 从而与RL特性自然契合.本文以BCI系统的核心流程为线索, 阐述RL在各流程优化中的理论依据与技术路径, 不仅关注其在神经解码器中的应用, 更深入探讨RL在BCI系统范式编码、数据采集、神经解码与指令输出核心流程中的优化机制, 旨在从BCI系统实用化角度对相关研究进行分析与总结.
1.1.1 脑机接口概念
脑机接口技术以脑电信号(Electroencephalo-gram, EEG)为基础, 构建用户与大脑协同参与的双向闭环通信与控制系统, 实现大脑与外部装置之间的直接信息交互[9].
根据不同工作模式, 可以将BCI系统分类成不同形式.根据脑信号产生方式, 可分为主动型BCI(Active BCI)、被动型BCI(Passive BCI)与反应型BCI(Reactive BCI)[10]; 根据神经信息的流向, 可分为输出式BCI(Output BCI)、输入式BCI(Input BCI)与双向交互式BCI(Bidirectional BCI)[11]; 根据传感器电极与大脑的物理接触方式, 可分为非侵入式BCI(Non-invasive BCI)和侵入式BCI(Invasive BCI).
BCI系统通常包括范式编码、数据采集、神经解码、指令输出、反馈等关键环节, 具体如图1所示.
1.1.2 非侵入式脑机接口
范式设计是非侵入式脑机接口的重要环节之一, 是激发大脑皮层产生特定活动行为并产生脑电特征的必要条件, 是解码算法准确识别用户意图的基础[1, 3].常用的非侵入式脑机接口范式包括事件相关电位范式(Event-Related Brain Potential, ERP)[12]、稳态视觉诱发电位范式(Steady-State Visual Evoked Potential, SSVEP)[13]和运动想象范式(Motor Ima-gery, MI)[14].ERP通过反复闪烁的行列矩阵, 使用户在特定刺激出现一段时间后产生能被解码的信号.SSVEP通过固定频率闪烁的视觉刺激, 使用户大脑产生与该频率同频或倍频的响应.MI要求用户主动想象肢体(如左右手)运动, 从而诱发其对侧感觉运动皮层特定频段能量的减弱或增强.此外, ASSR(Auditory Steady-State Responses)[15]能帮助完全锁闭患者通过不同频率和内容的听觉刺激实现无眼动控制; Hybrid BCI[16]结合两种或两种以上范式, 实现更高的信息传输率; Semantic BCI[17]利用协方差矩阵和相关性向量分类器的方法解码人类语言意图.
非侵入式脑机接口的信号处理主要流程为数据采集、预处理、特征提取和分类解码.脑电信号经电极采集并放大, 最终在计算单元上进行处理.良好的信号对算法提取大脑信息至关重要.预处理目的是去除信号采集过程中与大脑活动模式无关的噪声和伪迹信号, 主要采用空间滤波(Spatial Filtering, SF), 包括CAR(Common Average Reference)、ICA(Independent Component Analysis)、PCA(Principal Component Analysis)、LR(Laplacian Reference)等.
特征提取旨在降维处理复杂高维的信号数据, 提取最大程度表征用户意图的特征.不同范式下的特征提取方法存在一定差异.对于MI等诱发节律范式, 主要采用CSP(Common Spatial Pattern)[18].对于ERP、SSVEP等诱发电位范式, 主要采用CCA(Canonical Correlation Analysis)[19]、TRCA(Task-Re-lated Component Analysis)[20]、DCPM(Discriminative Canonical Pattern Matching)[21]等.此外, xDAWN[22]、黎曼几何方法[23]等也能实现较优的特征提取效果.
分类解码是将提取特征转化为具体指令的步骤, 包括线性分类器(Linear Classifiers)、非线性分类器(Non-linear Classifiers)、深度学习分类器(Deep Learning Classifiers)、迁移学习分类器(Transfer Learning Classifiers)等.对于线性分类器, 假设特征在空间中线性可分[24], 包括LDA(Linear Discri-minant Analysis)、SVM(Support Vector Machine)等, 非线性分类器包括Kernel SVM、k-NN(k-Nearest Neighbors)、MLP(Multilayer Perceptron)等.深度学习分类器通过神经网络将原始EEG数据进行自动特征提取并分类, 包括CNN(Convolutional Neural Network)、RNN(Recurrent Neural Network)、GAN(Generative Adversarial Network)等.迁移学习分类器是进行跨被试分类解码的解决方案, 包括RCSP(Regularized Common Spatial Pattern)[25]、MEKT(Manifold Embedded Knowledge Transfer)[26]等.
1.1.3 侵入式脑机接口
脑电信号可通过大脑不同皮层位置进行采集, 如ECoG(Electrocorticography)、EFPs(Epidural Field Potentials)或LFPs(Local Field Potentials)[27].侵入式BCI的信号采集材料对信号稳定和受试者安全具有直接影响, 是研究者关注的重点之一.从Micro-wire Arrays、Utah Array、Michigan Probe等刚性神经电极, 发展至以Polyimide和Parylene C为代表的柔性电极材料, 电极耐用性与稳定性大幅提升[28].随着材料制造技术的进步, 实现与脑组织近乎无缝融合的生物仿生与网状电子(Biomimetic & Mesh Elec-tronics)注射技术、基于热拉伸工艺(Thermal Drawing Process)的多功能探针技术被运用在侵入式BCI信号采集中[28], 材料与脑组织之间的生物相容性显著提高, 可实现神经信号在数月周期内的稳定记录.
侵入式脑机接口的信号处理主要流程为数据采集、预处理、特征提取和分类解码.脑电信号被植入电极阵列采集并放大, 最终在计算单元上进行处理.预处理从采集的信号中分离噪声, 主要方法包括Bandpass Filtering、 通用平均参考、SW(Spatial Whi-tening)[29]、NEO(Nonlinear Energy Operator)[30]等.
特征提取是将连续的电压信号转化为离散的神经状态变量的过程, 主要分为动作电位处理和局部场电位处理.针对动作电位, 涵盖PCA、小波变换(Wavelet Transform)、K-均值聚类(K-means Clus-tering)、阈值检测(Threshold Crossing)等具体技术手段[31].针对局部场电位, 主要通过多尺度时频分析提取多个频段的谱功率特征[32].
分类解码将提取的特征映射为有实际意义的输出, 主要方法包括卡尔曼滤波(Kalman Filter, KF)、ReFIT-KF(Recalibrated Feedback Intention-Trained KF)[33]、RNN等.
1.2.1 强化学习概念
强化学习是解决MDP数学框架下相关问题的算法合集.MDP被描述为序贯决策问题的数学理想化形式, 主要分为4个部分. 1)感知.在一定时间步t下, 智能体观察到环境当前状态St. 2)决策.智能体根据策略π 做出针对当下状态和奖励的动作At. 3)反馈.环境在智能体做出动作后进行从St 到St+1 的状态转移(St+1 |St, At), 并给出数值奖励Rt+1. 4)循环.智能体根据转移的状态和数值奖励做出下一个动作, 不断交互循环直到结束.强化学习基于MDP, 通过与环境交互学习最优策略π * 并最大化累计奖励期望值E, 基本流程如图2所示.
RL重要概念包括Value Functions、Bellman Equation、离线学习和在线学习、Exploration and Exploitation等, 各类方法的设计与实现均以此为理论基础与支撑框架.
1.2.2 强化学习算法
强化学习算法可分为基于值函数(Value Func-tion)的算法、基于策略梯度(Policy Gradient, PG)的算法、逆强化学习(Inverse Reinforcement Learning, IRL)的算法、多智能体强化学习的算法(Multi-agent Reinforcement Learning, MARL)、Bandit Learning等.
基于值函数的算法主要通过学习动作价值函数以学习最优策略, 包括Q-learning、SARSA(State-Action-Reward-State-Action)[34]、DQN(Deep Q-Net-work)[35]等.
基于策略梯度的算法通过梯度上升, 优化智能体策略参数并最大化累计奖励期望, 包括REIN-FORCE、Actor-Critic、TRPO(Trust Region Policy Opti-mization)[36]、PPO(Proximal Policy Optimization)[37]、Maximum Entropy RL[38]等.
逆强化学习不定义奖励函数, 观察专家行为轨迹, 直接优化智能体策略, 常用于自动驾驶系统中, 学习用户行为模式, 实现共享控制策略, 也可应用于BCI中, 对受试者的行为特征进行系统分析, 主要包括Maximum Entropy Inverse Reinforcement Lear-ning[39]、Generative Adversarial Imitation Learning[40]和Adversarial Inverse Reinforcement Learning[41].
MARL旨在解决涉及多个智能体之间交互与协作的应用场景, 包括CommNet[42]、DDPG(Deep Deterministic Policy Gradient)[43]、COMA(Counterfactual Multi-agent Policy Gradients)[44]等.
Bandit Learning通过平衡探索与利用的关系, 最大化累计收益, 实现序列决策中的最优选择, 包括MAB(Multi-armed Bandit)[45]、Contextual Multi-armed Bandit[46]、Banditron[47]等.
1.2.3 算法分类情况
强化学习算法在序贯决策任务中表现出优异的策略优化能力, 而脑机接口系统具备的闭环交互机制, 为该类算法的应用提供理想环境.
在现有研究中, 针对强化学习优化脑机接口的代表性算法, 可按照基于值函数的算法、基于策略梯度的算法、Actor-Critic融合算法、MARL、Bandit Learning进行分类.表1梳理各类优化脑机接口系统算法的内容、融合逻辑、优化场景、应用前景等内容.
| 表1 强化学习优化脑机接口系统算法分类情况 Table 1 Classification of reinforcement learning algorithms for optimizing brain-computer interface systems |
将脑机接口系统流程建模为序贯决策过程, 通过MDP框架与BCI系统动态特性之间的良好适配, 能为解决神经信号变化等核心挑战, 并实现人机动态适应性提供系统性解决方案[48, 49].基于这一理论基础, 可在BCI系统中运用RL, 实现动态优化.具体操作体现在如下关键流程.1)通过范式参数自适应调整, 优化系统编码过程.2)通过动态通道选择, 优化数据采集过程.3)通过动态聚焦特征、端到端解码、迁移学习等方法, 优化系统神经解码过程.4)通过降低用户认知负荷、动态适应信号波动、复杂任务自主规划等方法, 优化BCI指令输出并实现复杂控制.表2给出在BCI系统各流程中运用RL的优化目标、状态空间定义、动作空间定义、奖励信号定义、代表算法等内容.
| 表2 强化学习优化脑机接口系统关键流程 Table 2 Key processes of optimizing brain-computer interfaces system by reinforcement learning |
非侵入式BCI刺激范式能诱发大脑产生规律神经信号, 设计合理的刺激范式以提升信号采集的质量与效率, 是该领域研究中的关键问题之一.传统方法通常依赖经验或固定参数设计刺激范式, 无法根据个体差异和任务需求进行动态调整.基于RL的范式优化方法能进行实时学习并调整范式参数, 优化不同用户和特定任务下的信号诱发, 实现BCI系统在刺激范式上的人机动态适应.自适应刺激范式流程图如图3所示.
首先智能体观测当前刺激序列与解码结果, RL智能体基于观测状态与奖励信号决策生成一组新刺激序列.然后, 更新刺激序列, 输出解码结果并计算奖励.最后, 智能体基于状态更新与奖励执行后续动作, 持续交互迭代, 实现系统性能与刺激时间效率的最优平衡.
实现自适应刺激范式的关键是将刺激选择的动态过程分解为连续的决策步, 每步的奖励反馈引导智能体优化后续选择.奖励函数的设计需兼顾闪烁时间成本与系统性能, 只有明显提升解码性能的策略才能带来正向累积回报.每轮刺激呈现后, 系统依据脑电信号的实时解码结果计算奖励并更新模型参数, 引导其优先选择提供最大信息量的刺激序列.依据这一逻辑, 动态优化P300拼写任务的刺激序列, 实现较大信息传输率提升[50].同时, 通过用户接收刺激、系统反馈及用户与系统同步动态调节循环, 促进刺激范式与用户神经响应之间的协同演化, 大幅提升ERP-BCI系统对用户意图的敏感性, 实现刺激范式的个性化适应[51].
为了获取表征用户意图的脑电信号, 需采集大脑多区域神经活动信息.然而, 使用过多信号采集通道可能引入噪声和冗余信号, 基于神经生理经验知识手动选择通道, 未必能实现与使用所有脑电通道相当的性能, 而过少通道则会丢失重要神经信息, 因此选择适合的通道及数量以采集高质量的神经信号, 是提升后续解码性能的关键因素之一.传统统计方法虽能在一定程度上识别包含良好信号的通道集合, 但在通道数量与信号采集质量之间的平衡能力不足.基于RL的通道选择方法能在动态增删通道的过程中, 基于分类准确率等性能指标的反馈信息, 持续优化通道集合, 有效实现两者的优化平衡.自适应通道选择流程图如图4所示.首先, 智能体观测当前通道集合和脑电信号特征, RL智能体基于观测状态与奖励信号决策通道增删.然后, 更新通道集合和新特征向量, 计算奖励.最后, 智能体基于状态更新与奖励执行后续动作, 持续交互迭代, 实现性能与通道数量的最优平衡.
具体而言, 通道选择过程可被形式化为马尔可夫决策过程.其中, 状态空间由已选通道集合及其对应的EEG特征构成, 动作空间定义为对通道集合的增删操作, 状态转移定义为通道集合的更新与特征的重计算.奖励函数作为实现自适应通道选择的核心部分, 定义为新通道集合带来的性能增益, 同时引入惩罚项, 控制通道数量.该机制促使智能体在每步决策中综合评估性能增益与通道选择成本, 从而在时间维度上持续优化通道配置, 保持高质量信号的稳定获取.
在决策机制方面, 采用RL DQN等方法学习值函数, 评估对通道集合增删操作后获得的累积奖励期望.智能体通过持续试错更新值函数, 掌握添加新通道和终止选择的时间节点, 最大化累计奖励期望, 最终确定最优通道集合.Jin等[52]将通道选择形式化为适用于离散空间二元决策的MDP, 在MI任务中仅使用10个通道就达到接近全通道的分类精度.然而, 该方法无法依据各通道包含的有效信息量赋予相应的权重, 通道集合变化也导致MDP动作空间变化而影响训练稳定性.为了同时实现通道搜索效率和策略泛化能力的提升, Pongthanisorn等[53, 54]将当前通道集合的EEG信号输入深度学习模型中进行特征提取和分类, 所得性能指标作为奖励反馈给强化学习智能体, 由此实现通道选择策略与特征提取模型有效适配.智能体优先选择当前网络结构能高效处理的通道及其信息, 最终学得兼顾识别性能与实用性的通道选择策略, 在通道数减少40%时仍保持较高采集质量.
2.3.1 优化特征提取效率
在BCI神经解码过程中, 特征提取旨在从采集的神经信号中提取最能表征用户意图的关键特征, 是影响BCI系统输出的关键环节之一.传统BCI系统采用的特征提取方法针对动态演变脑电信号的特征提取能力不足, 而RL在策略优化过程中利用相关奖励信号, 动态聚焦任务相关特征, 剔除任务无关信息和噪声, 能有效提升系统特征提取效率并优化解码性能.优化特征提取效率流程图如图5所示.首先, 智能体观测当前脑电信号特征或计算机资源, RL智能体基于观测状态与奖励信号进行特征筛选或计算资源分配.然后, 更新聚合特征, 输出结果并计算奖励.最后, 智能体基于状态更新与奖励执行后续动作, 持续交互迭代, 实现自适应特征提取和解码效率的提升.
RL提升特征提取效率的关键在于:智能体在每个决策时刻, 根据当前状态确定哪些特征信息需被保留、强化或优先分配计算资源, 同时, 将优化过程纳入状态、动作和奖励的统一框架, 以解码性能的增益作为奖励反馈, 并根据任务复杂度采取不同RL算法.Ko等[55]在MI任务中, 将历史EEG特征与候选EEG特征拼接后输入状态, 将奖励函数定义为分类性能的相对改善程度, 通过该机制引导RL智能体根据分类结果决定是否保留特征的特定时间片段, 自动筛选并剔除噪声或无关时段.针对低维神经信号, Zhang等[56]使用分类正确性作为奖励反馈, 构建基于门控循环单元的注意力机制, 将高维信号映射为低维隐状态, 并通过RL策略梯度优化主动控制感知注意力, 给予聚焦特征最优计算资源.针对多通道高维神经信号, Hieu等[57]将奖励定义为受分类准确率间接影响的资源效率, 构建基于RL的Actor策略网络, 负责资源分配决策、应用Critic价值网络评估状态价值, 并使用深度神经网络对信号进行特征提取和分类.针对复杂场景中高性能BCI系统的需求, Shin等[58]提出MARS(Multiagent RL for Spatial-Spectral and Temporal Feature Selection), 构建多智能体RL框架, 通过RL将特征提取任务分配给空间智能体(通道选择)、谱域智能体(频带选择)、时域智能体(时间窗选择), 使用分类准确率作为全局奖励, 再通过反事实优势函数衡量每个智能体对最终分类的贡献, 引导智能体追求性能提升最大化或损失最小化, 实现在空间、光谱和时间域中的协同特征选择.
总之, RL将BCI解码中的特征提取与资源分配重构为一个可学习的序贯决策问题.在此框架下的RL智能体根据系统解码性能获取奖励信号, 动态更新决策策略, 将所选特征分配方案输入分类模型, 输出结果作为反馈决定后续决策, 形成闭环优化, 在保证解码精度的同时提升特征提取效率.
2.3.2 自适应解码器
BCI系统解码器是将采集的神经信号转换为控制指令的模块.传统BCI神经解码模型多依赖离线训练数据构建静态映射关系, 难以应对因电极漂移、用户状态变化、个体差异等因素导致的解码准确性下降问题.基于RL的自适应BCI解码框架构建闭环机制, 针对解码器能动态调整特征权重与分类策略, 持续优化解码模型, 实现BCI系统在解码器上的人机动态适应.自适应解码器流程图如图6所示.首先, 智能体观测当前脑电信号特征, RL智能体基于观测状态与奖励信号执行解码指令输出、采集进程控制或特征组合调整的动态调控行为.然后, 更新脑电信号特征并计算奖励.最后, 智能体基于状态更新与奖励执行后续动作, 持续交互迭代, 针对个体差异、信号波动进行自适应调控, 最终实现少样本学习与迁移学习及解码精度与效率的平衡.
将BCI系统解码过程建模为RL可求解的序贯决策MDP(或POMDP、MAB变体), 是技术融合和解码策略优化的基础.这一建模使系统能在不依赖神经信号与意图之间固定映射关系的前提下, 通过持续交互和奖励反馈动态调整解码策略.具体而言, 在自适应解码器的实现过程中, 状态由脑电信号特征向量表示, 如CSP-LSTM特征、连续小波变换系数、频谱特征、信噪比估计等.动作对应输出解码指令、控制采集进程或调整特征组合的动态调控行为, 如继续采集数据或停止分类.奖励函数综合考虑解码准确率、时间效率和错误惩罚, 引导智能体在精度与效率间取得最佳平衡.在具体实现过程中, 根据不同的应用场景选择针对性的RL算法, 获得最优动态自适应解码器.
在少样本学习与迁移学习中, 降低对离线数据依赖以实现个体差异自适应的需求, RL将BCI解码器的学习过程从传统的离线校准转变为在线交互学习[59].在模仿学习基础上, Finn等[60]提出MAML(Model-Agnostic Meta-Learning), 训练模型的初始参数, 使系统充分利用新任务少量训练数据, 实现在不同任务中较优的泛化性能.同时, Duan等[61]提出MUPS-EEG(Meta Update Strategy), 将MAML引入EEG跨被试分类, 实现一定的准确率提升.为了实现迁移学习的目的, Swamy[62]提出元学习与最大熵深度强化学习结合的BCI训练架构, 借助元学习迁移跨被试先验知识, 并通过柔性Actor-Critic算法从人类反馈中自主学习, 生成极少数据依赖的自适应BCI系统.
面对非平稳神经信号的自适应需求, RL通过在线交互机制动态优化解码策略, 建立意图与输出的动态映射关系.当神经信号与意图之间的映射关系完全未知时, Bryan等[63]采用POMDP结合贝叶斯推理, 仅凭用户执行动作后的单次反馈, 即可推断用户神经信号与意图动作之间的映射关系, 在线检测用户主动切换控制映射的行为, 及时调整解码策略.针对分类任务, DQN被广泛用于构建闭环自适应解码器.例如:智能体根据实时信噪比决定采集或终止, 在保持精度的前提下缩短信号采集时间, 提升系统实时性和自适应性[64].Nallani等[65]提出RLEEG-Net, 将CSP(Common Spatial Pattern)空间滤波、CNN-LSTM时序建模与DQN在线价值迭代深度融合, 使智能体在交互中持续优化价值估计, 实现信号波动下无需新数据的在线自适应.针对高维信号特征的解码鲁棒性问题, 采用RL ε -greedy探索利用策略优化特征选择与动作决策, 提升解码鲁棒性.例如:Fidê ncio等[66]将信号解码问题建模为MAB, 采用上置信界算法结合错误相关电位ErrP二值奖励信号, 有效鼓励智能体探索未充分学习的动作, 并动态更新模型参数.同时, Jabri等[67]将高维特征子集搜索转化为连续决策过程, 让智能体通过多轮交互修正特征价值估计, 自动识别关键特征, 快速调整策略, 降低维度并提高分类结果的鲁棒性.此外, 针对仅依赖稀疏环境奖励(如任务成败)导致的RL自适应训练滞后问题, Saluwadana等[68]引入人类反馈作为额外奖励信号, 纠正系统不确定的预测标签, 有效增强系统的动态适应能力.
总之, RL通过奖励信号将解码性能指标融入策略优化目标, 使解码器能根据实时反馈在每步交互中更新价值估计或策略参数.这种在线更新机制赋予解码器三方面自适应能力.1)对于个体差异的自适应, 仅需少量离线标定数据即可完成个性化神经-意图映射学习.2)对于信号波动的自适应, 在脑电质量波动时调整解码策略, 避免性能下降.3)平衡精度与效率, 在奖励函数中引入时间成本或维度惩罚, 使系统在保持分类准确率的同时减少采集时间, 为真实环境下的实用化部署奠定基础.
RL优化BCI指令控制, 本质是将用户的高层意图(离散指令)与智能体的底层连续控制结合, 同时动态评估用户解码置信度或任务风险, 自适应调节人机控制权重, 解决噪声影响、泛化能力差、用户认知负荷高的问题, 实现自适应共享控制.优化指令输出流程图如图7所示.首先, 智能体观测当前脑电信号特征及任务相关信息, RL智能体基于观测状态与奖励信号输出动作, 通过仲裁机制与用户指令进行融合.然后, 更新脑电信号特征并计算奖励.最后, 智能体基于状态更新与奖励执行后续动作, 持续交互迭代, 实现安全高效的人机协同控制.
从指令抽象角度分析, 传统BCI系统通常要求用户直接输出控制量(如光标移动、机械臂控制), 对用户的认知负荷和解码精度要求较高.RL智能体在仿真环境中自主学习完成高层目标所需动作, 使用户仅需产生少量离散指令(如左、右、确认), 即可驱动外部设备完成完整的任务操作[69].这种分层决策架构将认知负担从用户转移至智能体, 显著降低BCI的使用门槛.
面向共享控制中人机权重的动态调节需求, RL通过在线学习置信度评估模型, 以当前EEG特征、历史解码质量、任务上下文等信息为输入, 输出用户意图的置信度分数, 实现人机动态自适应控制.Deng等[70]提出BSE-Net(Brain State Evaluation Net- work), 构建脑状态评估网络, 基于量化注意力门控核RL, 以智能体在训练中输出正确动作的价值作为脑状态置信度分数, 输入仲裁函数后在控制中混合人机指令.Xu等[71]提出DRL-ABCC(Deep Rein-forcement Learning-Based Adaptive Brain-Machine Co- llaborative Control), 分别评估脑控指令的可靠性并生成具体控制指令, 二者通过交叉状态空间在博弈机制下协同进化, 实现用户指令与辅助指令的动态权衡.Phang等[72]训练独立风险阻断器, 当检测到解码存在错误风险(如特征和任务异常)时, 阻断器否决人类动作并切换至智能体控制, 防止危险操作.上述手段将权重分配问题转化为RL的价值估计或风险评估问题, 使系统不再依赖固定的人机控制权重, 而是根据实时神经信号质量动态调整的BCI系统.
此外, 为了应对EEG解码中的不确定性, 部分研究采用仿真环境下的预训练策略或生成模型, 增强RL智能体在与真实环境交互前应对不确定性的能力.Lee等[73]提出AI-BCI, 建立脑控操作员模型, 模拟用户认知决策, 利用激光雷达目标建模、代价函数决策和EEG信号扰动模拟解码不确定性, 在模型上进行端到端的元训练, 自适应调整共享权重, 无需真实用户试错.Gunasekera等[74]设计参数化仿真用户模型, 模拟BCI系统控制中典型不确定性特征, 在该仿真环境中离线训练RL策略, 使智能体预先具备在解码质量出现变化时提供辅助或进行控制的能力, 实现仅需少量真实数据微调的用户个性化适应.
侵入式BCI在记录高信噪比和高时空分辨率神经信号方面优势显著, 无需外部刺激就能解码用户意图, 可实现快速精准的复杂任务.然而, 侵入式BCI因植入式电极阵列存在固有的局限性及潜在风险, 电极一旦植入便无法进行频繁物理更换或重新配置, 为了实现高性能的侵入式BCI系统, 需从算法层面进行补偿和自适应调整[75].
研究表明, RL因其动态优化模型的特点, 能实时监测神经信号变化并根据反馈调整解码策略, 成为提升侵入式BCI系统稳定性和解码效率、实现人机协同适应的关键方法之一.其优越性主要体现在如下关键流程:1)优化神经解码过程, 提升系统对非平稳神经信号的自适应能力, 实现低功耗运算.2)通过离散化控制和共享控制, 实现解码能力不足时的系统补偿机制.
神经解码的核心是将原始神经信号映射为指令输出, 传统神经解码方法多为线性方法或基于静态映射模型, 无法适应因免疫反应和电极老化而导致的信号衰减问题, 系统难以保证长期的稳定性.此外, 为了限制植入电极在脑组织中的发热程度, 植入式脑机接口系统严格限制功耗, 使得电极采集的数据规模无法满足传统算法训练需求, 而RL能增强系统对非平稳神经信号的自适应能力, 并实现系统低功耗运算.
首先, RL将解码任务重新定义为基于奖励反馈的序贯决策问题, 使系统不再依赖信号到输出的静态映射关系, 而是以任务成败或分类正误作为重要依据, 交互中在线调整映射关系和解码策略, 有效应对信号非平稳性问题.在早期研究中, Pohlmeyer等[76]结合Actor-Critic架构与Hebbian学习规则, 以Actor为前馈网络, 利用Critic的二值奖励信号及Hebbian规则调控神经元连接强度, 替代反向传播, 从而在极端扰动下展现出优于传统静态解码器的鲁棒性.针对高维神经信号到动作映射的非线性表达需求, Bae等[77]提出KTD(Kernel Temporal Diffe-rence), 将非线性神经特征映射至高维核希尔伯特空间, 价值函数表示为核函数线性组合, 从而兼具线性与非线性的表达能力.此外, Zhang等[78]提出CKRL(Clustering-Based Kernel Reinforcement Lear-ning), 仅使用最近簇解码, 能使解码器同步适应神经模式变化, 实现高效稳定的连续脑控.在解决信号非平稳性问题上, 侵入式BCI系统和非侵入式BCI系统最大的区别是:侵入式BCI系统主要借助RL应对植入电极对神经元扰动而引发的信号质量下降问题, 着重聚焦通过调整算法网络的神经元连接权重或参数, 维持稳定的输入输出映射关系; 非侵入式BCI系统利用RL应对因外部干扰和用户状态波动导致的信号非平稳性, 动态适配用户信号状态, 优化通道选择与特征聚焦, 提升信号质量与解码性能.
其次, 植入式系统存在低功耗计算需求.一方面, 简化RL训练架构可降低计算复杂度, 可在降低一定计算精度下实现较大的计算效率提升.Ghosh等[79]使用Banditron及其非线性变体算法, 采用单层线性网络, 将离散神经状态映射至有限的离散动作, 并通过二值奖励更新权重优化策略, 实现解码精度和硬件性能之间的平衡, 提升非线性表示能力.另一方面, 对解码算法神经网络层面进行优化设计, 可有效降低计算功耗.Zhou等[80]将Banditron和AG- REL(Attention Gated Reinforcement Learning)嵌入深度脉冲神经网络, 利用迁移学习固定浅层特征提取器, 压缩网络, 降低计算量, 实现解码精度、稳定性和能效之间的平衡.
BCI系统指令输出的质量直接决定用户在实际任务中的体验.对于复杂任务, 指令输出不仅需确保单步动作的准确性, 还需兼顾人机协作的整体效率.传统系统普遍采用连续速度控制, 致使算法解码精度要求高、用户认知负荷重、缺乏容错机制.RL将控制问题从端到端映射转化为分层决策仲裁, 通过离散化约束将复杂的连续控制简化为有限动作选择, 降低用户控制复杂度, 使系统在信号质量波动时仍能保持基本控制能力, 为引入外部智能体实现更复杂的共享控制奠定基础[81].在优化指令输出流程中, 侵入式BCI系统与非侵入式BCI系统最大的区别是:侵入式BCI系统主要侧重于实现用户离散指令的低功耗传输, 并依托RL智能体, 基于离散指令执行复杂的连续控制任务, 而非侵入式BCI系统利用RL智能体进行状态判定和辅助时机决策.RL优化侵入式BCI系统神经解码和指令输出流程的应用情况如表3所示.
| 表3 强化学习优化侵入式脑机接口系统的相关应用 Table 3 Related applications of reinforcement learning for optimizing invasive brain-computer interface systems |
强化学习为脑机接口的自适应提供重要支撑, 但在技术层面仍面临诸多挑战, 存在训练样本效率不足、奖励信号设计困难、单模态信号局限、单用户人机交互局限的问题.本节从技术维度分析当前研究中的挑战与解决方案, 为系统的实用化提供理论基础.
由于BCI系统固有的人机交互特性, 用户在离线数据采集阶段需持续参与设备交互, 但长时间任务容易诱发疲劳, 迫使用户中断采集流程进行休整, 造成短周期内难以积累足够的数据量.然而, RL又需大量数据样本训练智能体, 训练样本不足正成为RL应用于BCI系统的关键挑战.
在未来研究中, 可通过预训练模型的方法, 应对训练样本不足问题, 实现高性能RL-BCI系统.一方面, 构建基于环境动态模型的RL-BCI框架, 减少对训练样本的依赖.Chua等[83]提出PETS(Probabilis-tic Ensembles with Trajectory Sampling), 结合深度网络动力学与采样不确定性传播, 并利用概率动态模型, 降低RL样本需求, 实现与传统方法相当的性能.基于这一思路, 可利用少量离线样本训练不确定性感知的神经信号动态模型, 预测下一时刻神经状态及其不确定性.智能体基于模型进行采样规划, 模拟策略效果以选择最优动作序列.在每个动作执行后, 系统依据真实交互反馈进行在线更新, 逐步缩小高不确定性区域, 持续提升预测精度.该机制使RL-BCI系统仅需少量离线数据即可启动, 为样本不足场景提供可行方法.另一方面, 探索元学习与RL的融合策略, 通过跨用户或任务的知识迁移, 提升模型在少量样本下的学习能力.Wang等[84]提出深度元强化学习方法, 利用任务结构中的先验信息进行高效学习.据此方法, 可在跨被试脑电数据上预训练神经动力学转移模型, 学习神经信号的通用先验知识.模型不针对特定用户或任务, 而是捕捉神经信号的一般性转移规律, 如ERP锁时性(作为时间先验约束解码窗口)和运动相关皮层预备电位(支持运动意图预测性解码).在线阶段仅需固定预训练模型参数, 即可利用少量数据实现针对特定用户或任务的快速适配.
在强化学习中, 奖励信号设计对智能体策略的训练效果具有决定性影响.侵入式BCI系统和非侵入式BCI系统在噪声水平、空间分辨率等方面存在差异, 离散分类与连续控制任务对奖励反馈时间的要求也不同, 导致奖励信号设计困难.此外, 按照经验设计的奖励可能无法准确表征系统对状态转移的真实反应, 如忽视影响任务效能的关键要素、信号波动使既有奖励机制的效用下降等, 这对RL的训练过程构成显著挑战.
在未来研究中, 可从构建与任务目标高度契合、具有信息增益的内在奖励信号着手, 解决当前框架中奖励信号设计依赖经验、难以准确表征系统真实状态转移价值的问题.Burda等[85]基于DRL的探索奖励方法, 固定随机网络与可训练预测网络的输出差异, 生成内在奖励信号, 引导智能体探索新颖状态.因此, 可设计反映任务成败和认知不确定性降低的复合奖励信号, 将智能体优化目标从被动等待任务结果转变为主动降低对用户意图认知的不确定性, 使智能体在每个时刻维护用户意图的概率分布以反映认知不确定性, 执行动作后若观测到新神经信号并使分布不确定性显著降低, 则产生正向的内在奖励信号.该机制使智能体主动选择降低分布不确定性的动作, 提供密集且保真的奖励信号.此外, Christinao等[86]也尝试跳过奖励函数设计, 直接从用户数据中学习个性化策略.方法采集用户个性化数据, 构建专家示范集, 对比分析智能体在与环境交互过程中生成的轨迹数据与专家示范集, 并引入判别器网络, 对与专家示范集分布趋同的智能体数据赋予正值, 引导智能体直接学习具备用户行为特征的策略, 解决在BCI系统和复杂任务下, 按照经验设计的奖励信号因偏差使训练不稳定, 进而导致智能体策略偏差的问题.
目前RL-BCI系统多采用单一神经信号作为状态输入, 非侵入式系统以EEG(Electroencephalo-gram)为主, 侵入式系统以皮层内信号或场电位为主, 限制RL智能体对用户意图的全面理解, 并且单模态信号易受影响, 信号质量波动时, RL策略缺乏额外信息进行补偿, 导致系统性能下降.目前人类意图不仅可通过脑电信号进行识别, 还可通过肌电信号(Electromyographic Signal, EMG)、眼电信号(Elec-trooculogram, EOG)、语音信号等多种生理信号进行捕捉与分析.
在未来研究中, RL可学习基于用户多模态数据的融合策略, 减少单模态信号对系统的影响, 提升系统鲁棒性并精准地识别用户意图.引入注意力机制或门控机制, 根据各模态当前的信噪比和任务相关性, 动态调整其在状态特征中的权重, 避免低质量模态影响全局决策.Garcí a-Martí nez等[87]将返回抑制与注意疲劳机制编码为RL奖励函数, 返回抑制对持续出现的信号进行抑制, 注意疲劳机制促使注意力在不同模态信号间进行重新分配.借助这种机制, RL智能体能依据信号的任务相关性、重复性等特征, 对各模态信息权重进行动态调控, 在每个决策步, 从输入中筛选与当前任务最相关且质量最高的信号.此机制已在多种RL场景中被验证有效, 将其迁移至RL-BCI多模态融合场景, 对构建高鲁棒性系统具有重要价值.
脑机接口技术的快速发展使其在多人协作场景中的应用得到应用和推广, 逐步成为该领域的重要研究方向.传统BCI大多仅关注单用户与机器交互, 难以适应复杂场景中多用户协同工作的需求.如何构建支持多用户并行交互的RL框架, 解决BCI中多用户间的意图冲突、任务分配等问题, 是突破单用户交互局限、推动BCI向群体智能交互演进的核心挑战.
多智能体强化学习因其解决高维度复杂多方协作问题的能力, 为多人协作BCI系统提供研究思路和技术手段.在未来研究中, 可结合多智能体强化学习探索多用户BCI系统的决策机制和训练策略.Zhang等[88]量化不同用户脑电信号的信息, 并使用RL提取信息相同特征.然后将单用户信号特征与跨用户相同特征共同作为RL智能体的状态输入, 通过动态奖惩机制引导智能体学习如何进行最优融合, 即当用户的意图一致时给予正向奖励并强化协同动作, 意图冲突时通过平衡机制促使系统寻求最优解, 以此实现高效的多用户协同控制.
本文主要针对强化学习算法优化非侵入式脑机接口和侵入式脑机接口各个流程的方法和应用, 分析其主要挑战和发展方向, 并对近年来关键技术和成果进行较全面的概括.强化学习与脑机接口的融合为神经工程领域带来新的机遇与挑战, 目前在训练样本效率、奖励函数设计、多模态信号、多用户交互、自适应性等方面仍存在进步空间, 随着算法优化、硬件升级及跨学科合作的不断深入, 这些问题有望逐步得到解决.未来不仅需要在理论层面探索更高效的强化学习算法, 还需结合具体应用场景, 开发具有鲁棒性、泛化性、自适应性的系统, 推动医疗康复、教育科研、航天航空等领域的发展.
本文责任编委 兰旭光
Recommended by Associate Editor LAN Xuguang
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|
| [31] |
|
| [32] |
|
| [33] |
|
| [34] |
|
| [35] |
|
| [36] |
|
| [37] |
|
| [38] |
|
| [39] |
|
| [40] |
|
| [41] |
|
| [42] |
|
| [43] |
|
| [44] |
|
| [45] |
|
| [46] |
|
| [47] |
|
| [48] |
|
| [49] |
|
| [50] |
|
| [51] |
|
| [52] |
|
| [53] |
|
| [54] |
|
| [55] |
|
| [56] |
|
| [57] |
|
| [58] |
|
| [59] |
|
| [60] |
|
| [61] |
|
| [62] |
|
| [63] |
|
| [64] |
|
| [65] |
|
| [66] |
|
| [67] |
|
| [68] |
|
| [69] |
|
| [70] |
|
| [71] |
|
| [72] |
|
| [73] |
|
| [74] |
|
| [75] |
|
| [76] |
|
| [77] |
|
| [78] |
|
| [79] |
|
| [80] |
|
| [81] |
|
| [82] |
|
| [83] |
|
| [84] |
|
| [85] |
|
| [86] |
|
| [87] |
|
| [88] |
|

