面向RGB-D显著目标检测的全局融合和递进解码网络
魏龙生1,2,3, 芈亦宸1,3, 周占翔1,3
1.中国地质大学(武汉) 人工智能与自动化学院 武汉 430074
2.云南省微光夜视探测及智能视觉导航重点实验室 昆明 650214
3.中国地质大学(武汉) 复杂系统先进控制与智能自动化湖北省重点实验室 武汉 430074
通信作者:

魏龙生,博士,副教授,主要研究方向为计算机视觉、模式识别等.E-mail:weilongsheng@cug.edu.cn.

作者简介:

芈亦宸,硕士研究生,主要研究方向为深度学习、RGB-D显著性检测等.E-mail:miyichen@cug.edu.cn.

周占翔,硕士研究生,主要研究方向为协同显著目标检测、脑电图信号解码等.E-mail:zhouzhanxiang@cug.edu.cn.

摘要

现有RGB-D显著目标检测方法普遍采用同质化融合策略,忽视特征在空间维度和语义维度上的差异.针对上述问题,文中提出全局融合和递进解码网络,采用非对称PVT(Pyramid Vision Transformer)双流编码器架构,设计差异化骨干网络,适配RGB模态与深度模态间的信息密度差异.首先,设计细节感知模块,替代传统对称融合,利用RGB全局纹理特征作为空间引导,对低质量深度特征进行非对称滤波,保留精细边界的同时抑制传感器噪声.然后,设计语义聚合模块,构建多尺度并行感受野,感知不同尺寸的目标特征,并引入通道注意力机制,实现跨模态语义纯化,优化多尺度目标的精准定位与语义对齐.最后,构建细化解码模块,通过双分支残差结构协同大感受野捕获通道注意力,有效弥补上采样过程中的信息损耗,实现显著目标从深层语义到浅层细节的递进式精准重构.在6个公开数据集上的实验表明,文中网络检测性能较优.

关键词: RGB-D显著目标检测; 注意力机制; 跨模态融合; 特征融合
中图分类号:TP 3
Global Fusion and Progressive Decoding Network for RGB-D Salient Object Detection
WEI Longsheng1,2,3, MI Yichen1,3, ZHOU Zhanxiang1,3
1. School of Artificial Intelligence and Automation, China University of Geosciences, Wuhan 430074
2. Yunnan Province Key Laboratory of Low Light Detection and Intelligent Visual Navigation, Yunnan Kunming 650214
3. Hubei Key Laboratory of Advanced Control and Intelligent Automation for Complex Systems, China University of Geosciences, Wuhan 430074
Corresponding author:
WEI Longsheng, Ph.D., associate professor. His research interests include computer vision and pattern recognition.

About Author:
MI Yichen, Master student. Her research interests include deep learning and RGB-D salient object detection.
ZHOU Zhanxiang, Master student. His research interests include co-salient object detection and EEG signal decoding.

Abstract

Existing RGB-D salient object detection methods predominantly employ homogenized fusion strategies and neglect the inherent discrepancies across spatial and semantic dimensions. To address these issues, a global fusion and progressive decoding network for RGB-D salient object detection is proposed in this paper. An asymmetric dual-stream encoder architecture is utilized, and differentiated backbone networks tailored to the distinct information densities of RGB and depth modalities are designed. First, a detail-aware module is developed to replace traditional symmetric fusion. Global RGB texture features are employed as spatial guidance for the asymmetric filtering of low-quality depth features with fine boundaries preserved and sensor noise suppressed. Then, a semantic aggregation module is developed to construct parallel multi-scale receptive fields. A channel attention mechanism is introduced for cross-modal semantic purification, optimizating precise localization and semantic alignment for multi-scale targets. Finally, a refined decoding module is constructed to cooperate with large receptive fields to extract channel attention through a dual-branch residual structure, effectively compensating for information loss and achieving a progressive reconstruction of salient objects from high-level semantics to low-level details. Experiments on six public datasets demonstrate that the proposed network achieves superior detection performance.

Key words: RGB-D Salient Object Detection; Attention Mechanism; Cross-Modal Fusion; Feature Fusion

显著目标检测(Salient Object Detection, SOD)是计算机视觉领域的一个重要研究课题.SOD通过计算机模拟人类的视觉机制, 发现物体并捕捉图像或视频中最吸引视觉注意力的区域, 在立体匹配、图像理解、目标检测、语义分割等方面发挥重要作用.单一的RGB图像容易出现低亮度、复杂背景和纹理重复等场景因素的干扰, 使得现有RGB图像显著性目标检测方法在一些复杂场景中难以精准检测图像的显著目标.深度图像蕴含的三维空间结构信息能直接反映目标与背景的距离关系, 有效弥补RGB图像在空间感知上的局限性, 提升方法的检测能力.因此, 研究人员开始关注RGB-D SOD任务.

随着深度学习技术的快速发展, RGB-D显著目标检测方法层出不穷.由于RGB信息和深度信息属于两种不同的模态, 如何有效融合跨模态信息成为当前RGB-D显著目标检测任务的研究重点之一[1].跨模态特征融合的方法演进主要经历早期融合方法和后期融合方法.早期融合方法主要侧重于简单的线性交互.其中:输入融合将RGB图像与深度图像直接拼接形成四通道输入; 早期特征融合利用两个独立网络提取低级特征后再进行拼接.后期融合方法通过并行流分别学习高级特征或显著预测图, 再进行结果层面的合并.尽管上述方法为RGB-D跨模态融合奠定基础, 但由于交互方式过于简单, 难以处理模态间的非线性语义关联.

近年来, 跨模态特征融合向深度交互与注意力引导机制转变.研究者开始探索更复杂的特征对齐策略.例如:利用跨模态残差函数和互补感知监督探索跨层互补性; 引入深度潜力感知提升深度图像质量, 整合互补信息.此外, 结合线性策略和非线性策略、采用深度交错骨干网络及引入双重注意力机制等手段, 进一步实现模态间的深度对齐.尽管这些策略提升检测性能, 但往往导致方法复杂度剧增, 且面临特征冗余的风险.

本文发现, 现有的融合方法普遍采用同质化融合策略, 即在全网络各层级均一律采用对称逐元素相加或通道拼接算子, 默认两个模态具有相同的置信度进行无差别平权交互, 忽视特征在空间维度和语义维度上的异质性.这种融合方式存在一定缺陷:在空间维度上, 低层深度特征常受限于传感器精度, 表现出低信噪比特性, 同质化融合极易导致这些噪声污染高质量的 RGB 细节; 在语义维度上, 同质化策略未能针对多尺度目标的抽象语义进行动态调整, 导致方法在处理尺度变化剧烈的目标时容易产生语义歧义.为此, 本文提出全局融合和递进解码网络(Global Fusion and Progressive Decoding Network, GPNet).首先, 设计细节感知模块(Detail-Aware Mo-dule, DAM), 提取高质量的RGB全局纹理特征作为空间引导, 对低质量深度特征进行非对称滤波.然后, 设计语义聚合模块(Semantic Aggregation Modu-le, SAM), 构建并行多尺度感受野, 全面感知不同尺寸的目标特征, 并引入通道注意力机制, 执行自适应特征重校准, 有效抑制深度噪声导致的语义歧义, 实现跨模态语义的深度融合与对齐.最后, 构建基于细化解码模块(Refined Decoding Module, RDM)的渐进式解码架构, 逐步融合高低层特征, 有效恢复显著目标的边缘细节与空间结构, 提升检测结果的精准度.

1. 相关工作
1.1 RGB-D显著目标检测

自Itti 等[2]首次提出基于生物视觉机制的显著性目标检测框架以来, 面向RGB 单模态显著目标检测涌现出一系列聚焦纹理建模、上下文聚合与边缘优化的经典方法.然而, 仅依赖RGB信息的方法在面对剧烈光照变化或背景干扰时精度有限.深度图像提供的几何结构信息能有效弥补 RGB 图像在空间感知上的短板.

在RGB-D SOD任务中, 核心挑战在于如何充分挖掘并融合两类模态的互补信息.RGB 图像擅长提供丰富的外观细节, 如颜色、纹理、边缘; 深度图像的优势在于刻画空间结构, 如目标轮廓、前景和背景的层级关系.根据这一核心特性, 学者们展开广泛探索, 形成两条主要技术路线:一类是追求极致检测性能的高精度模型, 另一类是面向资源受限设备部署的轻量级模型.

为了突破复杂场景中的检测瓶颈, 高精度模型的核心发展思路是设计精细化的特征交互机制与深层网络结构, 充分挖掘RGB模态与深度模态的互补性, 实现更精准的目标定位与背景抑制.Wei等[3]提出融合特征交互模块与边缘特征增强模块的EGA-Net, 提升显著目标的边界刻画能力.Zhou等[4]提出IRFR-Net(Interactive Recursive Feature-Reshaping Net-work), 设计动态门控机制, 筛选两类模态中的有效信息.Wu等[5]提出PopNet, 引入3D空间, 捕捉目标在三维场景中的显著性线索.Feng等[6]提出EMANet, 设计RMSA(Residual Multi-scale Aggrega-tion Module), 实现两类特征的动态优化与互补增强.Fang等[7]提出M2RNet(Multi-modal and Multi-scale Refined Network), 有效缓解跨层特征信息不一致的问题.Jin等[8]提出CAFCNet(Cross-Modality Asymmetric Feature Complement Network), 解决模态间干扰问题.Wang等[9]提出DCMNet(Discriminant and Cross-Modality Network), 改善噪声、空洞等缺陷对检测性能的影响.Wu等[10]结合边缘检测与显著目标检测任务, 通过多任务协同优化, 进一步提升模型的定位精度.Jiang等[11]提出PATNet(Patch-to-Pixel Attention-Aware Transformer Network), 利用图像块级别的上下文信息辅助像素级别的显著性判断.这类高精度模型虽检测性能优异, 但普遍依赖复杂的网络结构与密集的特征交互操作, 导致模型参数量与计算开销居高不下, 难以满足实际部署需求.

随着移动终端、边缘计算设备等资源受限场景对RGB-D SOD技术需求的日益增长, 轻量化模型成为另一重要研究方向.其核心设计理念是在保证检测性能基本满足需求的前提下, 通过简化网络结构、采用轻量级骨干网络、设计高效特征融合模块等方式, 最大限度降低方法的参数量与计算复杂度.Wu等[12]提出MobileSal, 通过隐式深度恢复弥补轻量化损失.Zeng等[13]提出AirSOD, 有效提升对长距离依赖关系与局部细节特征的建模能力.Zhou等[14]提出LSNet(Lightweight Spatial Boosting Network), 显著提升轻量级模型的边缘检测精度.Jin等[15] 提出MoADNet(Mobile Asymmetric Dual-Stream Network), 利用倒瓶颈模块降低融合计算量.Zhang等[16]提出DFM-Net(Depth Feature Manipulation Network), 针对性增强深度特征, 抑制低质量图像干扰.这类方法虽实现极高的推理速度与部署的灵活性, 但受限于简化的网络结构与有限的特征表达能力, 其检测性能, 尤其是在复杂场景中的鲁棒性, 与高精度模型相比仍存在明显差距.

总之, 现有RGB-D SOD研究需要有效平衡检测性能与计算效率:高精度模型以庞大的参数量与计算开销为代价换取优异性能, 轻量级模型则在追求效率的过程中牺牲检测精度.

1.2 跨模态特征融合

在RGB-D显著性目标检测任务中, RGB图像包含丰富的颜色和纹理信息, 而深度图像更侧重于3D布局和空间位置信息, 如何有效结合两者的互补性一直是研究焦点之一.早期融合方法主要为输入融合和早期特征融合.RGB 图像和深度图像直接拼接形成一个四通道输入, 称为输入融合.RGB图像和深度图像输入单独的网络进行特征提取, 再利用提取的低级特征进行拼接, 输入后续网络进一步进行显著预测, 称为早期特征融合.后期融合方法也分为后期特征融合和后期结果融合.采用两个并行网络流分别学习RGB图像和深度图像的高级特征, 拼接生成最终的显著预测图像, 称为后期特征融合.利用两个并行网络流分别获得RGB图像和深度图像的显著预测图像, 再拼接这两个显著预测图像, 得到最终的预测图像, 称为后期结果融合.

近年来, 大量研究致力于通过不同策略实现跨模态信息的深度融合.Chen等[17]设计渐进式双流网络, 利用跨模态残差函数和互补感知监督, 探索跨模态和跨层的互补性.Chen等[18]提出DPANet(Depth Potentiality Aware Gated Attention Network), 引入深度潜力感知, 动态评估深度图像特征的置信度, 并在网络后期融合特征, 提升跨模态的互补性.Huang等[19]探索结合线性方法和非线性方法的融合策略, 挖掘跨模态互补信息.Feng等[6]提出深度交错骨干网络, 在编码器之间传播信息, 实现不同层级的多模态特征融合.Wan等[20]提出MFFNet(Multi-modal Feature Fusion Network), 利用双重注意力机制充分融合各模态的有益信息, 实现三种模式的深度融合.Pang等[21]提出CAVER(Cross-Modal View-Mixed Trans-former), 通过模态内自注意力机制和模态间交叉注意力机制, 实现融合.Wang等[22]提出AMINet(Atten-tion-Guided Multi-modality Interaction Network), 设计CMAM(Cross-Modality Attention Module), 通过协同方式结合通道注意力机制和空间注意力机制, 细化不同模态的特征.尽管上述策略在一定程度上提高检测性能, 但往往导致方法复杂度的增加及特征冗余的风险.

2 全局融合和递进解码网络
2.1 网络架构

本文提出面向RGB-D显著目标检测的全局融合和递进解码网络(GPNet), 整体架构如图1所示.GPNet由一个非对称PVT(Pyramid Vision Transfor-mer)双流编码器[23], 细节感知模块(DAM)、语义聚合模块(SAM)和细化解码模块(RDM)组成.全局融合是指贯穿编码器阶段、结合多尺度上下文感知与多层级跨模态特征净化的融合策略, 由浅层特征的DAM和深层特征的SAM共同实现.递进解码是指在解码阶段逐步融合高低层特征、有效恢复显著目标边缘细节与空间结构的渐进式解码架构, 具体由贯穿整个解码上采样阶段的RDM通过双分支残差结构协同实现.首先, 非对称PVT双流编码器提取多级图像特征和深度图像特征, 并针对第1层和第2层获取浅层特征边界, 针对第3层和第4层获取深层特征边界.然后, 考虑浅层特征图像包含丰富的细节信息, 利用这些细节信息可在一定程度上降低网络的复杂度, 本文采用DAM实现浅层特征跨模态融合, 通过非对称滤波净化深度特征, 直接向解码器对应层级输送清晰的边缘与空间结构先验.同时, 由于高级特征图像比低级特征图像包含更多的语义信息和更少的数据, 因此采用SAM有效融合特征, 更好地利用语义信息.最后, 将DAM和SAM融合后的特征输入由RDM构成的解码器, 作为各层级解码特征的融合纽带, 逐步生成最终的显著目标预测图像.

图1 GPNet整体架构图Fig.1 Overall architecture of GPNet

本文采取非对称骨干架构:RGB图像包含丰富的颜色和纹理信息, 因此部署参数量更大、表达能力更强的PVTv2-B2, 确保充分挖掘复杂的外观特征; 对于主要反映距离和空间结构的深度分支, 由于其信息相对稀疏且存在噪声, 因此选用轻量级的PVTv2-B1.该设计不仅减少网络的整体参数量, 还防止深度分支在稀疏数据上的过拟合.

2.2 细节感知模块

在特征编码的浅层阶段, 不同模态特征的信噪比存在显著差异.在浅层网络中, RGB分支能提取高质量的空间细节, 包含清晰的纹理、精确的颜色边界及完整的物体轮廓.这些细节有助于确定显著性物体的几何边缘.相比之下, 低层深度特征受到传感器采集精度的限制, 表现出低信噪比特性.常见的伪影包括边缘锯齿效应、深度空洞及非平滑的梯度突变.在浅层阶段传统的对称融合策略, 如简单的逐元素相加或通道拼接, 忽视两个模态的特征在空间分布和置信度上并非均等的特点.直接融合极易受到深度图像中背景噪声的影响, 导致显著性检测把原本不属于显著目标的背景区域错误判定为显著目标区域.

为了解决这一问题, 本文设计细节感知模块(DAM), 采用非对称的交互策略, 利用高质量的RGB边界信息引导深度特征, 实现跨模态净化, 并在保留高频细节的同时抑制噪声.DAM详细架构如图2所示.

图2 DAM架构图Fig.2 Architecture of DAM

假设 FriRC×H×WFdiRC×H×W分别表示第 i层输入的RGB特征和深度特征.首先, 通过深度可分离卷积对特征进行嵌入, 统一通道数.再基于RGB特征, 生成空间引导图:

Mguide=σ(DConv3×3(Fri)),

其中, DConv3×3(·)表示膨胀率为2的空洞卷积算子, σ(·)表示Sigmoid激活函数, 将数值映射到(0, 1)区间以生成空间权重.

然后, 利用 Mguide对深度特征进行空间滤波, 使深度特征在空间分布上与RGB的纹理细节对齐.经过RGB空间引导净化后的深度特征为:

Frefinedd=FdiMguide,

其中 表示逐元素乘法.通过这种非对称引导, 当RGB特征指示某处为平滑背景时, 深度图像中该位置的潜在噪声会被强行抑制.仅当RGB特征确认存在边缘纹理时, 深度结构信息才会被保留.

为了充分利用净化后的深度几何信息与原始RGB纹理信息, 将 FriFrefinedd进行通道拼接.为了在低计算成本下增强特征的判别力, 引入高效通道注意力(Efficient Channel Attention, ECA)机制, 经过ECA机制重校准后的跨模态融合特征为:

Fatt=ECA(Concat(Fri, Frefinedd)),

其中, ECA(·)表示ECA机制, Cancat(·)表示通道拼接算子.

最后, 引入残差连接, 将原始RGB输入直接注入输出, 则DAM最终输出的第 i层跨模态细节增强特征为:

FiDAM=Conv3×3(Fatt)+Fri,

其中 Conv3×3(·)表示3× 3卷积算子.最终输出的 FiDAM不仅融合深度图像的几何结构信息, 还通过残差路径保留RGB图像的高分辨率细节, 为后续的解码过程提供清晰的边界先验.

DAM通过显式的非对称引导机制, 解决浅层特征融合中的模态不匹配问题.

2.3 语义聚合模块

在深层网络中, 特征图像高度抽象并富含语义类别信息, 但直接进行融合预测面临如下挑战.

1)尺度变化性, 单一固定感受野难以同时兼顾大尺度前景目标与微小目标.

2)跨模态语义的不对齐.深度图像的低质量区域可能导致语义歧义.

为此, 本文设计语义聚合模块(SAM), 集成多粒度上下文感知与自适应特征重校准机制, 具体架构如图3所示.

图3 SAM架构图Fig.3 Architecture of SAM

考虑到直接处理高维特征会带来巨大的计算开销, 首先通过通道拼接聚合双模态特征, 并利用1× 1卷积将其投影至一个特征子空间, 得到初始融合特征 Fin.

SAM引入一个三路并行的多尺度金字塔架构, 捕获覆盖多种目标尺度的上下文信息.这3个分支分别采用不同核大小的深度可分离卷积以提取特征, 第 k×k分支提取的多尺度上下文特征为:

Hk=BN(DWConvk×k(Fin)), k=3, 5, 7,

其中, BN(·)表示批归一化(Batch Normalization)层, DWConvk×k表示卷积核大小为 k×k的深度可分离卷积算子.

3× 3的小核分支专注于捕获局部细节和微小目标的拓扑结构; 5× 5的中核分支负责建立过渡尺度的语义关联; 7× 7的大核分支提供广阔的感受野, 捕获大尺度目标的整体轮廓.将3个分支的输出在通道维度上进行拼接, 得到多尺度特征:

Fms=[H3, H5, H7].

这种直接聚合的多尺度特征可能仍包含冗余信息.为了进一步实现语义纯化, 引入通道注意力机制.首先利用全局平均池化获取全局上下文信息, 再通过多层感知机生成通道重要性权重向量:

ω=σ(FMLP(GAP(Fms))),

其中, FMLP(·)表示由多层感知机构成的通道依赖性建模映射, GAP(·)表示全局平均池化操作.

这一过程赋予网络自适应选择特征的能力:对于富含显著性语义的通道给予较高响应权重, 而对于由深度噪声或背景杂波主导的通道则予以抑制.利用该权重向量对多尺度特征 Fms进行逐通道的重校准(Recalibration)操作, 得到重校准后的特征

Frecal=Fmsω,

实现跨模态语义的深度对齐与去噪.

最后, 采用残差连接策略.重校准后的特征 Frecal经过1× 1卷积进行通道降维与融合后, 与原始输入 Fin相加, 得到最终的聚合语义特征:

FiSAM=Conv1×1(Frecal)+Fin,

其中 Conv1×1(·)表示1× 1卷积算子.

SAM不仅解决多尺度目标的定位难题, 还显著提升网络在面对低质量深度图像时的鲁棒性, 为后续的解码过程提供准确、一致的语义指导.

2.4 细化解码模块

在解码阶段, 网络需要将深层的高级语义特征逐步恢复至原始图像分辨率大小.直接将上采样特征与编码器特征相加往往会导致语义模糊和细节丢失.

为了解决这一问题, 本文设计细化解码模块(RDM), 通过双分支残差结构实现由粗到精的特征重构, 具体架构如图4所示.

图4 RDM架构图Fig.4 Architecture of RDM

Fi+1f表示来自上一级解码器经过上采样后的特征图, Fif表示当前层级经过前序融合模块输出的跨模态融合特征.RDM首先将两者拼接, 并通过1× 1卷积进行初步聚合与降维, 得到输入特征:

Fini=Conv1×1(Concat(Up(Fi+1f), Fif)),

其中 Up(·)表示上采样操作.

设计一个上下文捕获主分支, 利用7× 7的大核深度可分离卷积, 在大感受野下感知目标的整体轮廓, 确保局部细节与全局结构的一致性, 经过大感受野上下文捕获主分支提取的大尺度结构特征为:

D=GELU(BN(DWConv7×7(Fini))),

其中, GELU(·)表示GELU激活函数, Conv7×7(·)表示卷积核尺寸为7× 7的深度可分离卷积算子.

同时, 设计一个轻量级的注意力辅助分支, 利用全局平均池化和两个1× 1卷积层建模通道间的依赖关系, 生成注意力权重:

Wattn=σ(Conv1×1(δ(Conv1×1(GAP(D))))),

其中 δ(·)表示ReLU激活函数.

最后, 利用注意力权重对主分支的输出进行重校准, 并通过残差连接将处理后的特征与原始输入相加, 得到最终的细化特征:

Pi=Fini+Conv1×1(DWattn).

其中, Fini提供显著目标的基础结构估计, 通过递进方式, 有效抵消上采样过程中的空间精度损耗.经过RDM处理后的特征不仅保留高层语义的完整性, 还有效恢复对象的边缘细节, 生成高精度的显著性预测图.

2.5 损失函数

在训练过程中, 损失函数由真值图像进行监督.此处, BCE(Binary Cross Entropy)和IoU(Intersec-tionover Union)损失函数[24]被应用于训练过程, 总损失

L=i=14(LBCE(pi, Gi)+LIoU(pi, Gi)),

其中, Gi表示真值图像, pi表示预测的显著性图像, LIOU·表示IOU损失函数, LBCE·表示BCE损失函数.

3. 实验及结果分析
3.1 实验环境

为了验证GPNet的有效性, 在6个主流的RGB-D数据集上进行广泛评估.从 NJU2K、NLPR、DUT数据集上分别选取1 485幅、700幅、800幅图像, 总计2 985幅图像作为训练集.上述3个数据集上的剩余图像, 以及STERE、SIP、LFSD数据集上的全部图像, 统一作为测试集.

为了评估网络性能, 采用如下4种评价指标:最大E-measure( Eξmax)[25]、结构度量(Structure Measure, Sα)[26]、最大F-measure (Fβmax)[27]、平均绝对误差(Mean Absolute Error, MAE)[28].

在网络的训练和测试阶段, 将输入的RGB图像和深度图像的分辨率调整为384 × 384.为了避免过拟合, 在数据预处理阶段采用增强策略, 即随机翻转、裁剪、旋转和颜色增强.对于骨干网络, 使用PVT的预训练参数进行初始化, 使用Adam(Adaptive Moment Estimation)优化器训练, 批大小设为8, 初始学习率设为5× 10-5, 每80个批次除以10.

在搭载单个NVIDIA RTX 3090Ti GPU的服务器上训练网络.该网络在14 h内收敛300个批次.

3.2 对比实验

本文选择如下16种先进网络进行对比, 包括:EGA-Net[3]、IRFR-Net[4]、EMANet[6]、M2RNet[7]、CD-Net(Complementary Depth Network)[29]、RD3D[30]、BBS-Net(Bifurcated Backbone Strategy Network)[31]、SSLSOD[32]、CIR-Net(Cross-Modality Interaction and Re-finement Network)[33]、HINet(Hierarchical Interaction Network)[34]、PICR-Net(Point-Aware Interaction and CNN-Induced Refinement Network)[35]、TPCL[36]、文献[37]方法、CPNet[38]、SATNet(Speed-Accuracy Tradeoff Network)[39]、PLFRNet(Perceptual Localization and Focus Refinement Network)[40].

3.2.1 定性对比

各网络的预测图像如图5所示.由图可见, 在前景背景对比明显的场景(第1幅图像和第2幅图像)中, 相比PICR-Net和PLFRNet, GPNet生成的预测图像具有更高的边缘锐度与结构完整性.这主要是由于细化解码模块通过大核卷积与注意力机制的协同作用, 有效实现空间位置的精确恢复与细节重构.当深度图像受限于传感器精度而出现边缘锯齿或空洞(第3幅图像和第4幅图像)时, 传统的对称融合方法, 如BBS-Net、HINet极易引入背景噪声, 而GPNet的细节感知模块采用非对称引导策略, 利用高质量RGB纹理生成空间权重, 净化深度特征, 确保网络在深度信息模糊时仍能输出纯净结果.当处理分布零碎且拓扑结构复杂的场景(第5幅图像和第6幅图像)时, CDNet等常因感受野受限导致漏检.GPNet凭借PVT骨干网络的全局自注意力机制聚合全图上下文信息, 配合语义聚合模块的多尺度并行架构, 实现对多个独立目标及其细长结构的完整分割.面对植物繁密叶片等复杂边缘(第7幅图像和第8幅图像)时, GPNet精准分离前景与背景, 通过在底层特征中引入细节感知模块保留纹理, 并在解码阶段利用双分支残差结构进行由粗到精的重构, 克服相似颜色特征的干扰, 实现高保真度的边缘对齐 .

图5 各网络的预测图像对比Fig.5 Comparison of predicted images from different networks

3.2.2 定量对比

各网络在6个数据集上的指标值对比如表1表2所示, 表中黑体数字表示最优值, 斜体数字表示次优值.

表1 各网络在STERE、LFSD、SIP数据集上的指标值对比 Table 1 Metric value comparison among different networks on STERE, LFSD and SIP datasets
表2 各网络在NLPR、NJU2K、DUT数据集上的指标值对比 Table 2 Metric value comparison among different networks on NLPR, NJU2K and DUT datasets

表2可知, GPNet的各指标值在多数情况下取得最优值, 说明提出的细节感知模块、语义聚合模块和细化解码模块能提升显著目标的定位精度、结构完整性和边界恢复能力.

3.3 消融实验

3.3.1 各模块有效性分析

为了评估GPNet每个组成部分的作用, 构建基准网络(Baseline)并逐步添加模块.Baseline是一个简单的编解码器结构, 不包含任何特定的融合或精炼机制.然后在Baseline中依次加入细节感知模块(DAM)、语义聚合模块(SAM)、细化解码模块(RDM), 相应消融实验结果如表3所示.

表3 各模块的消融实验结果 Table 3 Ablation experiment results on different modules

表3可见, 引入DAM后, STERE数据集上的Sα 指标有所上升, 表明DAM能通过RGB的纹理信息引导深度特征, 有效滤除深度图像中的背景噪声.加入SAM后, 更利于捕获多尺度目标, DUT数据集上的MAE指标显著下降.这归功于SAM的三路并行多尺度架构, 增强网络对不同尺寸物体的鲁棒性.最终, GPNet在所有指标上均达到最优值, 表明各模块之间具有良好的协同作用, 可共同增强显著目标检测能力.

DAM的设计在于解决浅层特征融合中低质量深度图像带来的噪声与模态不匹配问题.为了验证DAM及其非对称引导策略的有效性, 对比DAM与逐元素相加、通道拼接、DAM w/o 空洞卷积、DAM w/o 残差路径, 具体消融实验结果如表4所示.

表4 DAM的消融实验结果 Table 4 Ablation experiment results on DAM

表4可见, 相比传统的逐元素相加或通道拼接等对称融合策略, DAM显现显著的性能优势.对称融合由于隐含模态置信度均等的假设, 往往导致深度图像中由于传感器精度受限而产生的边缘锯齿和深度空洞无差别地污染RGB特征空间.相反地, DAM利用高质量的RGB纹理信息生成空间引导图像, 净化深度特征.这种非对称引导机制确保仅在确认RGB特征存在有效边缘纹理时才保留深度结构信息.DAM采用膨胀率为 2 的空洞卷积生成引导图像相比普通卷积, 空洞卷积在保持高空间分辨率的前提下可扩大感受野, 感知更广阔的上下文细节, 从而更准确界定显著边缘并剔除随机噪声响应.通过引入残差路径, DAM将原始RGB特征输入的高分辨率路径直接融入输出中.去掉该路径会导致显著目标在复杂纹理区域的边缘锐度下降.这验证残差路径能有效防止微小细节在多层卷积流转中的信息损耗.总之, DAM解决浅层特征融合中的信噪比失衡问题, 提升GPNet的检测鲁棒性.

本文在语义聚合模块(SAM)中引入基于通道注意力的重校准机制.该机制能根据输入图像的具体内容, 动态地在不同尺度的特征通道间分配权重.例如:在检测微小目标时, 会自动赋予细粒度特征分支更高的权重; 在处理复杂背景中的大型目标时, 侧重于宏观语义分支.这种“ 尺度仲裁” 机制有效抑制模态间的语义歧义, 显著降低平均绝对误差.SAM中分别包含3× 3卷积、5× 5卷积、7× 7卷积, 通道注意力的消融实验结果如表5所示.由表可见, SAM中不同卷积核分支对于提升GPNet性能具有互补作用.单一尺度分支难以同时兼顾局部细节和全局语义, 而3× 3卷积、5× 5卷积和7× 7卷积的组合能覆盖不同尺度的感受野, 使GPNet在微小目标和大尺度目标上均获得更稳定的响应.引入通道注意力后, SAM能根据图像内容自适应调整不同尺度特征的重要性, 进一步提升性能.

表5 SAM的消融实验结果 Table 5 Ablation experiment results on SAM

为了验证细化解码模块(RDM)在解码阶段对特征恢复的关键作用, 针对其内部的核心组件(7× 7大核深度可分离卷积与通道注意力分支)进行消融实验, 结果如表6所示.

表6 RDM的消融实验结果 Table 6 Ablation experiment results on RDM

表6可见, 在解码过程中, 简单的上采样容易导致显著目标边缘模糊或形状扭曲.引入7× 7大核深度可分离卷积后, Sα 指标具有明显提升.这是因为大核卷积提供广阔的局部感受野, 使网络在感知细微纹理的同时, 捕捉目标的整体轮廓信息.仅通过注意力机制建模通道间的依赖关系, 虽能在一定程度上抑制背景杂波, 但缺乏足够的空间建模能力.将大核卷积与通道注意力结合时, 性能达到最优.通道注意力通过对主分支输出进行重校准, 自适应增强包含显著性语义的通道响应, 进一步提升特征的判别力.

实验表明, RDM通过大感受野捕捉与通道注意力的协同作用, 实现从深层高级语义到浅层空间细节的平滑过渡.通过这一双分支残差结构, GPNet能有效恢复被上采样操作损耗的细节信息, 最终生成边界清晰、内部饱满的高精度显著性预测图像.

3.3.2 融合模块在不同位置的影响

为了验证DAM和SAM在不同编码阶段的融合有效性, 设计针对融合模块位置的消融实验.以全部使用DAM作为基线网络, 遵循从最深层向浅层逐步引入SAM模块的递进思路, 相应消融实验结果如表7所示.

表7 融合模块不同位置时的消融实验结果 Table 7 Ablation experiment results on fusion modules at different positions

表7可见, 相比全部使用DAM的方案, 第4层引入SAM后, 在DUT数据集上的MAE值降低0.003, Sα值提升0.004, 这说明深层特征确实需要多尺度感受野处理尺度突变问题.进一步将第3层DAM替换为SAM, 在DUT数据集上的 Sα值升至0.949.这表明在第3层网络、第4层网络中引入多尺度特征聚合机制能最大化消除语义歧义.

综上所述, 为有效实现跨模态语义对齐, 浅层采用DAM、深层采用SAM是融合模块位置的最佳选择.

3.3.3 骨干网络一致时性能对比

为了进一步验证GPNet的有效性, 排除骨干网络对对比实验的干扰, 将CPNet[38]和CATNet(Cas-caded and Aggregated Transformer Network)[41]的骨干网络统一替换为与GPNet相同的PVTv2, 构建CPNet(PVT)和CATNet(PVT).在STERE、DUT数据集上进行消融实验, 结果如表8所示.

表8 骨干网络一致时的消融实验结果 Table 8 Ablation experiment results with consistent backbones

表8可见, 在骨干网络完全一致时, GPNet的性能仍优于对比网络, 由此验证GPNet的有效性.

3.4 失败案例

尽管GPNet在多个主流数据集上检测性能较优, 但在处理极具挑战性的极端场景时仍存在局限性.部分失败案例如图6所示.

图6 失败案例Fig.6 Failed cases

由图6可见, 当面对背景深度与显著目标深度高度重合或RGB 图像与深度图像同时失效的特殊情况时, GPNet可能出现漏检或分割不完整的情况.这说明当两个模态都缺乏有效判别信息时, 难以通过全局感受野完全弥补底层信息的缺失.此外, 对于具有极端细长结构的物体, 受限于递进解码过程中的上采样损耗, 边缘细节的重构仍有提升空间.

4 结束语

现阶段RGB-D SOD中存在针对不同层级的特征采用同质化的融合策略, 忽视特征表示在空间维度和语义维度上的异质性问题, 因此本文提出全局融合和递进解码网络(GPNet), 采用非对称PVT双流编码器, 通过细节感知模块净化深度噪声, 利用语义聚合模块对齐多尺度特征, 并借助细化解码模块实现由粗到精的细节重构.实验表明, GPNet在6个主流数据集上均达到先进水平, 在显著降低计算开销的同时, 保持对复杂背景及低质量深度图像的强鲁棒性, 为该任务的实际工程部署提供高效方案.

未来可从如下方向进一步拓展与优化.1)模型轻量化升级.未来可探索轻量级Transformer骨干网络(如PVTv3-Lite)与动态通道剪枝技术, 在保持核心模块功能的前提下, 减少冗余参数与计算量.2)低质量深度图像自适应优化.现有网络对深度图像噪声、空洞等缺陷仍存在敏感性, 未来可引入深度质量评估机制, 设计自适应加权融合策略, 根据深度图像局部质量动态调整跨模态融合权重, 进一步提升网络在复杂传感环境下的鲁棒性.3)多模态泛化与扩展.将GPNet的核心融合机制扩展至RGB-T、RGB-X等多模态显著目标检测任务, 通过模态自适应特征转换模块, 挖掘不同模态间的互补信息, 提升网络在极端天气等特殊场景中的泛化能力.

本文责任编委 黄 华

Recommended by Associate Editor HUANG Hua

参考文献
[1] 化春键, 姚烨涛, 蒋毅, . 特征增强和渐进式解码的RGB-D显著性检测[J]. 计算机科学与探索, 2025, 19(9): 2419-2429.
(Hua C J, Yao Y T, Jiang Y, et al. RGB-D salient object detection with feature enhancement and progressive decoding[J]. Journal of Frontiers of Computer Science and Technology, 2025, 19(9): 2419-2429. ) [本文引用:1]
[2] Itti L, Koch C, Niebur E. A model of saliency-based visual attention for rapid scene analysis[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 1998, 20(11): 1254-1259. [本文引用:1]
[3] Wei L S, Zong G Y. EGA-Net: Edge feature enhancement and glo-bal information attention network for RGB-D salient object detection[J]. Information Sciences, 2023, 626: 223-248. [本文引用:2]
[4] Zhou W J, Guo Q L, Lei J S, et al. IRFR-Net: Interactive recursive feature-reshaping network for detecting salient objects in RGB-D images[J]. IEEE Transactions on Neural Networks and Learning Systems, 2025, 36(3): 4132-4144. [本文引用:2]
[5] Wu Z W, Paudel D P, Fan D P, et al. Source-free depth for object pop-out[C]//Proceedings of the IEEE/CVF International Confe-rence on Computer Vision. Washington, USA: IEEE, 2023: 1032-1042. [本文引用:1]
[6] Feng G, Meng J Y, Zhang L H, et al. Encoder deep interleaved network with multi-scale aggregation for RGB-D salient object detection[J/OL]. Pattern Recognition, 2022, 128. https://doi.org/10.1016/j.patcog.2022.108666. [本文引用:3]
[7] Fang X, Jiang M F, Zhu J C, et al. M2RNet: multi-modal and multi-scale refined network for RGB-D salient object detection[J/OL]. Pattern Recognition, 2023, 135. https://doi.org/10.1016/j.patcog.2022.109139. [本文引用:2]
[8] Jin D Z, Shao F, Xie Z X, et al. CAFCNet: cross-modality asy-mmetric feature complement network for RGB-T salient object detection[J/OL]. Expert Systems with Applications, 2024, 247. https://doi.org/10.1016/j.eswa.2024.123222. [本文引用:1]
[9] Wang F S, Wang R M, Sun F M. DCMNet: discriminant and cross-modality network for RGB-D salient object detection[J/OL]. Expert Systems with Applications, 2023, 214. https://doi.org/10.1016/j.eswa.2022.119047. [本文引用:1]
[10] Wu J Y, Sun F M, Xu R, et al. Aggregate interactive learning for RGB-D salient object detection[J/OL]. Expert Systems with App-lications, 2022, 195. https://doi.org/10.1016/j.eswa.2022.116614. [本文引用:1]
[11] Jiang M F, Ma J H, Chen J T, et al. PATNet: patch-to-pixel attention-aware transformer network for RGB-D and RGB-T salient object detection[J/OL]. Knowledge-Based Systems, 2024, 291. https://doi.org/10.1016/j.knosys.2024.111597. [本文引用:1]
[12] Wu Y H, Liu Y, Xu J, et al. MobileSal: extremely efficient RGB-D salient object detection[J]. IEEE Transactions on Pattern Ana-lysis and Machine Intelligence, 2022, 44(12): 10261-10269. [本文引用:1]
[13] Zeng Z H, Liu H J, Chen F L, et al. AirSOD: a lightweight network for RGB-D salient object detection[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2024, 34(3): 1656-1669. [本文引用:1]
[14] Zhou W J, Zhu Y, Lei J S, et al. LSNet: lightweight spatial boosting network for detecting salient objects in RGB-thermal images[J]. IEEE Transactions on Image Processing, 2023, 32: 1329-1340. [本文引用:1]
[15] Jin X, Yi K, Xu J. MoADNet: mobile asymmetric dual-stream networks for real-time and lightweight RGB-D salient object detection[J]. IEEE Transactions on Circuits and Systems for Video Technology, 2022, 32(11): 7632-7645. [本文引用:1]
[16] Zhang W B, Ji G P, Wang Z, et al. Depth quality-inspired feature manipulation for efficient RGB-D salient object detection[C]//Proceedings of the 29th ACM International Conference on Multimedia. New York, USA: ACM, 2021: 731-740. [本文引用:1]
[17] Chen H, Li Y F. Progressively complementarity-aware fusion network for RGB-D salient object detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2018: 3051-3060. [本文引用:1]
[18] Chen Z Y, Cong R M, Xu Q Q, et al. DPANet: depth potentiality-aware gated attention network for RGB-D salient object detection[J]. IEEE Transactions on Image Processing, 2021, 30: 7012-7024. [本文引用:1]
[19] Huang N C, Yang Y, Zhang D W, et al. Employing bilinear fusion and saliency prior information for RGB-D salient object detection[J]. IEEE Transactions on Multimedia, 2022, 24: 1651-1664. [本文引用:1]
[20] Wan B, Zhou X F, Sun Y Q, et al. MFFNet: multi-modal feature fusion network for V-D-T salient object detection[J]. IEEE Tran-sactions on Multimedia, 2024, 26: 2069-2081. [本文引用:1]
[21] Pang Y W, Zhao X Q, Zhang L H, et al. CAVER: cross-modal view-mixed transformer for bi-modal salient object detection[J]. IEEE Transactions on Image Processing, 2023, 32: 892-904. [本文引用:1]
[22] Wang R M, Wang F S, Su Y M, et al. Attention-guided multi-modality interaction network for RGB-D salient object detection[J]. ACM Transactions on Multimedia Computing, Communications and Applications, 2023, 20(3): 1-22. [本文引用:1]
[23] Wang W H, Xie E Z, Li X, et al. Pyramid vision transformer: a versatile backbone for dense prediction without convolutions[C]//Proceedings of the IEEE/CVF International Conference on Compu-ter Vision. Washington, USA: IEEE, 2021: 548-558. [本文引用:1]
[24] Zheng Z H, Wang P, Liu W, et al. Distance-IoU loss: faster and better learning for bounding box regression[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2020, 34(7): 12993-13000. [本文引用:1]
[25] Fan D P, Gong C, Cao Y, et al. Enhanced-alignment measure for binary foreground map evaluation[C]//Proceedings of the 27th International Joint Conferences on Artificial Intelligence. San Francisco, USA: IJCAI, 2018: 698-704. [本文引用:1]
[26] Fan D P, Cheng M M, Liu Y, et al. Structure-measure: a new way to evaluate foreground maps[C]//Proceedings of the IEEE International Conference on Computer Vision. Washington, USA: IEEE, 2017: 4558-4567. [本文引用:1]
[27] Achanta R, Hemami S, Estrada F, et al. Frequency-tuned salient region detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2009: 1597-1604. [本文引用:1]
[28] Perazzi F, Krähenbühl P, Pritch Y, et al. Saliency filters: contrast based filtering for salient region detection[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2012: 733-740. [本文引用:1]
[29] Jin W D, Xu J, Han Q, et al. CDNet: complementary depth network for RGB-D salient object detection[J]. IEEE Transactions on Image Processing, 2021, 30: 3376-3390. [本文引用:1]
[30] Chen Q, Liu Z, Zhang Y, et al. RGB-D salient object detection via 3D convolutional neural networks[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2021, 35(2): 1063-1071. [本文引用:1]
[31] Fan D P, Zhai Y J, Borji A, et al. BBS-Net: RGB-D salient object detection with a bifurcated backbone strategy network[C]//Proceedings of the 16th European Conference on Computer Vision. Berlin, Germany: Springer, 2020: 275-292. [本文引用:1]
[32] Zhao X Q, Pang Y W, Zhang L H, et al. Self-supervised pretrai-ning for RGB-D salient object detection[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2022, 36(3): 3463-3471. [本文引用:1]
[33] Cong R M, Lin Q W, Zhang C, et al. CIR-Net: cross-modality interaction and refinement for RGB-D salient object detection[J]. IEEE Transactions on Image Processing, 2022, 31: 6800-6815. [本文引用:1]
[34] Bi H B, Wu R W, Liu Z Q, et al. Cross-modal hierarchical interaction network for RGB-D salient object detection[J/OL]. Pattern Recognition, 2023, 136. https://doi.org/10.1016/j.patcog.2022.109194. [本文引用:1]
[35] Cong R M, Liu H Y, Zhang C, et al. Point-aware interaction and CNN-induced refinement network for RGB-D salient object detection[C]//Proceedings of the 31st ACM International Conference on Multimedia. New York, USA: ACM 2023: 406-416. [本文引用:1]
[36] Wu J S, Hao F W, Liang W Y, et al. Transformer fusion and pi-xel-level contrastive learning for RGB-D salient object detection[J]. IEEE Transactions on Multimedia, 2024, 26: 1011-1026. [本文引用:1]
[37] Song P P, Li W Y, Zhong P Y, et al. Synergizing triple attention with depth quality for RGB-D salient object detection[J/OL]. Neurocomputing, 2024, 589. https://doi.org/10.1016/j.neucom.2024.127672. [本文引用:1]
[38] Hu X H, Sun F M, Sun J, et al. Cross-modal fusion and progre-ssive decoding network for RGB-D salient object detection[J]. International Journal of Computer Vision, 2024, 132(8): 3067-3085. [本文引用:2]
[39] Duan S S, Yang X, Wang N N, et al. Lightweight RGB-D salient object detection from a speed-accuracy tradeoff perspective[J]. IEEE Transactions on Image Processing, 2025, 34: 2529-2543. [本文引用:1]
[40] Han J Y, Wang M Y, Wu W Y, et al. Perceptual localization and focus refinement network for RGB-D salient object detection[J/OL]. Expert Systems with Applications, 2025, 259. https://doi.org/10.1016/j.eswa.2024.125278. [本文引用:1]
[41] Sun F M, Ren P, Yin B W, et al. CATNet: a cascaded and aggregated transformer network for RGB-D salient object detection[J]. IEEE Transactions on Multimedia, 2024, 26: 2249-2262. [本文引用:1]