基于全局轨迹感知的多相机多目标跟踪
范宇腾1,2, 王强3, 甄奕豪1,2, 陈希爱1, 马驰4, 范慧杰1
1.中国科学院沈阳自动化研究所 机器人与智能系统全国重点实验室 沈阳 110016
2.中国科学院大学 计算机科学与技术学院 北京 100049
3.沈阳大学 辽宁省装备制造综合自动化重点实验室 沈阳 110096
4.惠州学院 计算机科学与工程学院 惠州 516007
通信作者:

范慧杰,博士,研究员,主要研究方向为机器人视觉、机器学习、模式识别.E-mail:fanhuijie@sia.cn.

作者简介:

范宇腾, 硕士研究生,主要研究方向为多相机多目标跟踪.E-mail:fanytncu@163.com.

王 强, 博士,副教授,主要研究方向为深度学习、多任务学习、图像恢复、视觉分析.E-mail:wangqiang@syu.edu.cn.

甄奕豪, 硕士研究生,主要研究方向为目标跟踪、视频生成、视频世界模型.E-mail:zhenyihao@sia.cn.

陈希爱, 博士,副研究员,主要研究方向为机器人视觉、图像处理、模式识别.E-mail:chenxiai@sia.cn.

马 驰, 博士,副教授,主要研究方向为模式识别、数据分析、机器学习.E-mail:machi@hzu.edu.cn.

摘要

现有全局跟踪方法主要将全局轨迹视为历史目标特征的集合,缺乏对轨迹级身份语义的显式建模与一致性约束,难以充分挖掘目标跨时空的长期身份一致性.针对上述问题,文中提出基于全局轨迹感知的多相机多目标跟踪方法(Global Trajectory-Aware Multi-camera Multi-target Tracking, GTAT).首先,设计全局轨迹语义编码模块,为每条全局轨迹聚合具有长期身份语义的轨迹级表示.再构建全局轨迹感知增强模块,利用交叉注意力机制将全局轨迹级身份语义注入时间窗口内的目标关联特征,实现目标级表示对轨迹级上下文信息的显式感知.最后,设计全局轨迹一致性损失,约束轨迹级表示与目标级关联特征之间的匹配关系,提升全局轨迹表示的身份一致性建模能力和关联特征的身份判别能力.实验表明,GTAT在6个公开多相机多目标跟踪数据集上均取得较优性能.

关键词: 全局跟踪方法; 轨迹级身份语义; 全局轨迹感知; 多相机多目标跟踪; 全局轨迹一致性
中图分类号:TP391.41
Global Trajectory-Aware Multi-camera Multi-target Tracking
FAN Yuteng1,2, WANG Qiang3, ZHEN Yihao1,2, CHEN Xiai1, MA Chi4, FAN Huijie1
1. State Key Laboratory of Robotics and Intelligent Systems, Shen-yang Institute of Automation, Chinese Academy of Sciences, Shenyang 110016
2. School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing 100049
3. Liaoning Key Laboratory of Integrated Automation for Equipment Manufacturing, Shenyang University, Shenyang 110096
4. School of Computer Science and Engineering, Huizhou University, Huizhou 516007
Corresponding author:
FAN Huijie, Ph.D., professor. Her research interests include robot vision, machine learning, and pattern recognition.

About Author:
FAN Yuteng, Master student. His research interests include multi-camera multi-object tracking.
WANG Qiang, Ph.D., associate profe-ssor. His research interests include deep learning, multi-task learning, image restoration, and visual analysis.
ZHEN Yihao, Master student. His research interests include object tracking, video generation, and video world models.
CHEN Xiai, Ph.D., associate professor. Her research interests include robot vision, image processing, and pattern recognition.
MAChi, Ph.D., associate professor. His research interests include pattern recognition, data analysis, and machine learning.

Abstract

In existing global tracking methods, global trajectories are mainly treated as collections of historical target features. However, trajectory-level identity semantics are not explicitly modeled, and identity consistency constraints are not imposed. Therefore, the long-term identity consistency of targets across time and space cannot be fully exploited. To address these issues, a global trajectory-aware multi-camera multi-target tracking method termed GTAT is proposed. First, for each global trajectory, a trajectory-level representation with long-term identity semantics is aggregated by the global trajectory semantic encoding module. Then, global trajectory-level identity semantics are injected into target association features within the temporal window by the global trajectory-aware enhancement module through a cross-attention mechanism. Thus, trajectory-level contextual information can be explicitly perceived by target-level representations. Finally, a global trajectory consistency loss is designed to constrain the matching relationship between trajectory-level representations and target-level association features. Consequently, the ability of global trajectory representations to model identity consistency is improved. The identity discriminability of association features is also enhanced. Experiments demonstrate that GTAT achieves superior performance on six public multi-camera multi-target tracking datasets.

Key words: Key Words Global Tracking Method; Trajectory-Level Identity Semantic; Global Trajectory Awareness; Multi-camera Multi-target Tracking; Global Trajectory Consistency

多相机多目标跟踪[1]的目标是在多个具有重叠视野的相机视角中定位并关联同一目标, 现已广泛应用于城市监控[2]、自动驾驶[3]、人群行为分析[4]、交通场景理解[5]等领域.相比传统的单视角跟踪[6], 多相机多目标跟踪的一个重要优势在于模型能融合来自多个视角的信息, 得到更丰富的视觉线索.这种信息多样性的提升使得目标建模更鲁棒和更具判别性[7], 从而在遮挡频繁或目标外观变化显著的场景中仍保持较优的跟踪性能[8].

多相机多目标跟踪方法可划分为两阶段范式和全局范式.现有传统方法以两阶段范式为主, 研究重点集中在跨相机跟踪.该范式将任务划分为单相机跟踪[9]和跨相机跟踪[10]两个阶段, 先利用现成的多目标跟踪器[11]完成单相机跟踪, 再对各视角下的跟踪结果进行跨相机关联.Specker[12]提出OCMC-Track, 在各相机视角内生成单相机轨迹并投影至世界坐标系, 再通过校正匹配级联机制动态重评估跨相机关联结果, 减少在线跟踪过程中的错误关联.Quach等[13]提出DyGLIP(Dynamic Graph Model with Link Prediction), 将多相机目标关联问题建模为动态图中的链路预测问题, 并结合注意力机制增强动态图表示, 提升数据关联的准确性.He等[14]提出TRACTA(Tracklet-to-Target Assignment), 将多相机数据关联问题建模为一个受约束的轨迹片段至目标匹配问题, 并通过受限非负矩阵分解求解满足约束条件的最优关联结果.Gan等[15]提出MvMHAT(Multi-view Multi-human Association and Tracking), 通过成对对称相似性与三元组传递相似性学习跨时间、跨视角的一致性表征, 实现跨视角关联.在MvMHAT的基础上, Feng等[16]进一步引入STAN(Spatio-Tem-poral Assignment Network), 将外观特征学习与分配矩阵优化统一至端到端自监督框架中, 并结合全局时空结构信息优化关联结果.针对多相机小目标跟踪中跨视角关联困难和遮挡严重的问题, Liu等[17]提出MIA-Net(Multi-matching Identity Authentication Network), 挖掘不同视角下目标拓扑关系, 实现跨相机身份关联与遮挡目标补全.Hao等[18]提出CrossMOT(Cross-View Multi-object Tracking), 在跟踪过程中联合优化单视角嵌入空间与跨视角嵌入空间, 实现更优的多视角目标特征之间的数据关联.

尽管两阶段范式取得较优效果, 但仍存在如下局限.1)在两阶段范式中, 最终的跟踪结果主要由单摄像头跟踪阶段决定, 由于该阶段仅依赖单视角内的信息, 因此对多视角信息的利用不充分.2)两阶段范式中任何一个阶段出现错误都会影响下一帧的结果, 相比全局范式, 产生误差累积的可能性更大[19].

为了解决上述问题, 研究趋势逐渐转向全局范式.Zhen等[20]提出GMT(Global Multi-camera Multi-target Tracking), 将历史时间窗口内来自不同视角的目标特征组织为全局轨迹, 将目标跟踪问题转化为全局轨迹-目标匹配问题.与两阶段范式先在单视角下完成跨时间跟踪、再进行跨视角匹配的方式不同, GMT使用的全局轨迹包含来自多个视角的信息, 因此可自然实现在跟踪过程中对多视角信息的利用.此外, 全局轨迹的编码形式实现对不同视角目标的ID统一, 对于新目标只需要进行一次匹配即可确定其ID, 避免不必要的两阶段匹配, 降低误差累积的可能.凭借对跨视角线索的直接利用, GMT的综合性能显著优于传统两阶段跟踪范式.在全局跟踪框架的基础上, Fan等[21]引入红外模态, 利用可见光与热红外信息的互补性[22], 提出ADMCMT(All-Day Multi-camera Multi-target Tracking Network).为了解决额外模态带来的计算开销问题, 文献[22]设计基于Mamba的轻量化特征融合模块, 同时提出邻近目标收集策略, 利用目标周围物体的信息增强跟踪精度.

虽然全局跟踪范式显著提升多相机跟踪性能, 但现有方法对全局轨迹本身的建模仍较粗浅.以GMT为代表的现有方法主要将全局轨迹组织为历史目标特征集合, 在关联阶段计算当前目标与轨迹内所有历史目标特征的相似度并取均值, 以此刻画轨迹与目标的匹配关系.该类方法本质上仍停留在目标级特征匹配层面, 缺乏对轨迹级身份语义的显式建模与统一表达.因此, 尽管模型能利用多视角下的历史目标信息, 却未能学习并使用可表征整条轨迹长期身份的轨迹级表示.

在多相机多目标跟踪任务中, 同一目标在不同时间与不同视角下具备稳定的身份一致性信息.例如:不同视角下的运动模式、外观结构及长期时空变化规律均能刻画同一目标的身份属性.若仅依赖目标级特征完成匹配, 模型难以充分利用这些跨时间、跨视角的长期身份信息, 在复杂遮挡、外观相似或剧烈视角变化场景中容易出现身份切换与跨视角关联错误.因此, 如何从全局轨迹中学习统一的轨迹级身份语义表示, 并进一步利用该表示增强目标级关联特征的判别能力, 成为当前全局多相机跟踪研究中的关键问题之一.

针对上述问题, 本文提出基于全局轨迹感知的多相机多目标跟踪方法(Global Trajectory-Aware Multi-camera Multi-target Tracking, GTAT).不同于GMT仅对全局轨迹隐式建模, GTAT从轨迹级身份建模的角度出发, 将全局轨迹表示学习与目标级关联特征增强融合至统一框架.首先, 设计全局轨迹感知模块(Global Trajectory-Aware Module, GTAM).先依托全局轨迹语义编码模块(Global Trajectory Semantic Encoding, GTSE), 引入可学习的全局轨迹令牌, 对跨时间、跨视角的历史目标特征进行聚合建模, 得到描述长期身份一致性的轨迹级表示.再通过全局轨迹感知增强模块(Global Trajectory-Aware Enhance-ment, GTAE), 利用交叉注意力机制, 将轨迹级身份语义显式注入时间窗口内的目标关联特征, 使目标级表示能感知全局轨迹上下文信息, 提升复杂场景中的跨视角关联鲁棒性.然后, 构建全局轨迹关联模块(Global-Level Trajectory Association, GTA), 对增强后的目标级关联特征与历史全局轨迹进行统一关联建模, 根据目标与轨迹之间的匹配关系完成全局身份分配, 并输出各目标对应的全局轨迹ID.最后, 提出全局轨迹一致性损失(Global Trajectory Con-sistency Loss, GTC), 约束轨迹级表示与目标级关联特征之间的匹配关系, 对轨迹级身份语义进行显式监督, 实现跨时间、跨视角条件下的身份一致性建模, 提升关联特征的判别能力.实验表明, GTAT在6个公开多相机多目标跟踪数据集上取得优于当前最强全局基线GMT的性能表现, 从而验证其在复杂跨视角场景中的有效性.

1 基于全局轨迹感知的多相机多目标跟踪方法
1.1 整体架构

本文提出基于全局轨迹感知的多相机多目标跟踪方法(GTAT), 遵循全局跟踪范式, 整体架构如图1所示.

图1 GTAT整体架构Fig.1 Overall architecture of GTAT

在环境中设置C个具有重叠视野的相机, 多相机多目标跟踪的任务是实时检测、跟踪所有相机拍摄的每个目标, 并为不同相机中的相同目标赋予统一的身份ID.在s时刻, 输入为所有相机采集的图像Ms={ msc}c=1C, 其中每幅图像先由骨干网络提取特征f sc, 再通过目标检测器输出每幅图像内所有目标的检测框$\boldsymbol{B}_{s}^{c}=\left\{\boldsymbol{b}_{s, j}^{c}\right\}_{j=1}^{N_{s}^{c}}$, 其中, bs, jc表示第c个视角下图像中的第j个检测框, Nsc表示检测框数量.根据检测框从特征f sc中裁剪目标的外观特征, 并提取对应的时间特征和相机特征, 经特征拼接与投影层映射, 得到第j条轨迹最终用于关联的目标特征 Fs, jasso, c.对于第j条轨迹, 从历史帧中收集其跨时间、跨视角的关联特征, 构成轨迹特征集合, 相应轨迹定义如下:

$\boldsymbol{\tau}_{j}=\left\{\boldsymbol{F}_{s, j}^{\text {asso }, c} \mid s \in[t-T+1, t-1], c \in[1, C]\right\}, $

其中, t表示当前时刻, T表示时间窗口长度.

GTAT首先通过全局轨迹语义编码模块(GTSE)聚合全局轨迹中的长期身份信息, 构建全局轨迹记忆库, 再通过全局轨迹感知增强模块(GTAE)将轨迹级身份语义注入目标级关联特征, 得到全局轨迹感知的关联特征, 然后通过全局轨迹关联模块(GTA)计算当前帧所有目标与全局轨迹的匹配分数, 最终使用匈牙利算法为目标分配轨迹ID.

在推理初始化阶段, 首先, 选择目标数量最多的视角作为主视角, 并为该视角中的各目标分配唯一的初始ID.然后, 将其余视角中目标依次与主视角中的目标进行匹配.对于匹配成功的目标, 并入对应的全局轨迹, 并赋予与该轨迹一致的ID; 对于未能成功匹配的目标, 分配新的ID, 并建立相应的全局轨迹.由此完成全局轨迹的初始化.当历史时间窗口长度为T-1时, 采用滑动窗口方式进行后续推理.时间窗口每次整体向后滑动一个时间步, 并移除窗口中上一时刻的观测.

1.2 全局轨迹感知模块

与GMT直接基于目标级关联特征进行全局匹配不同, GTAT通过全局轨迹感知模块(GTAM)将全局轨迹感知过程拆分为两步:全局轨迹级语义提取和目标级特征增强.首先, 对于每条历史轨迹, 利用GTSE, 聚合跨时间、跨视角的历史关联特征, 得到显式轨迹级表示, 用于描述该轨迹的长期身份语义.其次, 将所有轨迹级表示组织为全局轨迹记忆库.在此基础上, 通过GTAE, 利用交叉注意力机制, 按视角建模轨迹级表示与目标级关联特征之间的依赖关系, 并将轨迹级上下文信息注入时间-视角窗口内的目标级关联特征.即便推理阶段GTA依旧采用均值相似度策略, 计算当前目标与整条历史轨迹的匹配得分, 但经过增强后的目标特征已融入显式轨迹身份语义, 可有效区分外观相似目标, 维持跨时间跨视角的身份一致性, 输出更稳定可靠的全局关联结果.

1.2.1 全局轨迹语义编码模块

为了提取轨迹级别的全局表示, 设计GTSE, 引入可学习的全局轨迹令牌 ctrajg, 并拼接至展平后的轨迹特征序列前端, 与该轨迹在历史时间-视角窗口内的所有目标特征共同输入Transformer编码器.由于编码器内置自注意力机制可建模序列任意元素间的依赖关系, 令牌 ctrajg作为查询向量, 对轨迹内全部历史目标特征进行加权聚合, 得到蕴含全局身份语义的轨迹级表征.与简单平均池化不同, 该过程能根据不同目标特征对轨迹身份建模的重要性自适应分配权重, 从而更有效聚合跨时间、跨视角的身份一致性信息.

为了适配Transformer编码器输入形式, 将轨迹τ j按照时间和视角组织的特征展平为一维序列, 定义如下:

$\left\{x_{\tilde{t}, j}\right\}_{\tilde{t}=1}^{T_{g}}=\operatorname{Flatten}\left(\boldsymbol{\tau}_{j}\right), $

其中,

Tg=(T-1)C,

表示全局时间总步数, Flatten(· )表示将轨迹τ j展平的函数, t˜表示展平后的全局时间索引. t˜与原始历史帧索引s及视角索引c的映射关系如下:

t˜=(s-(t-T+1))C+c∈ [1, 2, …, Tg],
s∈ [t-T+1, t-1], c∈ [1, C].

由此构造模块原始输入:

Z j0=[ ctrajg, x1, j, x2, j, …, xTg, j].

将其送入Transformer编码器, 完成特征编码:

Z jn=TransformerEncoder(Z j0),

其中n表示编码器层数.最终截取输出序列中全局轨迹令牌对应的首位特征作为第j条轨迹的全局轨迹特征:

cjg= Zjn[0]∈ RD,

其中D表示特征维度. cjg综合编码该轨迹在历史时间维度和相机视角维度上的身份一致性信息, 可用于时间窗口关联特征的增强.

1.2.2 全局轨迹感知增强模块

然而, 当前时间窗口内的关联特征仍缺乏显式的全局轨迹级信息.为此, 设计GTAE, 利用全局轨迹记忆库, 对时间窗口[t-T+1, t]内的关联特征进行分视角增强.

对于第c个视角, 构建时间窗口内的关联特征集合:

$\boldsymbol{F}_{[t-T+1, t]}^{\text {asso }, c}=\bigcup_{s=t-T+1}^{t} \boldsymbol{F}_{s}^{\text {asso }, c}$,

其中 Fsasso, c表示第s时刻、第c个视角下的关联特征集合.将该集合作为交叉注意力的查询Qc.与此同时, GTSE提取的所有历史轨迹全局表示构成全局轨迹记忆库, 作为交叉注意力的键和值:

K=V=[ c1g, c2g, …, cJg]∈ RJ× D,

其中J表示历史窗口内轨迹的数量.在此基础上, 通过交叉注意力将历史轨迹级全局上下文分视角注入时间窗口的关联特征中, 得到第c个视角下的增强特征:

$\widehat{\boldsymbol{F}}_{[t-T+1, t]}^{\text {asso }, c}=\operatorname{Softmax}\left(\frac{\boldsymbol{Q}^{c} \boldsymbol{K}^{\mathrm{T}}}{\sqrt{D}}\right) \boldsymbol{V}, $

其中softmax(· )表示沿键向量维度对注意力得分矩阵进行逐行归一化.采用残差连接得到最终增强特征:

F˜[t-T+1, t]asso, c=Qc+ F︿[t-T+1, t]asso, c.

最终, 整个时间窗口内的全局轨迹感知关联特征为:

$\widetilde{\boldsymbol{F}}_{[t-T+1, t]}^{\text {asso }}=\bigcup_{c=1}^{C} \widetilde{\boldsymbol{F}}_{[t-T+1, t]}^{\text {asso }, c} .$

该模块利用提取的全局轨迹级表示, 对时间窗口内的关联特征进行全局轨迹感知增强, 从而引入目标的长期身份一致性特征, 有效解决原有关联特征全局信息不足的缺陷.

1.3 全局轨迹关联模块

本文采用全局跟踪范式, 将多相机多目标跟踪建模为全局层面的轨迹-目标关联过程.首先将历史时间窗口内的轨迹感知关联特征 F˜[t-T+1, t]∈ RL× D输入自注意力编码器中进行编码, 得到轨迹特征集合Γ , 其中L表示历史目标数量.然后处理当前帧的轨迹感知关联特征 F˜tasso.先利用自注意力机制为当前帧目标特征建模上下文信息, 再以当前帧目标特征作为查询向量, 通过交叉注意力机制与轨迹特征集合Γ 完成信息交互, 学习不同轨迹之间的判别性特征, 最终输出增强目标特征 F¯tasso.

在推理阶段, 首先计算增强后的当前目标特征 F¯tasso与历史轨迹特征集合Γ 之间的目标级相似度矩阵ES∈ RN× L, 其中N表示当前目标数量.本文将当前目标与单条轨迹的相似度定义为该目标与轨迹内所有历史关联目标相似度的均值, 由此进一步求解得到当前目标-轨迹相似度矩阵E∈ RN× J.最后利用匈牙利算法获得最终的关联结果.

在训练阶段, 编码器和解码器将时间窗口内轨迹感知增强的目标特征 F˜[t-T+1, t]asso作为输入, 对所有目标进行关联相似度计算.在训练时N=L, 两者均表示当前时间窗口下所有目标数量.训练目标是最大化由目标级相似度矩阵ES定义的预测分布相对于真实匹配标签的对数似然.对于 F¯tasso中的任意目标a, 若其无法与轨迹特征集合Γ 内任意历史目标完成匹配, 则标记为未匹配样本.本文额外引入未匹配类别, 在相似度矩阵ES基础上添加一列全零向量, 然后通过softmax归一化得到概率分布矩阵H∈ RN× (L+1), 相应元素计算方式如下:

$H_{a b}=\frac{\exp \left(E_{a b}\right)}{\exp \left(E_{a 0}\right)+\sum_{q=1}^{N} 1_{\left(t_{q}=t_{b} \text { and } c_{q}=c_{b}\right)}\left(\exp \left(E_{a q}\right)\right)} $.

其中: 1(tq=tbandcq=cb)表示示性函数, 当在时间tb和视角cb下能检测该目标时取1, 否则取0; Eab、Ea0表示目标-轨迹相似度矩阵E中元素.

对于真实标签矩阵X∈ RN× (L+1), 相应元素计算方式如下:

Xab= 1, pa↔pb0, 其它

其中, pa↔ pb表示Γ 中第b个目标与H中第a个标签匹配.最终的关联损失为:

$L_{\text {asso }}=-\frac{1}{N}\left(\sum_{a=1}^{N}\left(\sum_{b=1}^{L+1} X_{a b} \ln H_{a b}\right)\right) .$

1.4 全局轨迹一致性损失

现有关联损失本质上仅对目标级匹配关系施加约束, 缺乏轨迹层面的身份一致性监督.为此, 本文引入全局轨迹一致性损失(GTC), 以第1.2.1节中得到的全局轨迹表示和目标级关联特征的匹配关系为监督信号, 要求每条轨迹的全局表示在整个历史窗口内始终与其身份一致的关联特征保持稳定匹配关系.这样可在训练过程中同时从不同层面对关联特征进行优化与约束, 并保证历史窗口内全局轨迹级表示与关联特征之间的一致性, 从而增强全局轨迹级表示的身份一致性建模能力, 提升关联特征的判别能力.

本文仅考虑历史窗口[t-T+1, t-1].对于该窗口内的所有帧, 按照“ 时间优先、视角次优先” 的顺序, 将时间索引s与视角索引c联合展平为全局时间步 t˜.

由此, 第j条轨迹在全局时间步 t˜上对应的关联特征 Fj, t˜asso= Fs, jasso, c∈ RD, 其中, (s, c)与 t˜满足第1.2.1节中定义的映射关系, 即 t˜为展平后全局时间轴上的统一时间索引.

对于第i条轨迹的全局表示 cig及任意轨迹j在全局时间步 t˜上经GTSE处理后的关联特征 F·j, t˜asso, 分别通过2个独立的多层感知机将其投影到统一的匹配空间, 分别得到投影后的第i条轨迹的全局特征

$z_{i}^{\text {traj }}=M L P_{\text {traj }}\left(c_{i}^{g}\right)$

和第j条轨迹在全局时间步 t˜上关联特征

$z_{j, i}^{\text {asso }}=M L P_{\text {asso }}\left(\dot{\boldsymbol{F}}_{j, i}^{\text {asso }}\right) .$

再通过点积计算两者之间的相似度:

Ai, j, t˜=( zitraj)T zj, t˜asso.

若将(j, t˜)映射为一维列索引, 则可等价得到一个轨迹-目标相似度矩阵A∈ RJ×(J×Tg).

为了构建GTC的监督信号, 定义有效候选掩码矩阵M和轨迹-目标对应矩阵G, 分别用于刻画候选轨迹的有效性及轨迹与目标之间的身份对应关系.首先, 掩码矩阵M用于表征历史窗口内哪些候选轨迹-时间对是有效的, 矩阵中元素

$M_{i, j, \tilde{t}}=\left\{\begin{array}{ll} 1, & \text { 轨迹 } i, j \text { 在全局时间步 } \tilde{t} \text { 中同时存在有效目标特征 } \\ 0, & \text { 其它 } \end{array}\right.$

其次, 轨迹-目标对应矩阵G用于表征正负样本, 矩阵中元素

$G_{i, j, \tilde{t}}=\left\{\begin{array}{ll} 1, & \text { 轨迹 } i 、 j \text { 在全局时间步 } \tilde{t} \text { 中同时存在有效目标特征, 且二者属于同一身份 } \\ 0, & \text { 其 } \end{array}\right.$

上述监督信号的作用可理解为:对于第i条全局轨迹, 其轨迹级表示应当与该轨迹在不同时间、不同视角下的目标级关联特征保持较高的相似度, 而与其它轨迹的关联特征保持较低的相似度.由于多相机多目标视频中目标并非在所有时间和所有视角下均可见, 若直接在所有轨迹-全局时间对上计算损失, 会引入无效监督.为此, 引入有效候选掩码矩阵M, 用于避免不可观测或不可匹配的候选项参与损失计算, 确保GTC仅在有效候选集合上进行优化.基于上述定义, 记正样本集合

P={(i, j, t˜)| Gi, j, t˜=1},

其中每个三元组表示第i条全局轨迹与(j, t˜)对应的目标特征构成一个正样本.对于第i条全局轨迹, 定义有效候选集合:

Ω i={(j, t˜)| Mi, j, t˜=1}.

在此基础上, 将GTC定义为一个带掩码约束的多分类交叉熵损失:

$L_{\mathrm{GTC}}=-\frac{1}{|P|} \sum_{(i, j, \tilde{t}) \in P} \ln \left(\frac{\exp \left(A_{i, j, \tilde{t}}\right)}{\sum_{\left(j^{\prime}, \tilde{t}^{\prime}\right) \in \Omega_{i}} \exp \left(A_{i, j^{\prime}, \tilde{t}^{\prime}}\right)}\right) .$

GTC中相关矩阵构建示例如图2所示.

图2 GTC中相关矩阵的构建示例Fig.2 Example of constructing relevant matrices in GTC

示例包含2条全局轨迹和4个全局时间步, 矩阵的行表示全局轨迹索引i, 列表示展平后的轨迹-全局时间步索引(j, t˜).GTC鼓励第i条轨迹的全局表示 cig在整个历史窗口内对与正样本对应的关联特征赋予更高响应, 并降低其与负样本的匹配分数.掩码矩阵M用于筛除历史窗口中无效的轨迹-全局时间对, 使分母中的归一化仅在有效候选集合Ω i上进行, 保证监督信号仅来自可观测、可匹配的候选项.相比仅约束目标级匹配关系的关联损失, GTC从轨迹级全局表示出发, 在展开后的历史时间-视角窗口上统一建模身份一致性, 从而为全局轨迹级表示的学习提供更充分的跨时间、跨视角的监督信号, 最终引导方法学习判别性更强的关联特征.

1.5 损失函数

鉴于跟踪任务高度依赖于目标定位的准确性, 本文将训练过程划分为两个阶段.在第1阶段中, GTAT沿用GMT的检测器和关联特征提取模块进行训练:以DLA-34(Deep Layer Aggregation-34)[23]作为骨干网络, CenterNet[24]作为检测器.CenterNet以特征图为输入, 直接预测目标中心点的置信热力图, 并对目标尺寸和中心偏移进行回归.该设计能在保持结构简洁的同时实现较精确的目标定位, 为后续的目标特征提取与跟踪关联提供可靠的位置信息.目标检测分支的损失函数表示如下:

Ldet=Lheatmap+λ sizeLsize+λ offLoff,

其中, λ size=0.1, λ off=1.0, Lheatmap表示中心点热力图损失, Lsize表示目标尺度(长宽)回归损失, Loff表示中心点偏移回归损失.

为了学习具有身份判别性的外观特征, 采用交叉熵损失、三元组损失和中心损失进行联合监督.该分支损失函数如下所示:

LREID=LCE+LTriplet+LCenter,

其中, LCE表示交叉熵损失, LTriplet表示三元组损失, LCenter表示中心损失.训练时每个预测框会被分配给与其交并比(Intersection over Union, IoU)最大的真实框对应的身份标签, 以此为LREID提供可靠的监督信号.因此, 第1阶段的训练损失函数为:

Lstage1=Ldet+LREID.

第2阶段对完整模型进行训练, 损失函数为:

Lstage2=Ldet+λ 1Lasso+λ 2LGTC,

其中, λ 1=3.0, λ 2=1.0, Lasso表示时间窗口内所有目标匹配关系的交叉熵损失, LGTC表示本文的全局轨迹一致性损失.

2 实验及结果分析
2.1 实验环境

本文采用DLA-34作为骨干网络, CenterNet作为目标检测器.在VisionTrack数据集[20]上, 先将输入图像等比例缩放至1 280× 720, 再采用取值范围为0.8~1.2的随机尺度因子对图像进行缩放增强, 然后输入骨干网络.在预训练阶段, 采用Adam(Adaptive Moment Estimation)优化器, 初始学习率设为1× 10-4.在CrowdHuman数据集[25]上对骨干网络与目标检测器进行联合预训练, 共迭代4.5× 104次, 批次大小设为32.在正式训练阶段, 在两块NVIDIA RTX L40 48 G GPU上完成训练, 仍采用Adam优化器, 学习率设为5× 10-5, 时间窗口长度T设为9.其中, 第1阶段训练迭代1.05× 104次, 第2阶段训练迭代1.4× 104次.在推理阶段, 使用单张NVIDIA A6000 GPU进行评估, 时间窗口长度T设为60, 目标检测器的置信度阈值设为0.525, 与大多数现有工作保持一致.虽然训练和推理设置的时间窗口长度不一致, 但训练和推理都依据目标级关联特征之间的匹配关系, 因此并不存在训练和推理不一致的问题.

为了全面评估GTAT的性能, 在 MvMHAT[15]、DIVOTrack[18]、VisionTrack[20]、EPFL[26]、CAMPUS[27]、WILDTRACK[28]数据集上进行实验. MvMHAT数据集仅包含1个场景, 每段序列由3~4个不同视角组成.DIVOTrack数据集覆盖10个真实世界场景, 共包含20段视频序列, 涵盖室内与室外公共环境, 并由3台运动相机完成采集.VisionTrack数据集覆盖15个真实场景, 包含88段视频序列, 场景环境类型多样, 目标分布情况多样, 在数据规模与多样性方面均优于现有同类数据集.与采用固定地面相机采集的数据集不同, VisionTrack数据集上的数据由两架运动中的无人机完成拍摄, 从而引入更复杂的视角变化与动态成像条件[29].EPFL数据集包含5个场景, 每段序列由3~4个不同视角组成, 主要采集6~11名行人行走或奔跑的视频.各视角分辨率相对较低, 均为360× 288.CAMPUS数据集包含4个场景, 每个场景由4台1080P相机拍摄.WILDTRACK数据集仅包含1个场景, 具有7个视角, 场景中目标密度较高、遮挡与交互频繁, 因此更能体现模型的跨视角关联能力.

2.2 评估指标

本文采用MOTA(Multiple Object Tracking Accuracy)[30]、HOTA(High Order Tracking Accuracy)[31]、AssA(Association Accuracy Score)[31]、ID F1[32]对单视角跟踪性能进行综合评估.MOTA指标是多目标跟踪领域主流的整体评价指标, 综合考量误检、漏检与身份跳转等各类误差, 易受检测结果影响, 更侧重于反映模型检测效果与基础跟踪能力.HOTA指标将检测精度与数据关联精度融合至统一评价体系, 兼顾目标检测正误与时序身份关联效果, 可全面衡量模型检测与轨迹关联的综合表现.IDF1指标从身份匹配维度衡量预测轨迹与真实轨迹的契合程度, 有效体现模型长时序跟踪中的身份维持能力.AssA指标为HOTA框架下的关联精度子指标, 聚焦已检测目标间的匹配合理性, 可直观反映轨迹连续性与身份稳定程度.联合采用上述指标, 能从检测质量、整体跟踪效果、身份一致性等多维度完成方法单视角性能评估.

为了评估跨视角的跟踪性能, 使用CVIDF1(Cross-View IDF1 Metric)和CVMA(Cross-View Ma-tching Accuracy)[18]指标.CVIDF1指标是IDF1指标的跨视角版本, 主要用于衡量跨视角的ID一致性, 公式如下:

CVIDF1= 2·CVIDP·CVIDRCVIDP+CVIDR,

其中, CVIDP表示跨视角的ID精度, CVIDR表示跨视角的ID召回率.

CVMA指标是MOTA指标的跨视角版本, 公式如下:

$C V M A=1-\sum_{t}\left(m_{t}+f_{\mathrm{pt}}^{c}+2 m_{\mathrm{met}}\right)\left(\sum_{t} g_{t}\right)^{-1}, $

其中, mt表示在时间t时丢失的检测, gt表示在时间t时来自所有视角的真实目标, fpt表示假阳性匹配对的数量, mmet表示错误匹配对的数量.

2.3 对比实验

实验选取如下对比方法:$MvMHAT _{\text {prev }}$[15]、$MvMHAT_{\text {Res }}$[16]、$MvMHAT_{Trans}$[16]、CrossMoT[18]、GMT[20]、AGW (Attention Generalized Mean Pooling with Wei- ghted Triplet Loss)[33]、CTL[34].AGW和CTL均为行人重识别方法, 二者作为外观特征提取网络接入DIVOTrack基准采用的统一跨视角关联流程, 完成多相机多目标跟踪.MvMHATprev表示MvMHAT的前期版本.MvMHATRes和MvMHATTrans分别表示Mv-MHAT的ResNet版本和Transformer版本.

为了保证公平性, GTAT的检测器设置与GMT相同, 各对比方法的实验结果采用文献[20]中公布的结果.

各方法在VisionTrack、DIVOTrack数据集上的指标值如表1所示.由表可见, 在VisionTrack 数据集上, 相比GMT, GTAT取得更优值, 表明其在跨视角匹配与身份一致性方面均取得提升, 其中IDF1、AssA、CVMA、CVIDF1指标分别提升1.7%、1.5%、1.3%和1.6%, 表明挖掘和利用目标的身份一致性信息能有效提升跨视角关联性能.不同于Vision-Track数据集上由多架无人机拍摄带来的显著动态视角变化, DIVOTrack数据集上的视角变化相对有限, 因此场景变化也相对较弱.实验表明, 相比GMT, GTAT取得更优性能, IDF1、AssA、CVMA、CVIDF1指标分别提升2.1%、2.5%、3.2% 和 2.9%.

表1 各方法在VisionTrack、DIVOTrack数据集上的性能对比 Table 1 Performance comparison of different methods on VisionTrack and DIVOTrack datasets %

各方法在WildTrack、MvMHAT数据集上的指标值如表2所示.由表可见, 在WildTrack数据集上, 相比GMT, 尽管GTAT的AssA指标略有下降, 但CVMA、CVIDF1、MOTA、HOTA、IDF1指标均取得明显提升, 说明GTAT能更有效地提升复杂多视角场景中的全局身份建模能力与跨视角匹配能力, 在整体跟踪性能上取得更优平衡.MvMHAT数据集上行人目标尺度较大、外观清晰、背景干扰较少、极端遮挡情况相对较少, 同时行人活动范围与相机运动模式较为规律, 目标通常不会频繁进出视野, 因此轨迹断裂与身份切换发生的概率较低, 整体跟踪难度相比其它密集复杂场景也相对较小.相比GMT, GTAT的IDF1、AssA、CVMA、CVIDF1指标分别提升2.1%、5.8%、2.3% 和 2.3%.

表2 各方法在WildTrack、MvMHAT数据集上的性能对比 Table 2 Performance comparison of different methods on WildTrack and MvMHAT datasets %

各方法在CAMPUS、EPFL数据集上的指标值如表3所示.

表3 各方法在CAMPUS、EPFL数据集上的性能对比 Table 3 Performance comparison of different methods on CAMPUS and EPFL datasets %

由表3可见, 在CAMPUS数据集上, 相比GMT, GTAT的CVMA、CVIDF1指标分别提升3.7%和3.2%.在EPFL数据集上, 相比GMT, GTAT在部分与检测相关的指标上略有下降, 但其跟踪性能更优, IDF1、CVIDF1指标分别提升2.1%和2.7%.尽管EPFL、CAMPUS数据集上场景类型相对单一、可跟踪目标数量有限, 但测试集通常由较长的连续视频序列构成, 更强调跟踪过程中的时序一致性、长时遮挡恢复能力和身份保持能力, 因此更能体现GTAT的长期关联建模能力.

2.4 可视化分析

为了更直观地展示GTAT和GMT的性能差异, 选取2组GMT典型失效场景展开对比分析.Vision-Track数据集上00018court1场景涵盖篮球运动, 属于长时序视频, 具有目标运动剧烈、遮挡频繁等特点, 适用于评估方法的单视角跟踪性能.DIVOTrack数据集上SHOP场景为拥挤的室内商场环境, 跨视角外观差异显著, 且场景中目标尺度变化较大, 适用于评估跨视角匹配性能.GTAT和GMT的可视化结果如图3和图4所示.

图3 各方法在VisionTrack数据集0018court1场景中的可视化结果Fig.3 Visualization results of different methods in 0018court1 scene of VisionTrack dataset

图4 各方法在DIVOTrack数据集SHOP场景中可视化结果Fig.4 Visualization results of different methods in SHOP scene of DIVOTrack dataset

由图3可见, 在00018court1场景中, 相似目标干扰和遮挡同时存在时, GMT出现ID交换, 并将影子产生的误检错误关联至已有轨迹, 而GTAT能降低该误检对轨迹身份关联的干扰, 并保持较稳定的目标关联.

由图4可见, 在SHOP场景中, GMT的跨视角关联结果不够稳定, 而GTAT能更有效地应对外观差异与尺度变化带来的挑战, 实现更准确的跨视角匹配, 整体效果优于GMT.

2.5 复杂度分析

为了明确多相机在线场景中的统计口径, 在VisionTrack推理配置下对比GMT和GTAT的参数量、浮点运算量和推理速度.输入图像缩放至1 280× 720, 设置摄像头数C=2, 时间窗口T=60, 全局时间总步数Tg=118, 特征维度D=1 152.考虑到在线关联开销随目标和轨迹规模动态变化, 覆盖Vision-Track数据集上全部22个测试序列, 并从每个序列的早期、中段和末段分别采样一个包含80帧的片段.去除窗口预热后, 每个片段保留21个稳定样本, 即每个序列保留63个样本, 共获得1 386个样本.再对各序列的统计结果进行帧数加权.最终得到完整时间窗口内的目标特征数U=1 213.6, 历史窗口内轨迹数量J=18.1.

在上述统计条件下, 全局轨迹语义编码模块(GTSE)对J条历史轨迹分别进行自注意力编码, 复杂度为O(J(TgD2+T g2D)).全局轨迹感知增强模块(GTAE)将完整时间窗口内的U个目标特征按视角组织为查询, 并使用J个全局轨迹表示作为各视角的键和值, 复杂度为O((U+CJ)D2+UJD).

按照与GMT相同的有效推理模块统计口径, GTSE、GTAE参数量为18.6 M, 加上GMT原先46.0 M的参数量, 最后GTAT的总参数量为64.6 M.在VisionTrack的统计条件下, GTSE、GTAE分别产生17.8 G和9.9 G的浮点运算量, 相比GMT的227.6 G, GTAT增加27.7 G的浮点运算量, 总浮点运算量为255.3 G.推理速度由GMT的14.6帧/秒降至12.0帧/秒.

2.6 消融实验

WildTrack数据集上目标分布密集、视角数量多、遮挡频繁、场景难度高.为了直观验证GTAT中各模块的实际作用, 在该数据集上开展消融实验.基线方法为GMT, 再分别引入全局轨迹感知模块(GTAM)和全局轨迹一致性损失(GTC), 移除掩码约束.相应消融实验结果如表4所示.

表4 各模块在WildTrack数据集上的消融实验结果 Table 4 Ablation experiment results of different modules on WildTrack dataset %

由表4可见, 仅引入GTAM后, 跨视角跟踪性能得到明显提升, CVMA指标提升5.1%, CVIDF1指标提升2.4%, 充分表明将全局轨迹级信息注入关联特征的有效性.在此基础上引入GTC, 单视角与跨视角关联性能均获得进一步提升, IDF1指标提升0.9%, CVIDF1指标提升0.7%, 验证通过额外约束轨迹级表征与目标级关联特征的匹配关系, 能有效实现全局轨迹信息的跨时间、跨视角监督, 学习判别性更强的关联特征.移除掩码约束后, 单视角与跨视角跟踪性能均出现明显下降, 表明掩码机制能筛选有效样本、过滤无效监督噪声, 保证仅基于可观测、可匹配的样本开展学习, 是提升跟踪稳定性的关键约束之一.

为了验证GTC有助于学习更具有判别性的关联特征, 单独将GTC加入GMT, 在WildTrack数据集上的消融实验结果如表5所示.由表可见, GTC通过显式监督轨迹级表示与目标级关联特征的匹配关系, 直接强化关联特征与对应轨迹的对齐度, 提升目标特征在跨视角、跨时间匹配任务中的判别能力, 减少身份混淆.

表5 GTC对GTAT性能的影响 Table 5 Effect of GTC on GTAT performance %

为了验证GTAE中分视角交叉注意力增强设计的有效性, 在DIVOTrack数据集上, 将其与未分视角的交叉注意力增强方案开展对比实验, 结果如表6所示.

表6 分视角交叉注意力增强对GTAT性能的影响 Table 6 Effect of view-specific cross-attention enhancement on GTAT performance %

由表6可见, 采用分视角交叉注意力增强后, 各项指标均获得一定提升, 表明视角信息的解耦利用较重要:未分视角的交叉注意力会将不同视角的特征直接混合, 容易引入视角间噪声与干扰; 分视角设计能保留各视角的上下文信息, 使目标特征更精准地感知轨迹级身份语义, 强化跨视角关联能力.

为了验证GTSE使用可学习的全局轨迹令牌对全局轨迹语义编码的有效性, 在DIVOTrack数据集上对比轨迹平均池化与注意力池化, 结果如表7所示.由表可见, 相比静态单层注意力池化和无差别平均池化, 动态参与序列交互的全局轨迹令牌能建模更精准的全局轨迹表征.

表7 全局轨迹聚合策略对GTAT性能的影响 Table 7 Effect of global trajectory aggregation strategies on GTAT performance %

为了验证推理时间窗口长度对GTAT的影响, 在VisionTrack数据集上进行实验, 设定时间窗口长度为50、60、70, 相应结果如表8所示.由表可见, 随着时间窗口长度由50增至60, 各项性能均有所提升, 说明适当增加时间窗口长度能提供更充分的历史观测, 改善跟踪性能.当时间窗口长度进一步增至70时, CVIDF1指标保持不变, 其余指标均出现小幅下降.这可能是因为更长的时间窗口引入更多的冗余历史观测和更大的外观变化, 同时增加计算开销.综合关联性能与计算效率, 本文最终将推理时间窗口长度设为60.

表8 时间窗口长度对GTAT性能的影响 Table 8 Effect of window length on GTAT performance %
3 结束语

现有全局跟踪方法GMT仅对历史时间窗口内的关联特征进行自注意力编码, 同时将全局轨迹简单当作历史目标特征集合, 缺乏对轨迹级身份语义的显式建模与一致性约束.针对该问题, 本文提出基于全局轨迹感知的多相机多目标跟踪方法(GTAT).首先, 设计全局轨迹感知模块(GTAM), 先依托全局轨迹语义编码模块(GTSE), 聚合每条全局轨迹对应的轨迹级表示, 再设计全局轨迹感知增强模块(GTAE), 按视角对时间窗内的目标级关联特征完成交叉注意力增强.然后, 将融入全局轨迹语义的关联特征输入全局轨迹关联模块(GTA), 实现具备全局轨迹感知能力的多相机多目标跟踪.最后, 构建全局轨迹一致性损失(GTC), 聚焦轨迹与目标之间的匹配关系, 对全局轨迹表示进行显式约束, 有效提升全局轨迹表示的身份一致性建模能力与关联特征的判别能力.在6个公开多相机多目标跟踪数据集上的实验表明, GTAT在引入一定参数与计算开销的情况下, 各项指标取得一定提升.

虽然GTAT有效挖掘全局轨迹语义, 但多相机多目标跟踪场景中的轨迹级信息仍有待进一步挖掘.本文研究以全局轨迹级语义建模为核心, 尚未充分挖掘不同视角独有的轨迹语义特征.事实上, 不同视角下的目标轨迹在可视范围、运动规律、外观形态及遮挡状态等方面往往存在一定差异, 这类视角专属轨迹信息可进一步为跨视角目标关联提供有效约束.因此, 构建全局轨迹语义与视角专属轨迹语义的高效协同建模机制, 使模型在保障跨视角身份一致性的前提下, 自适应利用不同视角的数据特性, 是未来值得关注的重要研究方向.

本文责任编委 高隽

Recommended by Associate Editor GAO Jun

参考文献
[1] Li Y J, Weng X S, Xu Y, et al. Visio-temporal attention for multi-camera multi-target association[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Washington, USA: IEEE, 2021: 9814-9824. [本文引用:1]
[2] Li D G, Wei X, Hong X P, et al. Infrared-visible cross-modal person re-identification with an X modality[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2020, 34(4): 4610-4617. [本文引用:1]
[3] Yogamani S, Hughes C, Horgan J, et al. WoodScape: a multi-task, multi-camera fisheye dataset for autonomous driving[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Washington, USA: IEEE, 2019: 9307-9317. [本文引用:1]
[4] Ma Z H, Wei X, Hong X P, et al. Bayesian loss for crowd count esti-mation with point supervision[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Washington, USA: IEEE, 2019: 6141-6150. [本文引用:1]
[5] 濮志远, 罗素云. 复杂交通场景下的目标检测方法[J]. 信息与控制, 2025, 54(4): 632-643.
(Pu Z Y, Luo S Y. Object detection method in complex traffic scenarios[J]. Information and Control, 2025, 54(4): 632-643. ) [本文引用:1]
[6] 陈涛, 肖杰, 张雨飞, 等. 多相似度矩阵融合的多目标跟踪算法[J]. 小型微型计算机系统, 2026, 47(2): 428-434.
(Chen T, Xiao J, Zhang Y F, et al. Multi-object tracking algorithm based on multi-similarity matrix fusion[J]. Journal of Chinese Computer Systems, 2026, 47(2): 428-434. ) [本文引用:1]
[7] Xu Y L, Liu X B, Qin L, et al. Cross-view people tracking by scene-centered spatio-temporal parsing[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2017, 31(1): 4299-4305. [本文引用:1]
[8] Han R Z, Feng W, Zhao J W, et al. Complementary-view multiple human tracking[J]. Proceedings of the AAAI Conference on Artificial Intelligence, 2020, 34(7): 10917-10924. [本文引用:1]
[9] 赵永祥, 张国庆, 李灯华, 等. 一种用于监测奶牛的高精度跟踪定位方法[J]. 信息与控制, 2025, 54(1): 137-149.
(Zhao Y X, Zhang G Q, Li D H, et al. A high-precision tracking and localization method for monitoring cows[J]. Information and Control, 2025, 54(1): 137-149) [本文引用:1]
[10] 乔羽, 范慧杰, 付生鹏, 等. 高空无人机跨场景多目标跟踪方法[J]. 小型微型计算机系统, 2025, 46(8): 1993-1999.
(Qiao Y, Fan H J, Fu S P, et al. High-altitude unmanned aerial vehicle multi-target tracking method[J]. Journal of Chinese Computer Systems, 2025, 46(8): 1993-1999. ) [本文引用:1]
[11] Zhang Y F, Sun P Z, Jiang Y, et al. ByteTrack: multi-object tracking by associating every detection box[C]//Proceedings of the 17th European Conference on Computer Vision. Berlin, Germany: Springer, 2022: 1-21. [本文引用:1]
[12] Specker A. OCMCTrack: online multi-target multi-camera tracking with corrective matching cascade[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Washington, USA: IEEE, 2024: 7236-7244. [本文引用:1]
[13] Quach K G, Nguyen P, Le H, et al. DyGLIP: a dynamic graph model with link prediction for accurate multi-camera multiple object tracking[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2021: 13779-13788. [本文引用:1]
[14] He Y H, Wei X, Hong X P, et al. Multi-target multi-camera tracking by tracklet-to-target assignment[J]. IEEE Transactions on Image Processing, 2020, 29: 5191-5205. [本文引用:1]
[15] Gan Y Y, Han R Z, Yin L Q, et al. Self-supervised multi-view multi-human association and tracking[C]//Proceedings of the 29th ACM International Conference on Multimedia. New York, USA: ACM, 2021: 282-290. [本文引用:3]
[16] Feng W, Wang F F, Han R Z, et al. Unveiling the power of self-supervision for multi-view multi-human association and tracking[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, 47(1): 351-368. [本文引用:3]
[17] Liu Z H, Shang Y Y, Li T M, et al. Robust multi-drone multi-target tracking to resolve target occlusion: a benchmark[J]. IEEE Transactions on Multimedia, 2023, 25: 1462-1476. [本文引用:1]
[18] Hao S Y, Liu P Y, Zhan Y B, et al. DIVOTrack: a novel dataset and baseline method for cross-view multi-object tracking in diverse open scenes[J]. International Journal of Computer Vision, 2024, 132(4): 1075-1090. [本文引用:4]
[19] Amosa T I, Sebastian P, Izhar L I, et al. Multi-camera multi-object tracking: a review of current trends and future advances[J/OL]. Neurocomputing, 2023, 552. https://doi.org/10.1016/j.neucom.2023.126558. [本文引用:1]
[20] Zhen Y H, Xu M Y, Wang Q, et al. GMT: effective global framework for multi-camera multi-target tracking[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2026: 28201-28210. [本文引用:5]
[21] Fan H J, Qiao Y, Zhen Y H, et al. All-day multi-camera multi-target tracking[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2025: 16892-16901. [本文引用:1]
[22] 范慧杰, 郁航, 赵颖畅, 等. 可见光红外跨模态行人重识别方法综述[J]. 信息与控制, 2025, 54(1): 50-65.
(Fan H J, Yu H, Zhao Y C, et al. Review of visual-infrared cross-modal person re-identification methods[J]. Information and Control, 2025, 54(1): 50-65. ) [本文引用:2]
[23] Yu F, Wang D Q, Shelhamer E, et al. Deep layer aggregation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2018: 2403-2412. [本文引用:1]
[24] Duan K W, Bai S, Xie L X, et al. CenterNet: keypoint triplets for object detection[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision. Washington, USA: IEEE, 2019: 6568-6577. [本文引用:1]
[25] Shao S, Zhao Z J, Li B X, et al. CrowdHuman: a benchmark for detecting human in a crowd[EB/OL]. [2026-05-12]. https://arxiv.org/abs/1805.00123. [本文引用:1]
[26] Fleuret F, Berclaz J, Lengagne R, et al. Multicamera people tra-cking with a probabilistic occupancy map[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2008, 30(2): 267-282. [本文引用:1]
[27] Xu Y L, Liu X B, Liu Y, et al. Multi-view people tracking via hierar-chical trajectory composition[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2016: 4256-4265. [本文引用:1]
[28] Chavdarova T, Baqué P, Bouquet S, et al. WILDTRACK: a multi-camera HD dataset for dense unscripted pedestrian detection[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Washington, USA: IEEE, 2018: 5030-5039. [本文引用:1]
[29] 范晓雨, 刘明华, 李文静. 无人机场景下多层次特征变换的池化Transformer跟踪算法[J]. 小型微型计算机系统, 2025, 46(11): 2578-2585.
(Fan X Y, Liu M H, Li W J. Multi-level feature transformation of pooling transformer for UAV object tracking[J]. Journal of Chinese Computer Systems, 2025, 46(11): 2578-2585. ) [本文引用:1]
[30] Bernardin K, Stiefelhagen R. Evaluating multiple object tracking performance: the CLEAR MOT metrics[J/OL]. EURASIP Journal on Image and Video Processing, 2008, 2008. https://link.springer.com/content/pdf/10.1155/2008/246309.pdf [本文引用:1]
[31] Luiten J, Ošep A, Dendorfer P, et al. HOTA: a higher order me-tric for evaluating multi-object tracking[J]. International Journal of Computer Vision, 2021, 129(2): 548-578. [本文引用:2]
[32] Ristani E, Solera F, Zou R, et al. Performance measures and a data set for multi-target, multi-camera tracking[C]//Proceedings of the European Conference on Computer Vision Workshops. Berlin, Germany: Springer, 2016: 17-35. [本文引用:1]
[33] Ye M, Shen J B, Lin G J, et al. Deep learning for person re-identification: a survey and outlook[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44(6): 2872-2893. [本文引用:1]
[34] Wieczorek M, Rychalska B, Dabrowski J. On the unreasonable effec-tiveness of centroids in image retrieval[C]//Proceedings of the 28th International Conference on Neural Information Processing. Berlin, Germany: Springer, 2021: 212-223. [本文引用:1]