
谢 珺,博士,副教授,主要研究方向为自然语言处理、粒计算、粗糙集、数据挖掘、机器学习.E-mail:xiejun@tyut.edu.cn.
作者简介:

吕佳琪,硕士研究生,主要研究方向为知识图谱、人工智能.E-mail:1411081028@qq.com.

王 莉,博士,教授,主要研究方向为社会计算、数据挖掘.E-mail:wangli@tyut.edu.cn.

王丹彤,硕士研究生,主要研究方向为知识图谱、推荐系统.E-mail:dantong_turbo@qq.com.

雒雄艳,硕士研究生,主要研究方向为知识图谱、推荐系统.E-mail:15386986855@163.com.
针对现有时序知识图谱补全方法难以有效建模语义与多粒度时间信息间的深层交互、缺乏对历史信息时间敏感性显式建模等问题,文中提出基于四元数表示与显式历史增强的时序知识图谱补全方法(Quaternion-Based Representation and Explicit Historical Enhancement for Temporal Knowledge Graph Completion, QR-EH).首先,将实体、关系的语义信息与多粒度时间信息映射至四元数空间,通过哈密顿乘积实现语义与时间的深层交互.然后,设计显式历史检索模块,定义时序调制机制,对历史重复事件进行加权,精准捕获具有时间敏感性的历史规律.最后,构建自适应得分融合模块,对全局时空信息与历史重复信息进行加权融合,生成最终的预测结果.在3个公开数据集上的实验表明,QR-EH能深入挖掘时序演化与历史重复规律,具有良好的泛化性和可解释性.
XIE Jun, Ph.D., associate professor. Her research interests include natural language processing, granular computing, rough sets, data mining and machine learning.
About Author:
LÜ Jiaqi, Master student. Her research interests include knowledge graphs and artificial intelligence.
WANG Li, Ph.D., professor. Her research interests include social computing and data mining.
WANG Dantong, Master student. His research interests include knowledge graphs and recommender systems.
LUO Xiongyan, Master student. Her research interests include knowledge graphs and recommender systems.
Existing temporal knowledge graph completion models struggle to effectively model the deep interactions between semantic information and multi-granularity temporal information and lack explicit the modeling of temporal sensitivity of historical information. To solve these problems, an approach for quaternion-based representation and explicit historical enhancement for temporal knowledge graph completion(QR-EH) is proposed. First, the semantic information of entities and relations, and the multi-granularity temporal information are mapped into the quaternion space. Deep interactions between semantics and time are achieved through Hamiltonian products. Then, an explicit historical retrieval module is designed. A temporal modulation mechanism is defined by this module. Time-sensitive historical patterns are accurately captured by weighting historical recurring events. Finally, an adaptive score fusion module is constructed. Global spatio-temporal information and historical recurring information are weighted and fused by this module. The final prediction results are generated. Experiments on three publicly available datasets demonstrate that QR-EH deeply mines temporal evolution and historical recurrence patterns and exhibits good generalization and interpretability.
由于现实世界中大部分事件存在时效性, 传统的静态知识图谱不能完全适应知识高频更新的场景, 因此学者们提出时序知识图谱(Temporal Know-ledge Graphs, TKGs), 引入时间维度, 反映事件动态演变状态[1, 2].相比静态知识图谱, 时序知识图谱具有更高的实时性和动态性, 已被广泛应用于智能问答[3]和推荐系统[4]等领域.然而TKGs中大量隐含的事件未能被充分挖掘, 导致本身存在不完整性[5], 限制自身在下游任务中的推理能力, 因此学者们提出时序知识图谱补全(Temporal Knowledge Graph Completion, TKGC)的方法.
给定特定时间跨度的知识图谱, 根据是否预测未来事件, TKGC可分为插值法和外推法[6].本文聚焦时序知识图谱外推补全任务, 旨在根据历史信息对未来时间戳下四元组中缺失部分进行预测.然而现有方法在完成这一任务时仍面临两大挑战.
1)时序演化规律建模不充分.时序知识图谱中同一实体或关系的语义表示会随时间戳的推移而发生演化, 且每个时间戳均包含年、月、日等多粒度特征.现有方法, 如tTransE[7]、TComplEx[8]等, 大多将时间信息视为独立嵌入, 并将其与语义信息拼接或相乘, 这种分离式处理虽然保持独立性, 但语义特征与时间特征间缺乏深层交互, 无法有效刻画事件的演化规律.
2)历史重复模式利用不充分且可解释性较差.时序知识图谱中许多事件在时间轴上呈现周期性模式或重复性模式, 对未来事件预测具有重要价值.现有基于神经网络的外推方法, 如TeMP(Temporal Message Passing)[9]、TiPNN(Temporal Inductive Path Neural Network)[10]等, 虽已通过隐式建模考虑历史重复事件的影响, 但缺乏对全局时间的显式建模, 忽略历史信息的时间敏感性.
针对上述问题, 本文提出基于四元数表示与显式历史增强的时序知识图谱补全方法(Quaternion-Based Representation and Explicit Historical Enhance-ment for Temporal Knowledge Graph Completion, QR-EH).
首先, 构建四元数统一表示学习模块(Quater-nion-Based Representation Module, QR), 将实体、关系的语义嵌入分别与多粒度时间嵌入编码至四元数空间的1个实部及3个虚部, 构成统一的时空表示, 通过哈密顿乘积捕捉语义信息与多粒度时间信息间的深层交互.
然后, 设计显式历史检索模块(Explicit History Retrieval Module, EHR), 针对性查询检索相关历史重复事件, 并定义时序调制机制(Timing Modulation Mechanism, TMM), 动态调整不同历史重复事件的重要性权重.
最后, 提出自适应得分融合模块, 动态计算历史增强得分系数, 将历史重复信息整合至预测过程中, 生成最终预测结果.在3个公开数据集上的实验表明, QR-EH能深入挖掘时序演化与历史重复规律, 具有良好的泛化性和可解释性.
时序知识图谱插值补全任务旨在将时间信息嵌入事件表示中, 预测时间跨度内TKGs中缺失的实体或关系, 代表性方法有tTransE[7]、TA-DistMult[11]和ATiSE[12]等.时序知识图谱外推补全任务旨在根据历史信息预测时间跨度外时序知识图谱中缺失的实体或关系, 代表性方法有TeMP[9]、TiPNN[10]、RE-NET(Recurrent Event Network)[13]等.从方法实现的核心技术来看, 现有研究主要围绕如下3个方向展开.
基于翻译与张量分解的时序知识图谱补全方法的原理是将时间戳视为独立特征, 通过加法、乘法或拼接等操作, 与实体和关系表示进行融合.Jiang等[7]提出tTransE, 首次在三元组中加入时间信息, 通过时间约束对关系的演化过程进行建模, 但仅能建模固定时间点的关系, 无法实现跨时间推理.针对此问题, Dasgupta等[14]提出HyTE(Hyperplane-Based Temporally Aware Knowledge Graph Embedding), 将每个时间戳看作不同的超平面, 显式地将三元组投射至不同时间戳的超平面中, 捕捉实体或关系随时间变化的动态信息.在此基础上, Xu等[12]考虑时间具有周期性等特征, 提出ATiSE, 将时间序列分解为趋势、周期和随机三个分量, 有效建模实体和关系的随机变化趋势.
此类方法计算简单高效, 但在捕捉语义信息与时间信息之间的复杂交互时存在局限.
基于神经网络的时序知识图谱补全方法利用深度神经网络自适应地学习时序知识图谱中实体、关系的语义信息与时间信息之间的交互.
Garcí a-Durá n等[11]提出TA-DistMult和TA-Tra-nsE, 采用长短期记忆网络(Long Short-Term Me-mory, LSTM)[15]编码关系和时间序列, 得到时间感知的关系表示.针对不同时间粒度对应不同语义信息这一问题, Geng等[16]提出LTGQ(Learning Tem-poral Granularity with Quadruplet Networks), 采用递归神经网络建模年、月、日的顺序依赖关系.Zhang等[17]提出LGRe(Learning Granularity Representation), 使用多层卷积神经网络捕捉实体、关系和时间戳在不同粒度上的交互.
为了整合历史信息以增强预测的准确性, Wu等[9]提出TeMP, 采用R-GCNs(Relational Graph Con-volutional Networks)[18]学习固定历史窗口内的实体邻域信息, 并引入时间衰减机制和门控循环单元, 整合跨时间的实体表示.Jin等[13]提出RE-NET, 使用RNN(Recurrent Neural Network)[19]编码器动态更新时间信息, 通过邻域聚合器捕获事件之间的局部依赖关系.Dong等[10]提出TiPNN, 构建统一的历史时序图, 通过路径推理捕捉历史事件之间的联系.Zhu等[20]提出CyGNet(Temporal Copy-Generation Net-work), 通过复制和生成双模式推理, 结合历史词汇表与完整词汇表, 预测未来事件.
上述方法仅对历史事件进行单一特征建模, 忽略事件的顺序性、重复性和周期性, 为了解决此问题, Ouyang等[21]提出RLGNet(Repeating-Local-Glo-bal History Network), 设计重复历史模块, 识别和利用历史重复事件, 提高预测准确性.
尽管上述方法取得不错的进展, 但神经网络的性能仍依赖训练数据的质量, 可解释性较差.
四元数[22]是哈密顿提出的一种超复数, 由1个实部和3个虚部组成, 在计算机图形学、机器人等领域具有广泛应用.近年来, 为了更好地捕捉时序知识图谱中复杂结构和演化模式, 研究者们将四元数引入知识图谱嵌入, 通过四元数旋转操作建模实体和关系之间的复杂交互[23].Chen等[24]提出RotateQVS(Rotations in Quaternion Vector Space), 将时间戳编码为单位四元数, 通过四元数旋转建模实体嵌入的时间演化过程, 同时采用平移式约束捕捉多种关系模式.为了区分同一实体或关系在不同时间下的表示, Zhang等[25]提出TLT-KGE(Timeline-Traced Know-ledge Graph Embedding), 将实体和关系的语义嵌入与时间嵌入融合为四元数向量, 保持其结构上相互独立, 同时通过时间窗口内的参数共享机制增强时间段内事件的关联性.
为了有效建模时序知识图谱中的所有关系模式, Yu等[26]提出ComTR(Combining Translation and Rotation), 引入对偶四元数表示实体、关系和时间戳, 利用对偶四元数乘法结合旋转和平移操作, 几何解释性较强.类似地, Guo等[27]提出EHPR(Evolu-tionary Hierarchy Perception Representation), 在四元数哈密顿乘积旋转框架上引入模长层级因子, 刻画实体对间关系类型的层次演化.
为了进一步增强实体、关系和时间戳的交互, Yu等[28]提出MTE(Multi Transformation of Entities in Quaternion Vector Space), 将实体嵌入3D空间中, 构建时间戳特定的坐标系, 并为每个关系学习一对实体关系感知的四元数向量, 有效捕捉时间敏感性, 实现丰富的特征交互.
上述方法虽在建模时间与语义信息交互方面取得进展, 但在时序信息融合的充分性与历史依赖建模的可解释性上仍存在局限.
本文提出基于四元数表示与显式历史增强的时序知识图谱补全方法(QR-EH), 整体架构如图1所示.QR-EH主要由如下3部分组成.
1)四元数统一表示学习模块(QR).将实体、关系的语义信息分别嵌入四元数实部, 年、月、日多粒度时间信息嵌入虚部, 通过哈密顿乘积建模三者之间的复杂交互.
2)显式历史检索模块(EHR).针对目标查询检索相关的历史重复尾实体集合, 计算时序调制权重, 量化历史信息对当前预测的重要性.
3)自适应得分融合模块.定义历史增强得分系数, 动态加权全局信息与历史信息, 生成历史增强的预测表示.
给定时序知识图谱
G={G1, G2, …, GT},
其中G1, G2, …, GT分别对应时间戳1, 2, …, T下的静态知识图谱快照.每个离散静态图谱
Gt={(s, r, o, t)|s∈ ε , o∈ ε , r∈ R, t∈ T},
其中, ε 表示TKGs中实体集合, R表示TKGs中关系集合, s表示头实体, o表示尾实体, r表示两个实体间存在的关系, T表示事件发生的多粒度时间戳集合, 每个时间戳t均采用“ 年-月-日” 的标准日期格式进行存储.
TKGC的目标旨在针对查询(s, r, ?, t)或(s, ?, o, t), 根据TKGs中的已知四元组推测缺失的尾实体o或关系r.
本文添加逆向边, 扩展四元组, 对于每个(s, r, o, t), 添加(o, r-1, s, t)至TKGs中, 将(?, r, o, t)转换成(o, r-1, ?, t), 预测实体s.
2.2.1 四元数理论基础
四元数是复数的一种扩展, 由1个实部和3个虚部构成, 标准表达式如下:
Q=w+ai+bj+ck,
其中, w∈ R, a∈ R, b∈ R, c∈ R表示四元数的4个实数分量, i、j、k表示彼此正交的3个虚数单位, 分别是直角坐标系中x、y、z对应的三个基元, 满足
i2=j2=k2=-1,
i× j=k, j× i=-k.
四元数的模:
$|\boldsymbol{Q}|=|\overline{\boldsymbol{Q}}|=\sqrt{w^{2}+a^{2}+b^{2}+c^{2}} \text {. }$
四元数之间的内积运算是逐分量相乘后的和, 即
Q1· Q2=w1w2+a1a2+b1b2+c1c2,
其中
$\boldsymbol{Q}_{1}=w_{1}+a_{1} \mathrm{i}+b_{1} \mathrm{j}+c_{1} \mathrm{k}, $
$\boldsymbol{Q}_{2}=w_{2}+a_{2} \mathrm{i}+b_{2} \mathrm{j}+c_{2} \mathrm{k} . $
四元数中的乘法运算与复数乘法运算不同, 哈密顿乘积不满足交换律, 表达式如下:
$\begin{aligned} \boldsymbol{Q}_{1} \otimes \boldsymbol{Q}_{2}= & \left(w_{1} w_{2}-a_{1} a_{2}-b_{1} b_{2}-c_{1} c_{2}\right)+ \\ & \left(w_{1} a_{2}+a_{1} w_{2}+b_{1} c_{2}-c_{1} b_{2}\right) \mathrm{i}+ \\ & \left(w_{1} b_{2}-a_{1} c_{2}+b_{1} w_{2}+c_{1} a_{2}\right) \mathrm{j}+ \\ & \left(w_{1} c_{2}+a_{1} b_{2}-b_{1} a_{2}+c_{1} w_{2}\right) \mathrm{k} . \end{aligned}$
哈密顿乘积在几何上对应三维空间中的旋转合成, 相比复数空间具有更大的自由度和灵活度, 可有效捕捉各分量之间潜在的相互依赖关系.
2.2.2 四元数表示建模
时序知识图谱中的事件具有动态演化的特性, 为了有效捕获四元组的时空特征, 本文采用四元数将实体、关系的语义信息与多粒度时间信息编码至超复数空间.
为了捕捉实体和关系的静态语义特征, 为每个实体s∈ ε 和关系r∈ R分别学习一个d0维语义嵌入向量, 得到实体嵌入矩阵E∈
为了有效建模时间信息的复杂特性, 首先, 为年、月、日3个粒度分别学习基础时间嵌入ey∈
$\begin{array}{l}\boldsymbol{p}_{y}=\boldsymbol{P}_{y}\left[\left\lfloor\frac{y}{C_{\mathrm{y}}}\right\rfloor\right], \boldsymbol{p}_{m}=\boldsymbol{P}_{m}\left[\left\lfloor\frac{m}{C_{\mathrm{m}}}\right\rfloor\right], \boldsymbol{p}_{d}=\boldsymbol{P}_{d}\left[\left\lfloor\frac{d}{C_{\mathrm{d}}}\right\rfloor\right], \end{array}$
其中, Py∈
$\begin{array}{l} L_{y}=\left\lfloor\frac{y_{\max }-y_{\min }}{C_{y}}\right\rfloor+1, L_{m}=\left\lfloor\frac{12}{C_{m}}\right\rfloor+1, L_{d}=\left\lfloor\frac{a_{d}}{C_{d}}\right\rfloor+1, \end{array}$
表示各粒度的周期索引总数, ymax、ymin表示时序知识图谱中事件发生的最大年份和最小年份, ad表示事件发生月份的总天数.以本文使用的ICEWS14数据集为例, 该数据集上的所有事件均发生于2014年, 因此Ly=1, 表明ICEWS14数据集上所有事件共享同一个年周期嵌入.
最后, 通过残差连接将基础时间嵌入与周期性特征融合, 形成最终的时间表示:
ty=ey+py, tm=em+pm, td=ed+pd.
与大多数现有方法简单地将时间信息和语义信息拼接或相乘不同, QR-EH利用四元数空间的几何特性, 将实体或关系的语义信息嵌入四元数空间的实部, 多粒度时间信息分别嵌入3个虚部, 最终生成统一的四元数时空融合表示.头实体的四元数表示为:
qs=es+tyi+tmj+tdk,
关系的四元数表示为:
qr=rp+tyi+tmj+tdk,
其中, es表示头实体的初始语义嵌入向量, rp表示关系的初始语义嵌入向量.
2.2.3 哈密顿乘积融合
为了建模头实体和关系之间的动态交互, 使用哈密顿乘积实现qs与qr之间的深度融合:
$\begin{array}{l} \boldsymbol{Q}\left(s, r, t_{q}\right)= \\ \quad \boldsymbol{q}_{s} \otimes \boldsymbol{q}_{r}= \\ \quad\left(\boldsymbol{e}_{s} \odot \boldsymbol{r}_{p}-\boldsymbol{t}_{y} \odot \boldsymbol{t}_{y}-\boldsymbol{t}_{m} \odot \boldsymbol{t}_{m}-\boldsymbol{t}_{d} \odot \boldsymbol{t}_{d}\right)+ \\ \quad\left(\boldsymbol{e}_{s} \odot \boldsymbol{t}_{y}+\boldsymbol{t}_{y} \odot \boldsymbol{r}_{p}+\boldsymbol{t}_{m} \odot \boldsymbol{t}_{d}-\boldsymbol{t}_{d} \odot \boldsymbol{t}_{m}\right) \mathrm{j}+ \\ \quad\left(\boldsymbol{e}_{s} \odot \boldsymbol{t}_{m}-\boldsymbol{t}_{y} \odot \boldsymbol{t}_{d}+\boldsymbol{t}_{m} \odot \boldsymbol{r}_{p}+\boldsymbol{t}_{d} \odot \boldsymbol{t}_{y}\right) \mathrm{j}+ \\ \quad\left(\boldsymbol{e}_{s} \odot \boldsymbol{t}_{d}+\boldsymbol{t}_{y} \odot \boldsymbol{t}_{m}-\boldsymbol{t}_{m} \odot \boldsymbol{t}_{y}+\boldsymbol{t}_{d} \odot \boldsymbol{r}_{p}\right) \mathrm{k}= \\ \quad w_{3}+a_{3} \mathrm{i}+b_{3} \mathrm{j}+c_{3} \mathrm{k}, \end{array}$
其中, $\otimes$表示四元数哈密顿乘积, ☉表示逐元素相乘.
时序知识图谱中的事件往往蕴含重复的演化模式, 如某个球队在特定年份获得冠军后, 未来可能再次获得冠军.为了挖掘和利用时序知识图谱中蕴含的丰富历史信息, 本文设计显式历史检索模块(EHR).EHR核心思想如下:对于查询(s, r, ?, tq), 直接检索在tq之前发生的与查询相关的所有历史事件, 并通过时序调制机制(TMM)量化每个历史事件的重要性, 最终将历史重复信息整合至预测过程中.
具体来说, 首先, 构建基于时间戳的历史索引结构I, 该索引完全由训练集上四元组构成.对于每个四元组(s, r, o, t), 按(s, r)对进行分组, 在每个(s, r)组内按时间戳t升序存储对应的尾实体集合.这种索引结构可形式化表示如下:
I(s, r, ti), ti∈ T∶ I(s, r, (o, ti))← I(s, r, ti)∪ {o},
其中, I(s, r, ti)∪ {o}表示在时间戳ti、(s, r)对下出现的尾实体, I(s, r, (o, ti))表示累积更新后的最终历史索引.
然后, 针对查询(s, r, ?, tq), 在历史索引中找到所有满足ti< tq的时间点, 并以(s, r)为键检索对应的历史重复尾实体集合:
H={oh|(s, r, oh, ti)∈ G, ti< tq}.
集合H包含时序知识图谱中在查询时间tq之前发生的、与查询具有相同头实体s和关系r的所有历史重复事件的尾实体.
H中不同历史事件对当前预测的重要性存在显著差异, 距离当前查询时间更近的历史事件通常具有更大的参考价值, 而时间间隔较远的历史事件影响相对较弱.此外, 部分事件具有周期性规律, 如联合国年度气候大会每年举办一次、NBA每年10月至次年6月举办一次等.为了动态反映不同历史事件的重要性, 设计时序调制机制, 核心思想是根据时间间隔和周期性特征为每个历史重复尾实体分配相应权重.
对于集合H中的每个尾实体oh, 设其对应的历史事件发生时间为ti, 首先, 将查询时间tq与ti之间的时间间隔转换为连续天数:
Δ t=tq-ti.
然后, 使用三角周期编码建模时间的周期特征:
z=[Δ t; sin(ω Δ t); cos(ω Δ t)], (1)
其中, 事件的基本周期设为7天, ω =
α h=Sigmoid(uT· tanh(Wz+b)),
其中, W∈
在时序知识图谱补全任务中, 预测得分应兼顾当前全局信息和历史重复模式.当前全局信息由四元数统一表示的学习模块捕捉, 反映实体、关系和时间在语义空间中的交互.历史重复模式由显式历史检索模块捕捉, 反映历史演化规律对当前预测的影响.为了有效整合全局与历史依赖信息, 本文设计自适应得分融合模块, 动态加权全局路径得分和历史增强路径得分, 生成最终的预测结果.
1)全局路径得分.对于候选尾实体o∈ ε , 相应四元数表示如下:
qo=eo+tyi+tmj+tdk,
其中尾实体嵌入eo=E[o].计算查询表示Q(s, r, tq)与qo的四元数内积, 得到全局得分:
φ global(o|s, r, tq)=< Q(s, r, tq), qo> ,
其中< , > 表示四元数内积运算.
2)历史增强路径得分.若候选尾实体o∈ H, 则其为历史重复尾实体, 计算Q(s, r, tq)与qo的四元数内积, 并通过时序调制系数α h加权求和, 得到历史增强路径得分:
φ history(o|s, r, tq)=
若候选尾实体o∉H, 历史增强路径得分为0.
在现实世界中, 不同关系对历史事件的依赖程度往往存在显著差异, 为了动态调节全局路径得分与历史增强路径得分的权重贡献, 定义可学习的历史增强得分系数β .首先, 通过关系语义嵌入rp映射得到特征变量:
β raw=Wβ · rp+bβ ,
其中, Wβ ∈
然后, 通过Sigmoid激活函数将β raw归一化至(0, 1)区间, 得到历史增强得分系数:
β =Sigmoid(β raw).
最后, 利用β 对两种得分进行加权融合, 得到候选尾实体o的最终预测得分:
$\operatorname{Score}\left(o \mid s, r, t_{q}\right)= \beta \varphi_{\text {history }}\left(o \mid s, r, t_{q}\right)+ (1-\beta) \varphi_{\text {global }}\left(o \mid s, r, t_{q}\right) . $
本文采用多分类交叉熵损失函数作为主损失函数, 并引入L2正则化防止过拟合.总损失函数定义:
L=Lfit+Lreg,
其中,
$L_{\mathrm{fit}}=-\frac{1}{|\Omega|} \sum_{i=1}^{|\Omega|} \ln \left(\frac{\exp \left(\operatorname{Score}\left(o_{i}^{+} \ \ \mid s, r, t_{q}\right)\right)}{\exp \left(\operatorname{Score}\left(o_{i}^{+} \ \ \mid s, r, t_{q}\right)\right)+\sum_{j=1}^{K} \ \ \exp \left(\operatorname{Score}\left(o_{(i, j)}^{-} \ \ \ \mid s, r, t_{q}\right)\right)}\ \ \ \ \right), $
表示二元交叉熵损失,
$L_{\mathrm{reg}}=\lambda \sum_{\boldsymbol{\theta} \in \boldsymbol{\Theta}_{\mathrm{emb}}}\ \ \|\boldsymbol{\theta}\|_{2}^{2}, $
表示L2正则化损失, Ω 表示训练集上正样本集合, Score(
本文所有实验均在同一台服务器上完成计算, 具体实验环境如下:Intel(R)Xeon(R)Silver 4210R, CPU@2.40 GHz; 使用NVIDIA GeForce RTX 4090 GPU; 机器显存大小为24 GB; 操作系统为Ubuntu 18.04; Python版本为3.11; PyTorch版本为2.2.2; CUDA版本为12.3.
实验采用平均倒数排名(Mean Reciprocal Rank, MRR)和前k名命中率Hits@k(k=1, 3, 10)作为评价指标.具体公式如下:
$M R R=\frac{1}{|G|} \sum_{i=1}^{|G|} \frac{1}{\operatorname{rank}_{\ i}}, $
$\text { Hits@ } k=\frac{1}{|G|} \sum_{i=1}^{|G|} \text { indicator }\left(\operatorname{rank}_{i} \leqslant k\right), $
其中, |G|表示四元组集合个数, ranki表示第i个查询四元组中正确答案的预测排名, indicator(· )函数的条件为真, 函数值为1, 否则为0.MRR与Hits@k的值越大, 方法性能越优.
在训练优化过程中, 为了保证梯度下降的稳定收敛, 采用Adam(Adaptive Moment Estimation)优化器, 学习率设为0.001, 批量大小设为1 000.在此基础上, 采用网格搜索对核心超参数进行寻优, 搜索空间参数设置如下:嵌入维度d0=800, 1 000, 1 200, 1 400, 1 600; 正则化系数λ =1× 10-4, 3× 10-4, 5× 10-4, 1× 10-3, 3× 10-3, 5× 10-3.在负采样数量K的设置上, 考虑到不同数据集的密度差异, 实体规模较大的ICEWS14、ICEWS05-15数据集的负样本数量均设为100, 而对于实体数量较少且密度较高的GDELT数据集, 为了避免随机采样大量潜在的真实事实引发的梯度冲突, 负样本数量设为20.
本文选取如下3个基准数据集验证QR-EH的有效性和泛化性.来自综合危机预警系统(ICEWS)的2个事件数据集:ICEWS14(https://huggingface.co/datasets/linxy/ICEWS14)和ICEWS05-15(https://huggingface.co/datasets/linxy/ICEWS05_15),以及通用数据集GDELT(https://huggingface.co/datasets/linxy/GDELT).ICEWS是由美国国防部开发的事件数据库, 记录全球政治、军事、外交等事件, 其中ICEWS-14数据集时间跨度较短, 事件密度相对集中.ICEWS05-15数据集时间跨度为10年, 包含丰富的时序演化模式.GDELT是全球事件、语言和语调数据库, 呈现出极高的事件密集度.在实验中采用的GDELT数据集为外推任务中广泛沿用的基准版本[31].该版本将时间戳统一聚合至日级别, 即事件四元组均采用“ 年-月-日” 的存储格式.本文所有的对比方法均采用该统一粒度的数据集进行训练与测试, 确保评估环境的绝对公平.由于QR-EH执行外推补全任务, 因此本文采取与文献[29]相同的数据集分割策略:将数据集按时间顺序划分为训练集、验证集和测试集, 时间条件严格满足训练集数据时间< 验证集数据时间< 测试集数据时间.3个数据集的详细信息如表1所示.
| 表1 实验数据集 Table 1 Experimental datasets |
本文统计3个数据集的验证集和测试集上重复事件的比例, 结果如表2所示.
| 表2 各数据集上2种事件比例值 Table 2 Proportions of 2 types of events on different datasets % |
具体来说, 对于验证集或测试集上任意一个查询事件(s, r, o, t), 若训练集上存在至少一个四元组(s, r, o, t'), 满足t'< t, 则称该事件为重复事件.由表2可看出, 3个数据集上均包含大量重复事件, GDELT数据集上重复比例最高, 充分说明历史事件信息在时序知识图谱推理任务中的重要性.
本文分别选取如下12种前沿方法进行对比实验, 评估QR-EH在TKGC任务中的有效性与优越性.具体对比方法如下.
1)TiPNN[10].将时间戳融入路径结构, 通过路径聚合捕捉动态关系模式.
2)RE-NET[13].基于RNN编码历史事件序列, 使用邻域聚合器捕捉局部依赖.
3)CyGNet[20].通过时间感知的复制生成机制显式建模时序事实的重复规律.
4)RLGNet[21].采用基于递归神经网络和多层感知器的体系结构, 补充单步推理能力和多步推理能力.
5)TiRGN(Time-Guided Recurrent Graph Net-work)[30].通过局部-全局编码器及周期性时间解码器捕捉历史信息.
6)Re-Temp(Relation-Aware Temporal Represen-tation Learning)[31].通过关系感知的跳跃信息流机制过滤无关历史信息, 在此基础上进行推理.
7)DyMemR(Temporal Knowledge Graph Reaso-ning Model with Dynamic Memory Enhancement)[32].利用记忆网络与增量更新机制捕捉长期历史依赖信息, 在此基础上进行推理.
8)融合局部-全局历史模式与历史知识频率的时序知识图谱补全方法(Temporal Knowledge Graph Completion Algorithm Combining Local-Global Histori-cal Patterns and Historical Knowledge Frequency, LGH- HKF)[33].使用双循环机制编码子图序列, 全局编码器捕捉重复模式.
9)xERTE[34].采用多头注意力构建上下文, 通过可解释路径采样增强可溯性.
10)RG-TGA(Temporal Knowledge Graph Reaso-ning Based on Relation Graphs and Time-Guided Atten-tion)[35].引入基于时间跨度的注意力机制, 为重复事实分配不同权重.
11)LMS(Learning Multi-graph Structure)[36].通过多图结构捕捉时间序列的演化模式及时间戳的周期语义依赖.
12)TRCL(Temporal Reasoning with Recurrent En-coding and Contrastive Learning)[37].通过全局历史矩阵解释重复发生的历史事件, 采用对比学习减少历史事实对未来事件预测的干扰.
在3个公开数据集上进行对比实验, 相应指标值如表3所示.表中黑体数字表示最优值, 斜体数字表示次优值.由表可看出, QR-EH在ICEWS14、ICEWS05-15数据集上的MRR值分别达到0.492和0.578, 相比次优的Re-Temp, MRR值分别提升1.2%和1.5%.
| 表3 各方法在3个公开数据集上的指标值 Table 3 Metric values of different methods on three public datasets |
尽管CyGNet、TiRGN等专门设计用于捕捉历史模式的方法能较好地捕捉宏观重复规律, 但其本质上仍依赖静态的事件发生频率统计, 缺乏对历史信息时间敏感性的显式建模.相比之下, QR-EH设计的显式历史检索模块(EHR)不仅能精准召回历史重复信息, 而且通过结合时间间隔衰减与周期性特征的时序调制机制, 动态量化不同历史事件的重要性, 显著提升对未来特定时间戳事件的命中率.此外, 相比当前表现次优的Re-Temp, QR-EH在Hits@1指标上提升尤为明显, 这是因为本文构建的四元数统一表示学习模块(QR)通过超复数空间的哈密顿乘积实现实体、关系语义与多粒度时间嵌入在几何空间内的深层非线性交互, 能精准预测正确的未来候选尾实体.
尽管QR-EH在多数指标上表现出色, 但在事件高度密集的GDELT数据集上, 性能仍略逊于Re-Temp与DyMemR.这是因为本文的EHR基于实体-关系对的精确匹配召回历史事件, 在面对GDELT数据集上大量语义相近但关系存在细微差异的事件时, 容易引入与当前查询弱相关的噪声历史.相比之下, Re-Temp通过关系感知的跳跃信息流, 自适应过滤无关时序噪声并捕捉跨层次的关系演化路径, 而DyMemR的动态记忆更新机制可实时迭代实体表示, 适配高频数据的快速变化, 因此表现出略微领先的优势.尽管如此, 在GDELT数据集上, QR-EH凭借四元数空间强大的时空几何表达能力, 在各项指标上仍大幅领先于CyGNet、TiRGN等传统历史建模方法, 表明全局语义表示与显式历史增强结合的方法在处理大规模外推预测时仍具备极强的泛化性.
本文设置嵌入维度d0=800, 1 000, 1 200, 1 400, 1 600, 进行参数敏感性实验, 通过MRR指标评估不同嵌入维度下的方法性能, 结果如表4所示, 表中黑体数字表示最优值.
| 表4 d0对QR-EH性能的影响 Table 4 Effect of d0 on QR-EH performance |
由表4可看出, 随着d0的增加, QR-EH性能均呈现先上升后下降的趋势.当d0=800时, 四元数表示空间过于狭窄, 导致QR-EH无法充分编码实体与关系的多粒度时序演化特征, 从而产生结构性欠拟合问题.对于数据规模相对集中的ICEWS14、ICEWS05-15数据集, 当d0=1 200时, QR-EH性能达到最优, 继续增加d0容易引入冗余参数, 在产生轻微过拟合的同时增加计算开销.对于包含超过170万条训练数据的超大规模数据集GDELT, 较小的d0不足以充分编码其庞大且复杂的事件交互, 因此QR-EH性能在d0=1 500时才达到峰值.总之, 本文针对不同数据集设定相应的最优维度, 使方法在不同数据集上均能充分捕捉语义与时序信息的深层交互.
为了探究正则化系数λ 对于QR-EH性能的影响, 设置λ =1× 10-4, 3× 10-4, 5× 10-4, 1× 10-3, 3× 10-3, 5× 10-3, 相应MRR指标如图2所示.由图可看出, 不同数据集上最优λ 值存在差异.在ICEWS-14、ICEWS05-15数据集上, QR-EH在λ =1× 10-3时性能达到最优, 这是由于在长周期的外推任务中, 方法容易对训练集上的高频历史重复事实产生记忆性依赖, 适中的L2正则化约束能规范实体、关系和时间的四元数特征矩阵参数空间, 防止方法陷入局部过拟合.对于GDELT数据集, 最优λ 值降至5× 10-4, 表明在大规模且高密度的数据集上, 过强的空间约束会压制四元数哈密顿乘积对复杂非线性演化规律的深层学习能力.当λ 增至5× 10-3时, 3个数据集上QR-EH性能均出现下降, 这是因为过度的正则化会使方法无法充分学习数据中的复杂模式, 产生欠拟合.
为了探究自适应机制的有效性, 提取QR-EH在3个不同测试集上动态生成的β 平均值.ICEWS14数据集上重复事件最少, 因此QR-EH以当前全局信息为主, β 平均值约为0.32.ICEWS05-15数据集上重复事件适中, QR-EH的预测需要在历史演化规律与当前语义上下文之间取得平衡, β 平均值约为0.68.GDELT数据集上重复事件最多, QR-EH的预测几乎最大化地依赖历史重复信息性能, β 平均值约为0.84.综上所述, QR-EH能根据不同数据集的规模特性, 自适应分配历史信息与全局语义的预测权重.
为了验证QR-EH每个组件对整体性能的贡献程度, 在其它条件保持不变的情况下构建不同变体, 进行消融实验, 具体变体介绍如下.
1)w/o QR.移除四元数统一表示学习模块(QR), 将实体嵌入、关系嵌入与时间嵌入进行简单的向量拼接, 通过一个全连接层实现交互.
2)w/o EHR.移除显式历史检索模块(EHR), 完全依赖QR进行预测.
3)w/o MGT.移除年、月、日的多粒度划分, 将时间戳视为一个整体, 为其学习一个单一的时间嵌入向量, 并将其与实体、关系分别划分为两部分, 融合为四元数向量.
4)w/o TMM.移除时序调制机制(TMM), 为检索的每个历史重复尾实体分配统一的静态权重.
5)w/o PE.移除时间周期编码, 保留多粒度时间划分的同时仅使用基础时间嵌入.
在时间跨度较短的ICEWS14数据集及时间跨度较长的ICEWS05-15数据集上进行实验, 结果如表5所示, 表中黑体数字表示最优值.由表可见, 移除QR之后方法在2个数据集上的性能均出现大幅下降, 表明将实体、关系与时间嵌入进行简单的向量拼接并通过全连接层交互, 无法有效捕捉时空特征间复杂的非线性依赖.相比之下, 基于哈密顿乘积的四元数统一表示学习模块利用实部与虚部的交叉乘法, 能更有效地建模实体、关系与时间之间复杂的深层交互.移除EHR之后方法性能损失最严重, 这是因为去除EHR后, 方法不再利用任何历史重复信息, 仅依赖全局语义嵌入进行预测, 导致其精准定位正确答案的能力受限.由此进一步表明在处理高重复率的预测任务时, 显式利用历史重复信息对提升预测准确性至关重要.对于时间跨度较大的数据集ICEWS05-15, 重复事件占比更高, 因此依赖历史信息的程度更强, 移除EHR后性能损失也更显著.
| 表5 各模块消融实验结果 Table 5 Ablation experiment results of different modules |
对于时间跨度仅为1年的ICEWS14数据集, 移除MGT导致MRR指标下降1.1%; 对于时间跨度长达11年的ICEWS05-15数据集, 移除MGT导致MRR指标下降2.7%.这表明相比单一时间戳嵌入, 将时间分解为多粒度进行编码能提供更丰富的时序上下文信息, 有助于进行更精细的推理.尤其是对于长时间跨度的数据, 不同粒度的周期性规律能使方法更精确地定位事件发生的时间模式.移除TMM后, 在ICEWS14、ICEWS05-15数据集上的MRR指标分别减少2.0%和3.6%, 这是因为真实世界的历史事件对未来的影响并非完全一致, 而TMM通过时序调制机制精准量化不同历史事件对当前预测的重要性, 相比无差别的平均权重更符合客观规律.此外, 移除PE后方法性能也均产生不同幅度的下降, 这是因为2个数据集具有明显的周期性, 在基础时间嵌入上叠加周期性特征有助于方法捕捉事件的周期性规律, 提升时间表示的完备性.
为了更好地刻画时序知识图谱中事件的演化规律, 对3个数据集进行周度事件分布统计及时间序列自相关分析.
周度指人类社会政治活动以周一至周日7天为单位循环的规律, 周度事件分布统计展示数据集上的事件在工作日和周末的分布情况.ICEWS14数据集上工作日事件占比83.14%, 周末事件占比16.86%; ICEWS05-15数据集上工作日事件占比83.22%, 周末事件占比16.78%; GDELT数据集上工作日事件占比80.89%, 周末事件占比19.11%.这是因为3个数据集上的事件大多为国际性政治事件, 具有明显的社会活动周期特征, 基于这一特征3个数据集均呈现出显著的周度周期性, 为式(1)的三角周期编码提供强大的数据支撑.
计算时间序列自相关函数(Autocorrelation Fun-ction, ACF)得出自相关分析图.首先定义每日事件发生的总频次序列
X={x1, x2, …, xt, …xT},
其中, 数据集上时间跨度为T天, xt表示在第t天发生的事件总频次, 对于无事件发生的日期进行零值填充处理, 保证时间序列的时序连续性.然后, 为了衡量事件发生频率随时间推移的历史重复度, 计算序列X在不同滞后天数k下的皮尔逊自相关系数:
其中
为了剔除随机波动, 设置显著性相关阈值为0.3.由图3可看出, 每滞后7天曲线均出现一个明显的峰值, 自相关系数远高于显著性阈值, 尤其是对于高频数据集GDELT, 在宏观上依然受到周度规律的约束, 由此表明3个数据集上的事件均存在显著的周期性, 这也验证本文对时间进行周期编码的必要性.此外, 虽然自相关分析图中峰值很高, 但随着滞后天数的增加, 峰值呈现衰减趋势, 表明近期的历史事件比久远的历史事件对预测的影响程度更大, 由此验证本文构建时序调制机制的必要性.
考虑到现实世界中事件演化的复杂性, 本文构建可学习周期及多周期建模两种变体, 并在ICEWS14数据集上进行对比实验, 探讨不同周期建模机制对方法性能的影响.其中, 可学习周期将周期频率ω 设为随梯度更新的可学习参数, 而多周期建模则在式(1)特征拼接时同时引入1天、7天和30天的多维度三角周期特征.
不同周期建模机制的指标值如表6所示, 表中黑体数字表示最优值.由表可知, 可学习周期的MRR值低于固定周期, 这是因为三角函数具有周期性振荡的特征, 所以在优化频率参数时极易陷入局部最优解.多周期建模性能最优, MRR值比固定周期提升2.1%, 表明融合多尺度的宏观与微观周期可为显式历史检索模块提供更完整的时序上下文信息, 但增加前馈神经网络的输入维度和参数量.因此, 考虑到计算效率与参数规模的平衡, 本文在时间序列自相关分析的基础上将基本周期固定为7天.
| 表6 不同周期建模机制对比结果 Table 6 Comparison of different periodic modeling mechanisms |
为了全面评估QR-EH的计算效率, 从空间复杂度、时间复杂度及实际运行效率三个维度上进行分析.
1)空间复杂度.QR-EH的存储开销主要由四元数嵌入矩阵和历史索引结构两部分构成.时序知识图谱中实体总数为|ε |, 关系总数为|R|, 多粒度时间戳集合大小分别为Ny, Nm, Nd, 基础嵌入维度为d0.QR-EH将实体与关系的语义映射为实部, 参数量为d0(|ε |+|R|), 将多粒度时间映射为共享的3个虚部, 参数量为d0(Ny+Nm+Nd).因此嵌入层参数的空间复杂度为
O(d0(|ε |+|R|+Ny+Nm+Nd)).
此外, 历史索引结构的空间复杂度取决于训练集上四元组的数量|Gtrain|, 空间复杂度为O(|Gtrain|).因此, QR-EH的总体空间复杂度为
O(d0(|ε |+
相比传统方法, QR-EH在四元数空间共享动态时间虚部, 以低内存开销换取更强大的几何时空表达能力.
2)时间复杂度.对于任意目标查询(s, r, ?, tq), QR-EH需要计算其与所有候选尾实体的得分.在四元数统一表示学习模块中, 一次哈密顿乘积需要进行4d0次实数乘法和3d0次加法, 计算复杂度为实数空间向量内积的4倍, 因此全局得分计算的时间复杂度为O(4d0|ε |).在显式历史检索模块中, 基于历史索引检索历史重复尾实体的时间复杂度为O(1).假设检索的历史重复实体集合大小为|Oh|, 则时序调制机制计算的时间复杂度为O(|Oh|dh), 其中dh表示隐藏层维度.自适应得分融合模块对全局得分与历史增强得分进行线性加权, 时间复杂度为O(|ε |).由于|Oh|< < |ε |, 因此QR-EH总体时间复杂度仍由全局得分计算主导, 近似为O(d0|ε |).
3)实际运行效率.在相同的硬件环境下, 在ICEWS14数据集上, 选取RE-NET[13]、CyGNet[20]、Re-Temp[31]与QR-EH进行效率对比实验, 对比指标包括模型参数量、单轮训练时间及验证推理时间, 结果如表7所示.由表可见, 在单轮训练时间上, QR-EH仅需35.73 s, 大幅优于受限于循环神经网络固有串行计算机制的RE-NET.在验证推理阶段, Re-Temp由于将历史信息截断为固定窗口且仅依赖底层的稀疏矩阵乘法, 推理速度最快.CyGNet同样侧重于对历史事件的检索, 但由于其需要复制整个实体空间, 生成双模式概率映射, 导致参数规模较大, 在推理时产生严重的计算瓶颈.相比之下, QR-EH在参数利用率与计算效率上取得平衡, 在参数规模上, QR-EH的年、月、日多粒度划分机制将时间参数量由Ttotal压缩至(Ny+Nm+Nd), 其中Ttotal表示整个数据集的总时间步数.在运行时间上, 虽然EHR与自适应时序调制机制带来一定的张量计算开销, 但通过并行的四元数运算及全局哈希矩阵索引可避免计算瓶颈, 运行效率较高.
| 表7 各方法在ICEWS14数据集上的运行效率对比 Table 7 Running efficiency comparison of different methods on ICEWS14 dataset |
本文针对现有时序知识图谱补全方法在刻画语义特征与多粒度时间信息之间的复杂交互及显式利用历史重复模式方面存在的不足, 提出基于四元数表示与显式历史增强的时序知识图谱补全方法(QR-EH), 提升补全性能.构建四元数统一表示学习模块, 将实体、关系和多粒度时间编码至四元数空间, 利用哈密顿乘积捕捉其复杂交互.设计显式历史检索模块, 提取历史重复事件并基于时序调制机制分配重要性权重.最终通过自适应得分融合模块动态融合全局语义信息与历史信息, 实现高精度的时序知识推理.实验表明, QR-EH在MRR等核心指标上取得较优值, 可精准建模时序依赖并有效捕捉历史重复规律.
QR-EH虽取得显著成效, 但仍存在进一步优化的空间.首先, 本文的初步实验表明融合多尺度周期特征能进一步提升方法性能, 未来可探索自适应多周期注意力机制, 在不显著增加计算开销的前提下增强时序表达能力.其次, 针对ICEWS14等历史重复规律不显著的短周期数据集, 方法对非重复性突发事件的泛化捕捉能力相对较弱, 后续工作可尝试引入局部邻域信息聚合或结合大语言模型的常识先验知识, 利用上下文信息弥补历史线索的缺失.最后, 未来可在维持低计算复杂度的前提下, 构建更微观尺度的多粒度时间编码机制.
本文责任编委 欧阳丹彤
Recommended by Associate Editor OUYANG Dantong
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|
| [31] |
|
| [32] |
|
| [33] |
|
| [34] |
|
| [35] |
|
| [36] |
|
| [37] |
|

