
黄 捷,博士,教授,主要研究方向为模式识别、智能系统、多智能体系统.E-mail:jie.huang@fzu.edu.cn.
作者简介:

田展宏,硕士研究生,主要研究方向为模式识别.E-mail:zhanhongtian@fzu.edu.cn.
针对古钱币真伪包浆宏观视觉高度相似导致的传统空域模型判别能力不足,以及现有方法难以有效解决包浆物理演化程度的连续评分问题,提出基于频域特征与多任务学习的中国古钱币包浆鉴别方法.首先,设计频域特征提取与增强模块,通过分块离散余弦变换捕捉真伪包浆在频域能量分布上的差异,利用双路池化策略感知异常频率.然后,构建多尺度空频调制融合模块,将频域特征转化为注意力权重,调制空域特征,避免语义冲突.最后,设计融合特征筛选模块,抑制钱文轮廓干扰.同时构建多任务联合学习框架以求解评分,实现真伪判别与包浆评分连续回归的联合优化.在自建数据集上的实验表明,文中方法在真伪判别任务与包浆评分任务上均取得较优性能.
HUANG Jie, Ph.D., professor. His research interests include pa-ttern recognition, intelligent systems and multi-agent systems.
About Author:
TIAN Zhanhong, Master student. His research interests include pattern recognition.
The high macroscopic visual similarity between authentic and fake patina on ancient coins limits the discriminative capability of traditional spatial-domain models. Existing methods struggle to solve the continuous scoring problem of the physical evolution degree of patina. To address the above issues, a Chinese ancient coin patina authentication method based on frequency-domain features and multi-task learning(FDF-MTL) is proposed. First, a frequency-domain feature extraction and enhancement module is designed. Patch-based discrete cosine transform is adopted to capture the essential differences in frequency energy distribution between authentic patina and fake patina. A dual-path pooling strategy is utilized to perceive abnormal frequencies. Second, a multi-scale spatial-frequency modulation fusion module is constructed to transform frequency-domain features into attention weights for modulating spatial-domain features, thereby avoiding semantic conflicts. Finally, a fused feature screening module is designed to suppress the interference of coin inscription contours, and a multi-task learning framework is constructed to solve the scoring problem. The joint optimization of authenticity discrimination and continuous patina score regression is achieved. Experiments on a self-built dataset demonstrate the superior performance of the proposed method in both authenticity discrimination and patina scoring tasks.
在中国货币史上, 曾长期流通以青铜或黄铜为主要材质的圆形方孔钱.它们作为重要的物质文化遗产, 在世界货币发展进程中占具显著地位.这类古钱币在长期埋藏或流通过程中, 受基体金属成分、环境温湿度及氧化作用的共同影响, 表面会逐渐生成一层具有特定色泽与纹理的锈蚀层, 即俗称的“ 包浆(Patina)” [1].频域特征可表征包浆微观结构带来的纹理差异、蕴含的能量分布与频谱结构, 有效反映自然演化与人工干预痕迹在微观层面的差异, 为古钱币包浆的真伪鉴别与评估提供客观依据.传统的包浆鉴定主要依赖专家肉眼观察, 存在依赖人工经验、评分标准缺失及难以规模化应用等问题.随着古钱币收藏热的兴起与文物数字化保护需求的增长, 如何利用人工智能技术对古钱币包浆进行快速、科学的鉴别, 已成为文物数字化领域的热点研究方向之一[2].
目前, 围绕古钱币的智能化图像分析已取得一定进展, 但多聚焦于帝王肖像、装饰纹样等具有稳定几何结构的图案特征.Zaharieva等[3]采用标准尺度不变特征变换(Scale-Invariant Feature Transform, SIFT)描述符进行古钱币图像识别.Zambanini等[4]提出基于SIFT Flow的能量函数优化方法, 构建密集SIFT特征网格, 提高特征匹配的可靠性.Schlag等[5]设计定制化的卷积神经网络(Convolutional Neural Network, CNN)结构, 实现古罗马帝国钱币正面肖像的细粒度识别.
然而, 此类基于几何轮廓的方法并不适用于包浆鉴别, 包浆作为金属氧化产物, 呈现出连续的色泽变化且缺乏固定的物理形态, 导致传统的空间特征提取算子难以捕捉有效的识别特征.
此外, Wei等[6]基于早期树状小波变换与能量图的纹理分析工作, 验证中高频分量在古钱币表面纹理识别中的关键作用.Hui等[7]提出AFSIFormer(Adaptive Frequency-Spatial Interaction Transformer), 从频率空间交互角度构建注意力机制, 在空频特征协同建模方面效果较优.
然而, 目前针对包浆这类缺乏固定形态的表面特征研究仍相对有限, 且现有的古钱币包浆智能评分工作多局限于离散分类机制[8], 缺少量化评估包浆连续演化程度的研究.
尽管前文所述工作可增强模型的纹理感知能力, 但在包浆鉴别中仍面临频域差异表征不足与连续特征量化困难的双重挑战.
一方面, 现代做旧技术伪造的包浆在宏观视觉上与真实包浆高度相似, 但二者在频域能量分布上通常存在差异.仅依赖空域特征提取的方法难以捕捉此类频域差异, 导致模型对高仿样本判别的鲁棒性不足.
另一方面, 自然包浆是一个连续的老化过程, 表面呈现无固定形态的渐变纹理.单纯采用传统的离散分类任务划分策略, 不仅易受钱文轮廓等背景特征干扰, 也难以有效解决对包浆连续演化程度进行连续量化评分的问题.
为了解决上述问题, 本文提出基于频域特征与多任务学习的中国古钱币包浆鉴别方法(Chinese Ancient Coin Patina Authentication Method Based on Frequency-Domain Features and Multi-task Learning, FDF-MTL).首先, 设计频域特征提取与增强模块(Frequency-Domain Feature Extraction and Enhance-ment Module, FEEM), 捕捉真伪包浆的频域能量分布差异, 弥补空域特征判别能力的不足.然后, 构建多尺度空频调制融合模块(Multi-scale Spatial-Frequency Modulated Fusion Module, MSFMF), 实现空间与频域信息的深度交互.最后, 设计融合特征筛选模块(Fused Feature Screening Module, FFSM), 利用掩码分支抑制钱币字符与背景轮廓干扰, 实现包浆区域的精准聚焦.在此基础上, 进一步设计多任务联合学习机制, 在真伪判别基础上, 引入连续回归拟合任务, 解决包浆连续演化程度的评分问题.实验表明, FDF-MTL在真伪判别任务与包浆评分任务中均取得较优性能.
早期古钱币识别研究多基于局部特征匹配的方法.Aslan等[9]结合密集SIFT特征与博弈论启发的图传导机制, 构建基于特征相似性的交互式判别框架, 使古钱币图像能通过描述符之间的关联关系实现标签的自组织传播.Lin等[10]采用局部二值模式刻画古钱币表面纹理细节, 并结合局部共生矩阵模式, 实现旋转与光照不变特征提取.
随着特征表示能力的提升, 基于机器学习的方法逐渐受到学者关注.Arandjelović 等[11]提出基于对数极坐标变换的几何校正方法, 定位环形铭文区域, 实现古罗马钱币的自动识别.Kavelar等[12]结合SIFT特征与支持向量机分类器, 构建罗马共和国古钱币铭文识别框架.Kim等[13]以古钱币正面人物半身像作为关键视觉特征, 实现古钱币类别识别.
近年来, 深度学习技术的兴起为古钱币识别带来新的突破.Kim等[14]利用CNN提取古钱币图像的全局视觉特征并进行识别.李耀明等[15]利用深度神经网络架构, 在古钱币图像的自动化识别任务中取得显著成效.施雨等[16]利用神经网络, 编码古钱币的复杂外观特征, 实现从单一图像识别到相似性检索的跨越.Cirillo等[17]针对欧元硬币识别需求, 提出带自注意力的CNN方法, 验证深度模型的识别潜力.
然而, 现有方法大多依赖清晰边缘与稳定的几何结构, 对于包浆中呈现连续色泽变化且缺乏固定几何形态的纹理特征, 表征能力仍存在一定局限.
在古钱币评分中, 已有研究尝试通过视觉特征对包浆状态进行评分以降低人工评估的主观性.Bassett等[18]尝试利用颜色统计特征描述钱币表面氧化状态, 提取钱币的色调-饱和度-明度光谱直方图, 通过直方图模运算对比特征空间差异, 以此评估表面氧化色泽的改变程度.Vadivelan等[19]提出基于局部纹理特征的钱币建模方法, 利用Gabor滤波器与局部二值模式算子提取微观特征, 通过同心环结构消除旋转变化的影响, 为刻画包浆结晶纹理与局部锈蚀斑块的定量分析提供技术思路.Pan等[20]构建钱币表面氧化痕迹的多尺度评分体系, 结合传统图像处理与深度学习技术, 实现从宏观氧化斑块到微观老化痕迹的分层检测, 将包浆和光泽度纳入评分指标, 验证包浆分析在钱币自动化评分中的有效性.
上述方法多基于颜色或纹理等单一视觉特征, 通过离散等级或特征匹配实现评估, 难以有效解决对包浆连续演化程度进行连续量化评分的问题, 导致在处理低氧化程度或成分复杂的样本时, 难以输出稳定、客观的连续评分.
在图像识别领域, 频域信息与CNN的深度融合已成为提升模型表征能力的重要途径之一.Gueguen等[21]将JPEG编码的频域系数直接输入CNN, 初步验证频域特征在深度学习任务中的有效性.Ehrlich等[22]提出一种域转换算法, 实现模型从空间域向JPEG变换域的深度残差学习.Xu等[23]利用离散余弦变换(Discrete Cosine Transform, DCT)[24], 将频域信息以残差形式直接集成至CNN中, 并借助压缩-激活机制实现对特定频率通道的动态选择.Zhong等[25]引入可学习的频率增强模块, 并将RGB域与频域对齐, 有效利用频率信息.葛斌等[26]在可逆流网络中结合频域增强与自适应通道注意力机制, 实现高效的风格迁移, 并强调频域增强在捕捉复杂纹理特征方面的优越性.林力伟等[27]在多级特征解耦框架中引入频域信息, 通过解耦频域伪造痕迹实现深度伪造检测, 这进一步表明频域增强在捕捉复杂纹理特征方面的优越性.
上述研究验证频域信息在提升纹理表征能力方面的潜力.然而, 现有方法多面向通用任务, 未针对古钱币包浆鉴别进行专门设计.因此, 设计面向古钱币包浆鉴别的频域特征提取与空频融合机制仍有待深入研究.
本文提出基于频域特征与多任务学习的中国古钱币包浆鉴别方法(FDF-MTL), 整体架构如图1所示:图中MV2为MobileNetV2的倒残差块, 是骨干网络的基础轻量化特征提取单元; ↓ 2表示步长为 2 的下采样操作, 特征图经该操作后高宽缩减为原尺寸的 1/2, 用于构建多尺度特征层级.
首先, 针对输入的古钱币图像, 利用骨干网络提取多尺度空间特征, 并结合频域特征提取与增强模块(FEEM), 进一步挖掘包浆在频域中的差异信息, 增强对细微纹理变化的表征能力.然后, 设计多尺度空频调制融合模块(MSFMF), 对空间特征和频域特征进行联合建模, 实现频域先验对空域表征的自适应引导.随后, 引入融合特征筛选模块(FFSM), 从通道与空间双维度, 抑制钱文轮廓、背景反光等干扰因素, 突出包浆区域的有效信息.最后, 在统一特征表示的基础上, 分别完成真伪分类任务与包浆评分任务, 实现对古钱币包浆状态的综合判别.
古钱币真伪包浆在视觉表象上高度相似, 但其局部纹理结构与频域高频能量分布存在差异.为了增强方法对频域先验信息的建模能力, 设计频域特征提取与增强模块(FEEM), 提取局部频域响应并实现特征重标定.考虑到全局快速傅里叶变换(Fast Fourier Transform, FFT)难以保留局部空间上下文信息, 本文采用分块离散余弦变换(Patch-Based Discrete Cosine Transform, P-DCT), 在局部窗口内建模频域特征, 从而兼顾局部纹理与频率响应.FEEM由P-DCT与频域特征重标定(Frequency Feature Re-calibration, FFR)组成, 结构如图2所示.
为了消除环境光照等干扰, 将输入的彩色古钱币图像XRGB∈ RH× W× 3转换为亮度通道图像Xgray∈ RH× W× 1, 其中, H、W分别表示图像高度和宽度.然后图像经离散余弦变换(DCT)[24], 获取频域表示.将图像划分为大小为k× k的非重叠图像块Pi, j, 其中i=1, 2, …,
$D_{i, j}(u, v)=\alpha(u) \alpha(v) \sum_{x=0}^{k-1} \sum_{y=0}^{k-1} P_{i, j}(x, y) \cos \left[\frac{(2 x+1) u \pi}{2 k}\right] \cos \left[\frac{(2 y+1) v \pi}{2 k}\right], $
其中, u=0, 1, …, k-1, v=0, 1, …, k-1, 表示频率索引, (x、y)表示块内空间坐标, α (u)、α (v)表示正交归一化系数,
$\alpha(u)=\left\{\begin{array}{ll} \sqrt{\frac{1}{k}}, & u=0 \\ \sqrt{\frac{2}{k}}, & u \neq 0 \end{array}\right.$
二维DCT后, 以系数形式表示图像块的频率信息, 低频分量集中于左上角, 高频分量集中于右下角.将每个图像块的频域系数展平为长度为k2的向量, 再依据其在原图中的空间位置, 对同一频率位置的系数进行通道级重组, 最终得到初始频域特征Ffreq∈
为了避免在DCT前实施空域裁剪引发的硬边缘高频噪声, 频域特征重标定在特征层面对Ffreq引入有效区域掩码M∈ {0, 1}H'× W', 其中H'、W'分别表示频域特征图高度和宽度.根据钱币图像的圆形外轮廓与方孔位置生成M, 非钱币区域值为0, 有效包浆区域值为1.掩码净化后的频域特征为:
$\widetilde{\boldsymbol{F}}=\boldsymbol{F}_{\text {freq }} \otimes \boldsymbol{M}, $
其中$\otimes$表示逐元素相乘.
为了同时捕捉人工做旧产生的局部异常高频响应与自然包浆形成的整体频率分布特征, 对$\widetilde{F}$采用自适应双路池化策略.对于第c个频率通道, 分别执行Top-K池化与全局平均池化, 第c个频率通道的Top-K池化统计量
$z_{t o p K}^{c}=\frac{1}{K} \sum_{(h, w) \in N_{K}} \widetilde{F}^{c}(h, w), $
第c个频率通道的全局平均池化统计量
$z_{\text {avg }}^{c}=\frac{1}{H^{\prime} \times W^{\prime}} \sum_{h=1}^{H^{\prime}} \sum_{w=1}^{W^{\prime}} \widetilde{F}^{c}(h, w), $
其中, (h, w)表示特征图上的空间像素坐标, NK表示$\widetilde{F}^{c}$在空间维度上响应值最大的K个像素坐标集合.ztopK∈ RC刻画局部高频异常响应, zavg∈ RC描述整体频率分布趋势, 其中C泛指通道数.最后, 将两路统计向量输入共享的一维卷积, 实现跨频率通道的特征交互, 并通过Sigmoid函数生成最终的频域通道权重向量:
$\boldsymbol{\omega}=\sigma\left(\operatorname{Conv1D}\left(z_{\text {topK }}\right) \oplus \operatorname{Conv1D}\left(z_{\text {avg }}\right)\right), $
其中, σ (· )表示Sigmoid激活函数, Conv1D(· )表示一维卷积操作, $\oplus$表示逐元素相加.
利用生成的权重向量ω 对初始频域特征Ffreq进行通道重标定, 输出增强后的频域特征:
$\boldsymbol{F}_{\text {FEEM }}=\boldsymbol{F}_{\text {freq }} \otimes \boldsymbol{\omega} .$
FEEM提取的频域特征侧重表征包浆区域的局部高频响应, 而骨干网络输出的空域特征主要描述整体纹理结构与语义信息, 二者在表征尺度与特征分布上存在差异.直接采用拼接或逐元素相加等线性融合方式, 容易导致跨域特征耦合不足, 削弱频域先验对空间表征的增强作用.为此, 本文设计多尺度空频调制融合模块(MSFMF), 对频域增强特征与空域特征进行自适应调制与协同融合, 实现高频细节信息对空间表征的有效引导.MSFMF结构如图3所示.
MobileViT[28]结合CNN的局部归纳偏置与Trans-former的全局建模能力, 在保持轻量化的同时捕获包浆区域的远距离纹理依赖, 适合作为FDF-MTL的特征提取骨干网络.提取的浅层特征虽保留丰富纹理细节但语义抽象程度较低, 深层特征语义较强却丢失空间分辨率, 而网络最后3个阶段在感受野与语义层次之间取得良好平衡, 能有效表征包浆从微观结晶纹理到宏观氧化分布的跨尺度退化信息.设网络最后3个阶段输出的特征图分别为f3∈
Fspa=Concat(GAP(f3), GAP(f4), GAP(f5))∈ RC,
其中, Concat(· )表示通道维度拼接操作, GAP(· )表示全局平均池化, 聚合后的总通道数
C=C3+C4+C5.
为了建立频域先验与空域通道之间的映射关联, 首先对FFEEM进行全局平均池化与展平操作, 将其由空间频域特征图压缩为通道描述向量zf∈ RD, 其中D表示频域通道描述向量的特征维度.然后, 通过包含激活函数的两层感知机将zf映射为与Fspa维度一致的调制权重向量:
Wmod=σ (W2δ (W1zf))∈ RC,
其中, W1∈
最后, 为了保证特征融合过程的数值稳定性, 并防止在训练初期因频域特征分布不稳定而导致的梯度坍塌, 引入残差学习机制.将调制权重Wmod与多尺度空间特征Fspa逐元素相乘后, 叠加原始的空间特征, 得到最终的空频融合特征:
Ffused=Fspa+(Fspa$\otimes$Wmod).
空频融合后的特征虽然整合空间纹理与频域信息, 但其中仍不可避免地包含钱币边缘、文字轮廓及背景纹理等冗余响应.受卷积块注意力模块(Convo-lutional Block Attention Module, CBAM)[29]双维度调制思想的启发, 本文在融合特征后引入融合特征筛选模块(FFSM), 分别从通道和空间两个维度对特征进行调制, 突出包浆相关区域并抑制无关干扰.FFSM结构如图4所示.
在通道维度上主要建模不同通道的重要性差异.考虑到古钱币包浆的真假差异往往集中体现在少量具有较强响应的特征通道上, 因此分别对融合特征进行全局最大池化和全局平均池化, 提取极值信息和整体统计信息.然后, 将两路特征分别送入一维卷积进行映射, 并将结果相加后经Sigmoid函数生成通道权重Wc.相比直接采用共享MLP(Multi-layer Perceptron)的方式, 该设计在降低参数量的同时, 更便于保留两类统计信息的互补性.最终, 将通道权重与输入特征逐通道相乘, 得到细化后的特征表示.
在空间维度上, 古钱币包浆常表现为局部裂纹、腐蚀斑块及缓慢过渡的色泽变化, 不同结构对应的空间尺度存在差异.不同于CBAM中采用单一卷积核生成空间权重的方式, 本文在空间维度上设计双分支感知结构:一支采用标准3× 3卷积, 捕捉局部细腻纹理; 另一支采用扩张率d=2的空洞卷积, 扩大感受野并建模包浆的整体分布趋势.首先, 对细化后的特征在通道维进行最大池化与平均池化, 得到两路空间描述, 将其拼接后输入双分支结构.两路响应经逐元素相加, 再经过卷积层并经Sigmoid激活后, 生成最终的空间掩码Ms.该设计兼顾局部细节与全局形态, 有助于突出包浆区域的连续分布特征, 并抑制背景轮廓带来的干扰.
针对古钱币图像的多尺度空间特征, 经过频域增强、空频融合与特征筛选, 获得富含包浆信息的深度特征.在此基础上, 进一步设计多任务联合学习框架, 同时完成古钱币包浆的真伪判别任务与评分任务.由于真伪判别与包浆评分共享表征且目标互补, 通过联合优化, 可提升特征表达能力与模型的泛化能力.
针对真伪硬边界判别任务, 采用二元交叉熵损失
Lcls=-
进行约束, 其中, N表示批次样本数, ti∈ {0, 1}表示真实标签, pi表示网络预测的真品概率.该损失用于约束方法快速收敛到清晰的分类边界.
为了提升方法面对高仿伪造样本时的鲁棒性, 引入中心损失:
Lcenter=
约束深层特征空间, 其中, fi表示第i个样本送入分类器前的深层融合特征向量,
为了弥补单纯二分类方法难以反映包浆状态差异的问题, 由专业标注人员给出初始评分, 并经最小-最大归一化映射至[0, 1]区间作为监督标签
$L_{\text {score }}=\frac{1}{N} \sum_{i=1}^{N}\left(y_{i}^{\text {score }}-\hat{y}_{i}^{\text {score }}\right)^{2}$
进行优化, 其中$\hat{y}_{i}^{\text {score }}$表示回归分支输出的预测值.最终的总损失函数定义为各部分损失的加权和:
Ltotal=Lcls+λ 1Lcenter+λ 2Lscore,
其中λ 1、λ 2表示平衡不同量级损失的超参数.
通过多任务联合优化, FDF-MTL在提升真伪判别性能的同时, 进一步增强对包浆演化程度的表征能力.
针对当前古钱币包浆公开数据集匮乏且标注规范缺失的现状, 本文构建一个涵盖真伪及不同氧化程度的古钱币包浆数据集.数据集共包含6 858幅样本, 其中真包浆样本3 655幅, 伪包浆样本3 203幅.数据集上古钱币真伪属性均由专业鉴定人员确认, 伪包浆样本涵盖化学催化、物理附着及复合做旧等多种现代仿制工艺.
为了保证数据质量与模型训练的有效性, 对原始图像进行规范化筛选.首先, 剔除分辨率低于300× 300或存在严重拍摄模糊的低质量图像.然后, 排除因严重磨损或附着物遮蔽导致包浆微观纹理残缺的样本.此外, 广泛采集不同历史时期及铸造工艺的古钱币, 增强数据集的泛化能力.在数据集划分过程中, 以钱币实体为单位进行训练集与测试集划分, 确保同一钱币的不同图像不会同时出现在训练集与测试集上, 从而避免由数据泄露导致的性能偏高问题.最终按照8∶ 2的比例划分训练集与测试集, 并在相同实验设置下完成训练与评估.
在数据标注方面, 邀请6名经过专业培训的古钱币鉴定人员对每枚钱币进行双盲独立评估, 并对原始评分结果进行组内相关系数(Intraclass Corre-lation Coefficient, ICC)分析, 结果为ICC=0.86, 表明不同标注者之间具有较好的评分一致性, 说明该连续评分具有较稳定的专家共识基础.真伪标签依据古钱币包浆鉴定通用判别标准[30]标定.
为了连续刻画包浆的物理演化过程, 制定如表1所示的连续评分标准.依据该标准给出初始分值, 并采用去极值平均法对多名标注者的结果进行融合, 即剔除最高分与最低分后, 对其余分值取算术平均值, 经最小-最大归一化映射至[0, 1]区间, 作为回归分支的监督标签.
| 表1 古钱币包浆物理演化程度连续评分标准 Table 1 Continuous scoring standard for physical evolution degree of patina on ancient coins |
为了直观展示构建的数据集的多样性及联合标注体系, 图5给出部分代表性样本在包浆评分数轴上的分布.由图可见, 离散真伪标签用于刻画包浆的定性属性, 连续评分用于量化其由轻度氧化向重度老化演化的程度, 为多任务学习提供更全面的监督先验.
在Ubuntu 22.04系统上完成实验, CPU为Intel Xeon Gold 6430@2.10 GHz, GPU为NVIDIA RTX 4090 24 GB, 框架选用PyTorch, CUDA版本为12.4.输入图像尺寸为224× 224, 骨干网络在ImageNet上进行预训练.在微调时, 迭代周期设为50, 批次大小设为32, 采用AdamW(Adaptive Moment Estimation with Weight Decay)优化器进行参数更新, 初始学习率设为3× 10-4, 权重衰减系数为1× 10-4, 采用余弦退火策略动态调整学习率, 促进模型收敛.在频域特征提取与增强模块(FEEM)中, DCT采用16× 16分块计算以平衡效率与精度.
为了全面评估方法在古钱币包浆鉴别任务中的性能, 从分类与回归两个方面选取评价指标.分类性能指标采用准确率(Accuracy, ACC)、F1值及曲线下面积(Area Under the Curve, AUC).回归性能指标采用平均绝对误差(Mean Absolute Error, MAE)和皮尔逊相关系数(Pearson Correlation Coefficient, PCC).模型复杂度指标采用参数量、浮点运算量及单幅推理时间.
在真伪判别任务中, ACC用于衡量模型整体分类正确的比例, F1值通过调和平均值反映模型的综合稳健性, 相应公式如下:
其中, TP表示真阳性, TN表示真阴性, FP表示假阳性, FN表示假阴性,
Precision=
表示准确率,
Recall=
表示召回率.
AUC表示ROC(Receiver Operating Characteristic Curve)下面积, 用于评估模型在不同阈值设置下区分真伪样本的能力.
在包浆评分任务中, MAE用于衡量预测值与真实值之间的平均偏差, 公式如下:
$ M A E=\frac{1}{N} \sum_{i=1}^{N}\left|y_{i}-\hat{y}_{i}\right|, $
其中, yi表示真实评分, $ \hat{y}_{i}$表示模型预测值, N表示参与性能评估的测试样本总数.MAE能直观反映模型的回归误差, 数值越小表示预测越准确.
此外, 为了评估预测结果与真实评分之间的线性相关性, 引入PCC, 公式如下:
$P C C=\frac{\sum_{i=1}^{N}\left(y_{i}-\bar{y}\right)\left(\hat{y}_{i}-\overline{\hat{y}}\right)}{\sqrt{\sum_{i=1}^{N}\left(y_{i}-\bar{y}\right)^{2}} \sqrt{\sum_{i=1}^{N}\left(\hat{y}_{i}-\overline{\hat{y}}\right)^{2}}}, $
其中,
为了全面验证FDF-MTL的有效性, 选择如下基于不同技术路线的代表性的鉴别与评估方法进行对比.
1)基于古钱币视觉特征的方法:AnCoins(An-cient Coins)[31]、CoinNet[32], 侧重于古钱币形制与局部几何特征的感知.
2)基于经典空域卷积的方法:MobileNetV3[33], ResNet50[34]、RepViT[35], 依靠通用空域卷积机制实现视觉表征.
3)基于频域特征变换的方法:FcaNet[36]、GFNet(Global Filter Network)[37]、CFormer[38], 引入全局或局部频域变换捕捉高频细节.
4)基于退化评分回归的方法:文献[39]方法, TReS[40]、MANIQA(Multi-dimension Attention Network for No-reference Image Quality Assessment)[41], 利用回归架构对图像质量或连续退化状态进行量化分数拟合.
为了保证对比公平性, 所有方法均在统一的数据集与实验配置下重新训练与评估.对于原始任务形式与本文不一致的方法, 仅保留其核心骨干网络, 统一改造为与本文一致的分类-回归双分支结构.
各方法在真伪判别任务中的性能对比如表2所示.
| 表2 各方法在真伪判别任务中的性能对比 Table 2 Performance comparison of different methods on authenticity identification task |
由表2可见, FDF-MTL在ACC、F1、AUC指标上均取得最优值.相比基于古钱币视觉特征的方法, FDF-MTL更适配包浆鉴定任务, 这是因为前者的设计侧重于钱币轮廓、文字等几何结构特征, 而FDF-MTL从频域能量分布出发, 能有效捕捉包浆独有的微观纹理.基于经典空域卷积的方法结果表明, 单一的空间维度特征难以充分捕获真伪包浆的差异, FDF-MTL能更有效区分真伪包浆, 体现FEEM对真伪包浆频域能量分布差异的捕捉能力.相比基于频域特征变换的方法, FDF-MTL仍保持领先, 归因于MSFMF将频域特征转化为自适应调制权重, 实现空域与频域特征的深层语义对齐.
各方法在包浆评分任务中的性能对比如表3所示.由表可见, 考虑到包浆的物理演化是一个连续的过程, 专门用于分数拟合的方法均展现出一定的拟合能力.然而, FDF-MTL进一步将MAE值降至0.042 1, 使PCC值升至0.958 1.相比文献[39]方法, MAE值缩小0.020 5, 即便面对同组表现较优的前沿方法MANIQA, FDF-MTL也同样保持领先.这得益于FDF-MTL通过FFSM能剥离背景噪声并关注核心包浆区域, 使输出的评分更贴合包浆的演化规律.
| 表3 各方法在包浆评分任务中的性能对比 Table 3 Performance comparison of different methods on ancient coin patina scoring regression task |
为了验证方法在应对不同朝代包浆特征差异时的泛化能力, 从构建的数据集上抽取唐、宋两朝的古钱币包浆图像, 开展交叉评估.宋代数据样本共1 969幅(真包浆样本1 056幅, 伪包浆样本913幅), 唐代数据样本共1 245幅(真包浆样本688幅, 伪包浆样本557幅).
MobileViT[28]和FDF-MTL在不同朝代古钱币数据集上的跨域泛化性能对比如表4所示.由表可见, 在域内测试中, FDF-MTL各项指标均优于Mobile-ViT.以宋代数据为例, ACC值提升1.52%, PCC值由0.847 6升至0.925 8, MAE指标显著下降, 表明MSFMF能更精准地捕捉包浆退化特征.在跨域测试中, MobileViT呈现出明显的泛化能力不足(如唐代到宋代时PCC值降至0.898 1), 说明单一空域卷积容易过拟合源域的表象特征.相比之下, FDF-MTL展现出更优的跨域鲁棒性, 在双向跨域测试中ACC值均超过94%, PCC值均超过0.93.这表明本文引入的FEEM能有效滤除特定朝代的颜色与背景干扰, 促使方法聚焦跨域通用的高频纹理, 提升在不同场景中的适用性.
| 表4 MobileViT和FDF-MTL在不同朝代古钱币数据集上的跨域泛化性能对比 Table 4 Comparison of cross-domain generalization performance of different methods on multi-dynasty ancient coin datasets |
为了验证方法在复杂光照环境中的鲁棒性, 采用非线性伽马校正、随机亮度与对比度剧变, 构建光照泛化测试集.
MobileViT[28]、ResNet50[34]和FDF-MTL在不同光照条件下的性能对比如表5所示.
| 表5 各方法在不同光照条件下的性能对比 Table 5 Performance comparison of different methods under different illumination conditions |
由表5可见, 在真伪判别任务中, 各方法的ACC指标波动相对较小, 但在包浆评分任务中, 传统空域网络的性能下降较明显.例如:在强光干扰下, MobileViT的MAE值升至0.100 1, PCC值降至0.858 1.相比之下, FDF-MTL在不同光照条件下均保持较稳定的性能, ACC值始终高于97%, MAE值也控制在0.05以内.该结果表明, 本文引入的FEEM有助于减弱光照扰动对方法的影响, 提升泛化能力.
各方法的计算复杂度对比如表6所示.由表可见, 在效率方面, FDF-MTL的参数量为5.74 M, 显著低于CoinNet、TReS等大型及混合架构方法, 与GFNet等轻量化方法处于同一规模.在计算效率方面, FDF-MTL的浮点运算量为1.55 G, 推理时间为0.51 ms.相比MobileNetV3(0.23 G, 0.18 ms)和GFNet(1.28 G, 0.37 ms), FDF-MTL的计算量与推理时间均略有增加.这主要源于本文的FEEM在增强高频特征表征能力的同时, 也带来一定的计算开销.但是, 这种以适度计算负担换取鉴别与评分性能提升的权衡是合理且必要的.
| 表6 各方法的计算复杂度对比 Table 6 Computational complexity comparison of different methods |
为了直观验证FDF-MTL的有效性, 采用Grad-CAM(Gradient-Weighted Class Activation Mapping)[42], 对不同方法进行可视化, 结果如图6所示.由图可见, 不同方法的热力图关注区域存在明显差异.
基于古钱币视觉特征的方法响应较分散, 主要集中于钱币轮廓及局部边缘区域.基于经典空域卷积的方法虽能一定程度上聚焦文字和内孔附近, 但整体响应仍不够稳定.基于频域特征交换的方法对钱币表面纹理和环状结构的响应更连续, 说明其对高频细节具有一定的敏感性.相比之下, FDF-MTL的热力区域更集中于包浆关键纹理区域, 能更稳定地捕获与真伪判别相关的细粒度差异.该结果表明, MSFMF有助于提升方法对古钱币微观纹理变化的关注能力, 增强判别性能.
在统一骨干网络MobileViT与实验设置下, 本文选取3种典型的传统注意力模块进行对比:CBAM、SE(Squeeze-and-Excitation Networks)、ECA(Efficient Channel Attention), 同时引入基于离散余弦变换的频域注意力(下文简记为DCT Attention).
相同骨干网络下不同注意力模块的性能对比如表7所示.由表可见, 传统注意力模块虽能带来一定的性能增益, 但提升幅度有限, 说明其对古钱币包浆细粒度差异的建模能力仍存在不足.相比之下, DCT Attention均取得较优值, 验证频域信息对于包浆微观纹理表征的有效性.FDF-MTL进一步取得最优值, 表明FEEM、MSFMF、FFSM之间具有良好的协同作用, 可有效提升方法对包浆真伪差异及连续演化特征的判别能力.
| 表7 相同骨干网络下不同注意力模块的性能对比 Table 7 Performance comparison of different attention modules under same backbone network |
为了验证FDF-MTL的有效性, 在构建的古钱币包浆数据集上进行全面的消融实验, 探究FEEM、MSFMF、FFSM在古钱币真伪判别任务与包浆评分任务中的性能提升效果.
各模块的消融实验结果如表8所示.由表可见, 在仅使用空域骨干网络时, MobileViT的ACC值为94.97%, PCC值为0.867 9.在此基础上, 若单独引入FFSM或FEEM, ACC值分别升至95.63%和95.92%.这表明单一的空间特征降噪或频域特征补充均能在一定程度上提升对于古钱币包浆的鉴别性能, 但由于缺乏跨模态信息的深度交互与融合, 整体性能提升幅度相对有限.同时引入FEEM与FFSM, 但未采用MSFMF时, ACC值为96.21%, 相比仅使用FEEM时提升0.29%, 且MAE、PCC指标的改善也不明显.说明未经对齐与调制的频域高频幅值直接与空间特征相加, 可导致异构特征之间的语义混叠.这种未对齐的特征输入干扰FFSM中自注意力机制的权重分配, 使其容易将部分真实的微观包浆特征误判为噪声并予以抑制, 从而限制性能的进一步提升.引入MSFMF后, ACC值升至96.94%.这是因为MSFMF将频域能量转化为归一化的调制权重, 不仅有效避免空频特征的直接冲突, 还能自适应激活与人工痕迹相关的特定空间通道.最终, 在完整架构中, 性能达到最优, ACC值升至97.74%, MAE值降至0.042 1, PCC值升至0.958 1.其原因在于MSFMF预先为特征构建纯净且对齐的解空间, 使末端的FFSM能更好地发挥去噪与提纯优势, 体现各模块在真伪判别任务与包浆评分任务中的有效协同.
| 表8 各模块的消融实验结果 Table 8 Ablation experiment results of different modules |
采用Grad-CAM对不同实验组的特征响应区域进行可视化, 结果如图7所示.由图可见, MobileViT的热力响应分布较弥散, 注意力主要分散在背景.单独引入FEEM, 响应逐渐集中于钱币本体区域, 相比仅含FFSM时, 无关区域的响应显著减弱, 表明FE-EM可有效引导方法关注钱币表面纹理.在此基础上加入FFSM与MSFMF后, 对包浆纹理的响应更集中, 关注区域与包浆实际分布更一致.FDF-MTL的热力图响应最集中, 由此验证各模块的协同优化效果与FDF-MTL的有效性.
多任务学习的消融实验结果如表9所示.由表可见, 同时进行真伪判别任务与包浆评分任务时, 方法在所有指标上均优于仅使用单任务的方法.加入包浆评分任务后, ACC值从97.23%升至97.59%, F1值从97.50%升至97.81%.加入真伪判别任务后, MAE值从0.049 9降至0.045 2, PCC值从0.947 2升至0.955 0, 表明两个任务之间存在互补性.进一步加入中心损失后, ACC值升至97.74%, F1值升至97.94%, AUC值达到0.991 8, 同时MAE值降至0.042 1, PCC值升至0.958 1, 表明多任务联合优化有助于提升真伪判别任务与包浆评分任务的综合性能, 而中心损失能进一步增强类内特征紧凑性, 带来更稳定的性能提升.
| 表9 多任务学习的消融实验结果 Table 9 Ablation experiment results of multi-task learning |
定义DCT中的分块大小为8× 8, 16× 16, 32× 32, 其对FDF-MTL性能的影响如表10所示.由表可见, 采用16× 16分块时各项指标均取得最优值, 说明该设置能在包浆细粒度纹理表征与整体频域信息保留之间取得较好平衡.8× 8分块虽使局部频率划分更细, AUC值略高于其它设置, 但在ACC、F1、MAE、PCC指标上并未同步提升, 表明过细分块可能引入一定的局部噪声并削弱整体判别稳定性.相比之下, 32× 32分块由于单块覆盖范围较大, 部分局部差异被弱化, 整体性能略有下降.综合各项指标, 本文最终将16× 16作为默认分块大小.
| 表10 分块大小对FDF-MTL性能的影响 Table 10 Effect of patch size on FDF-MTL performance |
为了说明真伪包浆在频域结构上的差异, 并验证FEEM的判别价值, 从频谱形态和径向能量衰减两个层面开展统计分析.
从真、伪包浆样本中分别随机抽取1 500幅图像, 转换为单通道灰度图, 从图像中心裁剪至224× 224区域, 并叠加二维汉宁窗预处理, 再采用二维FFT提取频域特征并完成中心化处理, 通过对频谱幅值矩阵进行径向平均, 获得随频率半径递增的能量分布曲线.此处采用FFT主要用于直观展示真伪包浆在全局频谱统计上的差异, 而FDF-MTL采用P-DCT, 则主要考虑其计算开销较低, 更适合对局部纹理块进行频率建模.因此, 二者在本文中分别承担频域差异分析和特征建模的不同功能.
真伪包浆频谱图如图8所示.由图可见, 真伪包浆在频谱中心区域均具有较强的能量集中趋势, 说明二者在整体形制与亮度分布等宏观结构上具有相似性.在高频区域, 二者的能量扩散形态存在差异.伪包浆在部分方向上呈现异常频率响应, 而自然包浆的频谱分布更平滑且连续, 反映出两类包浆在微观纹理组织方式上的差异.该结果表明, 真伪包浆在频域特征分布上存在差异, 为本文引入频域特征建模提供依据.
真伪包浆径向能量衰减对比如图9所示.由图可见, 在低频区域内, 两类样本的能量变化趋势基本重合, 说明其宏观结构信息具有较强的一致性.随着频率半径增大, 二者曲线逐渐分离, 表明两类样本在高频细节表征上存在差异.伪包浆在高频区域的能量衰减相对更缓, 相同频率半径下的能量幅值整体更高, 说明其纹理边缘、局部突变及微观结构更不均匀.由于高频分量主要对应图像中的细粒度纹理与局部微观变化, 因此该结果表明两类包浆在高频特征上具备可分性.
频段输入对FDF-MTL性能的影响如表11所示.由表可见, 当仅保留低频分量时, 性能显著下降, 表明仅依赖整体亮度与轮廓等低频信息难以有效完成真伪区分.相比之下, 仅保留高频分量时, FDF-MTL仍能保持较优的识别性能, 说明包浆区域的局部高频纹理是方法判别的重要依据.该现象进一步验证本文频域特征建模策略的有效性.
| 表11 频段输入对FDF-MTL性能的影响 Table 11 Effect of frequency band input on FDF-MTL performance |
本文针对古钱币包浆的真伪鉴别与评分问题, 提出基于频域特征与多任务学习的中国古钱币包浆鉴别方法(FDF-MTL).以MobileViT作为骨干网络, 设计频域特征提取与增强模块(FEEM), 捕捉真伪包浆的频域能量差异.构建多尺度空频调制融合模块(MSFMF), 实现空域与频域信息的对齐与互补.同时, 引入融合特征筛选模块(FFSM), 有效抑制钱文轮廓等背景干扰.在训练策略上, 采用多任务联合学习框架, 协同优化真伪判别任务与包浆评分任务.在自建数据集上的实验表明, FDF-MTL在鉴别精度与泛化鲁棒性方面均具有明显优势.不同朝代钱币在铸造工艺、合金成分及埋藏环境上存在差异, 致使包浆的频域能量分布出现一定偏移, 影响方法在未见朝代样本上的表现.为此, 下一步研究拟引入域自适应机制, 通过频域对齐操作缩小跨朝代数据的分布差异, 并施加更细粒度的频域约束, 增强方法在多样化实际鉴定场景中的鲁棒性与适用性, 进一步提升FDF-MTL在跨朝代古钱币鉴别上的泛化能力.
本文责任编委 高隽
Recommended by Associate Editor GAO Jun
| [1] |
|
| [2] |
|
| [3] |
|
| [4] |
|
| [5] |
|
| [6] |
|
| [7] |
|
| [8] |
|
| [9] |
|
| [10] |
|
| [11] |
|
| [12] |
|
| [13] |
|
| [14] |
|
| [15] |
|
| [16] |
|
| [17] |
|
| [18] |
|
| [19] |
|
| [20] |
|
| [21] |
|
| [22] |
|
| [23] |
|
| [24] |
|
| [25] |
|
| [26] |
|
| [27] |
|
| [28] |
|
| [29] |
|
| [30] |
|
| [31] |
|
| [32] |
|
| [33] |
|
| [34] |
|
| [35] |
|
| [36] |
|
| [37] |
|
| [38] |
|
| [39] |
|
| [40] |
|
| [41] |
|
| [42] |
|

