Prism-OBI: a novel framework for OBI recognition via visual perception and and feature decoupling
论文链接:https://www.nature.com/articles/s40494-026-02493-9
拜读了这篇论文,感悟良多!我们也做过类似的工作,但是没有形成文字记录,没有进行方法的创新和深挖,没有形成成果,追悔莫及。
一、研究背景与挑战
-
甲骨文的重要性:是中国已知最早的文字系统,对研究古代历史、文化、社会活动具有极高价值。
-
识别难点:
-
拓片存在严重退化:笔画模糊、背景裂纹、地质噪声。
-
字形多变、结构复杂,与现代汉字差异大。
-
传统OCR和端到端深度学习模型难以区分“语义笔画”与“背景噪声”。
-
二、核心创新:Prism-OBI 框架
Prism-OBI 是一个两阶段、解耦式框架,将“空间定位”与“语义分类”显式分离。

阶段一:检测器 OBI-YOLOv8(负责定位)

在YOLOv8基础上,集成了四个定制模块:
| 模块 | 功能 |
|---|---|
| OracleC2f | 信号解耦:将高频(笔画边缘)与低频(整体结构)分离,结合通道-空间双注意力机制,增强笔画特征、抑制背景噪声。 |
| OracleSPPF | 多尺度特征提取 + SE通道注意力,适应字符尺寸剧烈变化(20×20 到 100+×100+)。 |
| OracleFusion | 自适应加权融合多尺度特征,提升信噪比,防止低质量分支干扰。 |
| OracleDetect | 引入坐标注意力(Coordinate Attention),显式编码方向与空间位置信息,解决密集布局下的边界混淆问题。 |
2.1 OracleC2f 模块 —— 信号解耦与语义增强
解决的问题:原始 YOLOv8 的 C2f 模块对甲骨文拓片进行无差别特征处理,无法区分语义笔画(如文字)和背景噪声(如龟甲裂纹),导致特征提取被干扰。
核心创新:信号解耦 + 双注意力机制
-
频率分解
-
通过
5×5平均池化提取低频分量
(保留字符整体轮廓)。 -
通过残差连接
得到高频分量(包含笔画边缘、纹理细节)。 -
这样将字符结构与细节分离,分别输入后续注意力模块。
-
-
级联双注意力(应该源自CBAM)
-
通道注意力:使用全局平均池化和全局最大池化并行生成通道描述符
。再通过共享 MLP 生成通道权重
,增强关键特征通道(如笔画通道),抑制无关通道。
-
空间注意力:沿通道维度进行平均/最大池化,得到空间特征图
,再通过 7×7卷积生成空间权重图
,聚焦字符区域,抑制裂纹等背景噪声。
-
-
特征重组
将增强后的高频细节和低频结构相加,得到同时包含精细笔画和完整结构的输出特征。
效果:
-
精度提升 1.62%,mAP50-95 提升 2.23%,召回率提升 2.66%。
-
有效提取模糊或复杂笔画的字符特征。
2.2 OracleSPPF 模块 —— 动态尺度自适应
解决的问题:原始 SPPF 对所有特征通道和尺度一视同仁,无法根据通道重要性加权,且对极端尺度变化(20×20 到 100+×100+ 像素,OBI长尾现象和image尺寸差异非常大)适应能力弱。
核心创新:多尺度金字塔 + SE 通道注意力
-
标准 SPPF 多尺度提取
-
输入通道的1/2 经
1×1卷积降维(减少计算量)。
-
串联三次
5×5最大池化,得到四个不同等效感受野的特征图:Y1(原始细节)、Y2(等价~5×5)、Y3(等价~9×9)、Y4(等价~13×13)。
-
拼接后通过
1×1卷积恢复通道数,得到融合多尺度特征
。
-
-
SE 通道注意力
-
对
进行全局平均池化,得到每个通道的全局响应描述符 z
。 -
通过两层全连接网络(先降维后升维)学习通道间的非线性依赖,生成权重 s
。 -
将权重 s乘回
,实现通道重标定:增强关键尺度/结构的通道,抑制冗余信息。

-
效果:
-
召回率提升 2.84%,mAP50-95 提升 2.31%。
-
对不同大小、密集分布、边界模糊的字符检测更鲁棒。
2.3 OracleFusion 模块 —— 自适应加权特征融合
解决的问题:原始 YOLOv8 使用静态拼接进行多尺度特征融合,无法反映不同分支的质量差异,易受低质量或噪声分支干扰,稀释有效信息。
核心创新:可学习的加权融合
-
可学习权重
为每个输入特征分支
分配一个可训练的标量权重
,通过梯度下降更新。
-
权重归一化
-
使用 ReLU 保证权重非负。

-
通过
使所有权重之和为 1,引入竞争机制。where ε is a small constant to prevent division by zero。
-
-
加权求和
,网络自适应学习各分支的重要性。
效果
-
精度提升 1.09%,mAP50 提升 1.75%,mAP50-95 提升 1.67%。
-
对小目标分支自动提高权重,对噪声分支抑制权重,提高融合特征的信号噪声比。
2.4 OracleDetect 模块 —— 显式空间编码
解决的问题:原始 YOLOv8 检测头使用位置无关卷积,忽略空间位置信息,导致:
-
无法区分拓片中央主文字与边缘辅助文字;
-
密集排列时字符边界混淆;
-
对极端长宽比字符的定位不准确。
核心创新:坐标注意力(Coordinate Attention)
-
方向感知编码
-
将输入特征 X
沿水平方向进行 1D 全局池化,得到
。 -
沿垂直方向进行 1D 全局池化,得到
。 -
这保留了精确的位置信息,不同于全局池化完全丢失空间结构。
-
-
交互与分离
-
拼接
与转置后的
,经
1×1卷积降维(通道缩减 r 倍)。
-
再分离回
和
,分别通过
1×1卷积恢复通道数,经 Sigmoid 生成水平注意力 和垂直注意力
。


-
-
双方向调制

两个方向注意力同时作用,增强对水平/垂直笔画边界的敏感度。 -
预测
增强后的特征 Y 输入分类和回归分支(3×3+3×3+1×1卷积),输出边界框和类别。
效果
-
mAP50 提升 2.13%。
-
显著改善密集布局下的边界区分能力,对复杂背景中的真实目标定位更准。
整体协同效应
当四个模块集成使用时(OBI-YOLOv8),性能提升超过各自单独贡献之和:
-
精度提升 4.19%,召回率提升 3.76%,mAP50 提升 4.26%,mAP50-95 提升 3.68%。
协同原理:
-
OracleC2f 从源头分离笔画与噪声,为后续模块提供干净特征。
-
OracleSPPF 建立多尺度金字塔,并通过通道重标定增强关键尺度。
-
OracleFusion 动态加权融合不同分支,保证高信噪比。
-
OracleDetect 在检测头注入空间坐标信息,实现精准边界回归。
这四者形成了从特征提取 → 多尺度融合 → 自适应加权 → 空间感知定位的完整退化感知流水线,有效解决了甲骨文识别的核心瓶颈。

2.5 检测总结表
| 模块 | 原始问题 | 核心机制 | 主要效果 |
|---|---|---|---|
| OracleC2f | 无法区分笔画与噪声 | 频率分解 + 通道/空间双注意力 | 增强笔画特征,抑制裂纹 |
| OracleSPPF | 多尺度处理僵化 | SPPF + SE 通道注意力 | 动态适应尺度变化 |
| OracleFusion | 静态拼接,易受噪声分支干扰 | 可学习加权融合 | 自适应平衡多分支贡献 |
| OracleDetect | 忽略空间位置信息 | 坐标注意力(水平+垂直编码) | 精确边界定位,解决密集混淆 |
阶段二:分类器 OBI-ResNet(负责识别)
-
使用 ResNet-50 对裁剪出的单字图像进行分类(306类)。
-
输入尺寸:224×224,经ImageNet统计归一化。
-
输出:字符类别 + 置信度。
-

-

三、数据集与预处理
-
OBI检测数据集OBCD:带标注的拓片图像,用于训练检测器。
-
OBC306数据集:309,551张单字图像,306个类别,用于训练分类器。
-
预处理流程:
-
CLAHE(对比度受限自适应直方图均衡):增强局部对比度。
-
中值滤波(3×3):去除椒盐噪声和随机点噪声,保留笔画边缘。
-
四、实验结果
1. 消融实验(检测任务)
| 方法 | Precision (%) | Recall (%) | mAP50 (%) | mAP50-95 (%) |
|---|---|---|---|---|
| 基线YOLOv8 | 84.77 | 81.48 | 86.95 | 53.29 |
| OBI-YOLOv8(完整) | 88.96 | 85.24 | 91.21 | 56.97 |
-
所有模块组合后性能提升显著,超过各自单独贡献之和,说明协同效果好。
2. 分类器对比(OBC306数据集)
| 模型 | Top-1 (%) | Top-3 (%) | Top-5 (%) |
|---|---|---|---|
| LeNet-5 | 61.75 | 72.23 | 78.21 |
| AlexNet | 81.69 | 91.36 | 93.86 |
| VGGNet-16 | 82.83 | 91.25 | 93.52 |
| ResNet-50 | 85.44 | 93.23 | 96.66 |
-
ResNet-50 因其残差结构和跨层特征复用能力,最适合细粒度甲骨文分类。
3. 两阶段完整系统对比
| 配置 | 平均准确率 (%) | 推理时间 (ms/图) |
|---|---|---|
| + LeNet-5 | 52.81 | 20.45 |
| + AlexNet | 76.49 | 26.12 |
| + VGGNet-16 | 78.23 | 52.78 |
| + ResNet-50 | 83.64 | 30.81 |
-
达到约32 FPS,满足实时处理需求。
-
准确率略低于纯分类器(85.44%),是因为检测阶段引入的微小定位误差。
五、跨域泛化实验(零样本)
-
直接应用于青铜器铭文、石鼓文、古代印章、秦石权文字等未见过的历史文档。
-
结果:
-
能有效定位大部分字符候选区域。
-
但对结构松散的字(如左右结构)可能分裂为多个框。
-
-
表明该框架可作为通用笔画提取器,对拓扑结构差异大的文字需微调。
六、主要贡献
-
提出解耦范式:将视觉感知(去噪+定位)与语义分类显式分离,解决端到端模型的定位-分类权衡问题。
-
设计专用视觉感知模块:针对古代拓片的退化特征,提出OracleC2f、OracleSPPF、OracleFusion、OracleDetect。
-
模块化与可迁移性:检测器可作为通用笔画提取器,分类器可替换为更先进的网络,适用于多种历史文档。
-
实验充分:包括消融、对比、跨域、效率分析,结果稳健。
七、局限性 & 未来方向
-
局限性:
-
对松散结构或极简拓扑的字仍可能错分或分割错误。
-
极端退化场景下仍存在噪声残留。
-
依赖有限标注数据,跨域泛化需微调。
-
-
未来方向:
-
引入图神经网络(GNN) 捕捉字符的结构不变性。
-
使用自监督学习(如掩码图像建模) 从海量未标注历史档案中学习鲁棒表示。
-
八、个人评价
这是一篇工程与考古深度融合的高质量论文,具有以下亮点:
-
问题定义清晰:直指甲骨文识别的核心瓶颈(噪声 vs 笔画)。
-
方法设计系统:不是堆砌模块,而是围绕“解耦”思想构建完整感知系统。
-
实验设计严谨:消融、对比、跨域、效率分析齐全,结果可复现。
-
可迁移性强:框架不仅适用于甲骨文,也为其他古代文字识别提供了通用技术路径。
更多推荐



所有评论(0)