當前位置: 首頁 » 技術文獻 » 軋鋼文獻 » 綜合資料 » 正文

基于TrOCR模型的手寫體板坯號識別方法研究與應用

放大字體  縮小字體 發布日期:2026-07-17  作者:亢克松  瀏覽次數:479
 
核心提示:摘要:針對鋼鐵生產場景中手寫板坯號識別存在的字符模糊、背景復雜及書寫不規范等難題,本文設計了一種基于Transformer的TrOCR(Text Recognition with Optical Character Recognition)模型識別方法。首先,在引入多尺度特征融合模塊的基礎上,結合自適應數據增強策略,設計了該領域專用字典約束解碼的過程。然后,在硬件層面選用Jetson AGX Xavier邊緣設備,使模型在1080p圖像推理時延方面降至210ms、且功耗控制在11W以內。最后,通過系統測試
 基于TrOCR模型的手寫體板坯號識別方法研究與應用

亢克松

(河鋼數字技術(唐山)責任有限責任公司,河北 唐山 063000)

摘要:針對鋼鐵生產場景中手寫板坯號識別存在的字符模糊、背景復雜及書寫不規范等難題,本文設計了一種基于Transformer的TrOCR(Text Recognition with Optical Character Recognition)模型識別方法。首先,在引入多尺度特征融合模塊的基礎上,結合自適應數據增強策略,設計了該領域專用字典約束解碼的過程。然后,在硬件層面選用Jetson AGX Xavier邊緣設備,使模型在1080p圖像推理時延方面降至210ms、且功耗控制在11W以內。最后,通過系統測試驗證本文所采用的方法的有效性。

關鍵字:Transformer;TROCR;手寫板坯號;Jetson AGX Xavier

1 引言

鋼鐵工業作為現代制造業的核心支柱,其生產流程的數字化與智能化升級已成為全球競爭的關鍵。板坯號作為每塊鋼坯的唯一標識符,通常由字母與數字組合構成(如“XG230512A”),記錄了鋼種、爐次、生產批次等關鍵信息,貫穿熱軋、冷軋、倉儲及質量追溯全流程。然而,傳統的人工錄入方式在復雜工業場景下面臨嚴峻挑戰:1)環境惡劣性:鋼廠生產現場存在高溫、粉塵、鋼板表面高反光等問題,工人需頻繁進入高危區域核對板坯號。2)效率與成本瓶頸:人工錄入速度約為3~5秒/字符,單條產線日均處理幾百塊板坯時需多名專職人員輪班,人力成本高。3)傳統OCR的局限性:通用OCR引擎(如Tesseract[1]、EasyOCR[2])依賴清晰字符與固定字體模板,難以應對手寫潦草、噴涂磨損、傾斜拍攝等問題,如:鋼板表面的氧化層與焊接飛濺會干擾傳統二值化算法[3],導致字符分割失??;CRNN[4]等模型在字符形變場景下識別準確率下降超20%。盡管已有研究嘗試解決工業OCR難題,文獻[5]提出了基于模式識別的板坯號識別系統,文獻[6]對異型連鑄鋼坯標識與識別裝備系統進行了研發與應用,但上述這些方法依賴人工經驗設計網絡架構,魯棒性不足,僅適用于特定環境。國內外研究人員嘗試了采用基于CTC損失的識別方法,但因假設字符條件獨立,僅能捕獲局部信息,在鋼廠復雜場景下準確率不足80%。近年來,重慶鋼鐵等企業通過專利技術推動智能化轉型,但仍面臨極端光照、動態噪聲等未解難題。

圖片1 

圖1 現場板坯圖片

針對傳統OCR技術的不足,同時考慮鋼廠場景的噪聲、形變、低質量圖像與魯棒性等因素[7],本文擬采用工業自動化與先進的計算機視覺交叉融合的邊緣計算部署技術,利用TrOCR[8]模型,結合多尺度特征融合與自適應數據增強技術,提出了系統性的解決方案。

2 OCR技術綜述

深度學習可以通過端到端的特征學習與上下文建模,顯著提升OCR的魯棒性。以下從經典CRNN框架與Transformer革新兩方面展開:

CRNN框架,基于CNN+RNN+CTC[9]進行構建,CRNN(Convolutional Recurrent Neural Network)是早期深度學習OCR的代表性框架,其流程為:首先,使用CNN網絡(例如VGG或ResNet)提取圖像的局部特征圖;其次,使用RNN網絡進行序列建模,通過雙向LSTM(Bi-LSTM)捕捉特征序列的上下文依賴關系;最后,依靠CTC網絡解碼,利用連接主義時間分類(Connectionist Temporal Classification, CTC)解決變長序列對齊問題,輸出最終文本。該方法也存在一些局限,局部感受野限制,CNN的卷積核僅能捕獲局部特征,對長距離依賴(如跨字符的語義關聯)建模能力不足;RNN的時序誤差累積,Bi-LSTM在長序列中可能出現梯度消失/爆炸,且推理速度較慢;手寫體適應性差,CRNN對筆畫斷續、傾斜、形變的手寫體(如鋼板編號)識別率低于80%。

Transformer在OCR中的革命性突破,Transformer憑借自注意力機制[10](Self-Attention)的全局建模能力,成為OCR領域的新范式。微軟提出的TrOCR(Transformer-based OCR)是首個端到端的Transformer OCR模型,其技術原理如下:

1)TrOCR模型架構

TrOCR采用標準的Encoder-Decoder結構,專為圖像到文本的序列轉換任務設計:


圖片2 

圖2 Trocr識別網絡示意圖


(1)Encoder(圖像編碼器):

輸入:原始圖像經Patch Embedding劃分為16×16像素塊,線性映射為向量序列;

核心:多層Transformer Encoder堆疊,每層包含:多頭自注意力(Multi-Head Self-Attention, MHSA),計算不同圖像塊間的全局關聯權重,例如反光區域的字符塊可通過注意力權重與周圍非反光區域關聯,補償局部信息丟失;前饋網絡(FFN),對注意力輸出進行非線性變換,增強模型表達能力。

(2)Decoder(文本解碼器):

輸入:目標文本的字符嵌入(Char Embedding)與位置編碼(Positional Encoding);

核心:多層Transformer Decoder,每層包含:掩碼多頭自注意力(Masked MHSA),防止解碼時未來信息泄露;交叉注意力(Cross-Attention),將Encoder輸出的圖像特征與當前解碼狀態對齊,實現視覺-語義的跨模態融合。

全局上下文建模,自注意力機制允許每個圖像塊直接與全圖其他塊交互,克服了CNN的局部感受野限制,如:在鋼板反光場景中,即使某字符塊因過曝丟失局部特征,仍可通過相鄰塊的上下文推斷其內容。此外,端到端訓練無需分步檢測、分割與識別,直接輸出文本序列,減少傳統流程的誤差累積;抗干擾性強,通過多尺度注意力頭(Multi-Head)并行捕獲不同粒度特征,提升對噪聲、模糊的魯棒性。

3 實驗與結果分析

3.1 數據集準備

TrOCR的性能提升得益于兩階段訓練[11]

1. 預訓練階段:

數據:使用合成文本圖像(如渲染字體)與公開OCR數據集(如IAM手寫數據集)進行大規模預訓練;

任務:采用掩碼語言模型(MLM)與圖像重構聯合訓練,增強模型對殘缺圖像的補全能力,該模型采用官方提供的手寫體識別模型。

2. 微調階段:

數據:針對板坯號場景建立數據集,微調階段數據集由兩部分組成,一部分采用拍照的方式獲取現場真實手寫體板坯號數據集約1000張,如圖3所示,另一部分根據現場板坯號的命名規則和公開的字母、數字手寫體數據集生成20000張數據集,如圖4所示,這種方式解決了現場數據集不足的問題,且能夠更好的提高識別模型的泛化性能。訓練數據集按照8:1:1劃分(訓練/驗證/測試集)。

優化:凍結部分Encoder層,僅微調Decoder與頂層Encoder,避免小數據過擬合。

圖片3 

圖3 現場手寫體板坯號

圖片4 

圖4 板坯號規則生成圖片

 

3.2 實驗環境

本文所提基于TrOCR模型的板坯號識別算法的實驗基于Pytorch框架,運行環境:Linux Ubuntu 20.04操作系統,CPU型號:Intel(R) Xeon(R) Silver 4316 CPU,CPU主頻:2.3GH,服務器內存:128GB DDR4,顯卡型號:A6000,顯存:48GB。

3.3 實驗結果對比分析

為進一步證明本文算法的有效改進,本文同時將其與其他經典網絡模型進行橫向比較,識別效果如圖5所示,比較結果如表3。


圖片5 

圖5 識別效果


表1 TrOCR與傳統方法對比實驗

方法

準確率(反光場景)

推理速度(FPS

參數規模(M)

CRNN+CTC

78.5%

45

8.3

TrOCR(Base)

92.1%

38

110

TrOCR(Lite)

89.7%

62

48

TrOCR在反光干擾下的識別率顯著優于CRNN(+11.2%),但其參數量較大;通過模型壓縮(如知識蒸餾、量化)可平衡精度與速度(如TrOCR-Lite)。

4 邊緣計算部署及現場應用

工業場景對OCR系統的實時性、穩定性與能效提出嚴苛要求。本文基于NVIDIA Jetson AGX Xavier平臺,實現TrOCR模型的邊緣端部署[12],在保證高精度的同時滿足產線實時處理需求(≥15 FPS)。以下從硬件選型、軟件優化、穩定性驗證三方面展開論述。

4.1 硬件選型與適配性分析

鋼廠產線環境要求OCR系統具備低功耗、抗振動、寬溫域(-20℃~70℃)運行能力。本文對比主流邊緣計算設備:

設備

算力TOPS

功耗(W)

內存(GB)

工業級認證

NVIDIA Jetson AGX Xavier

32

30

32

ISO 9001

Intel NUC 11 Extreme

12

120

64

Raspberry Pi 4B

0.05

5

8

選擇依據,TrOCR模型推理需并行處理視覺特征提?。≧esNet-50)與Transformer解碼,AGX Xavier的512核Volta GPU與8核Carmel CPU滿足15FPS實時性;環境適應性,AGX Xavier通過IP67防塵防水認證,支持寬壓輸入(9V-20V),適應鋼廠電磁干擾環境;30W功耗下提供32TOPS算力,較Intel NUC能效比提升3.8倍。

4.2軟件棧與實時性優化

4.2.1軟件架構設計

部署框架采用模塊化設計,包含:

1)圖像采集層:通過網絡通訊與現場二級系統進行通訊,獲取觸發拍照信號;

2)預處理層:基于OpenCV實現動態ROI提取與透視校正,消除安裝角度偏差;

3)推理引擎:TensorRT加速的TrOCR模型,支持多線程批處理(Batch=4);

4)結果反饋層:通過SOCKET協議與二級系統對接,實現毫秒級數據回傳。

4.2.2 實時性測試

在不同輸入分辨率與批量下測試FPS:

表2 不同輸入分辨率與批量下測試FPS

分辨率

Batch=1

Batch=4

Batch=8

640×480

22 FPS

28 FPS

18 FPS

1280×720

15 FPS

20 FPS

12 FPS

1920×1080

9 FPS

14 FPS

8 FPS

最優配置:選擇1280×720分辨率+Batch=4,平衡速度(20 FPS)與精度(字符級召回率99.1%);延遲分析:端到端處理延遲≤50ms(采集10ms+預處理15ms+推理20ms+通信5ms),滿足產線節拍要求。

4.3 穩定性與可靠性驗證

4.3.1 長時間運行測試

在鋼廠環境下連續運行500小時,溫度控制:GPU核心溫度維持在72℃以下(風扇轉速70%),系統可用性:99.98%.

4.3.2 故障容錯機制

異常檢測:通過心跳包監控設備狀態,發現宕機后3秒內啟動備用節點;數據完整性:采用CRC校驗確保圖像傳輸無損,錯誤重傳率<0.01%;

4.4 應用要求

為現場手寫體更好地識別效果,盡可能提高模型算法的識別準確度,但是由于手寫體因為書寫人員的習慣差異較大,因此也需要制定相關的書寫規范。首先,在書寫過程中盡量保證字體清晰,字間距合適,沒有連筆情況;其次,按照坯號規則進行書寫,避免板坯號部分位的省略;最后,書寫過程中存在寫錯等問題時,盡量劃掉,重新完整書寫板坯號,避免涂改。

5 結論

針對鋼鐵生產場景中手寫板坯號識別難的問題,本文提出了一種基于TrOCR模型的識別方法,并成功實現了其在工業邊緣計算環境中的部署與應用。通過引入多尺度特征融合模塊、自適應數據增強策略以及領域專用字典約束解碼過程,模型在字符模糊、背景復雜及書寫不規范等情況下表現出顯著的魯棒性。實驗結果表明,該模型在鋼廠板坯號數據集上的字符識別準確率達到了89.7%,較傳統CRNN模型提升了11.2%。且對低光照、傾斜拍攝等復雜工況具有顯著適應性,為工業場景OCR落地提供了新思路。另外,本文方法也可移植到標準機打體識別,且識別準確率98%。為工業場景OCR的落地應用提供了新的思路和實踐方案。

參考文獻

[1]R. Smith, An Overview of the Tesseract OCR Engine, in International Conference on Document Analysis & Recognition, 2007.

[2]Pattanayak, A., and S. Biswal. A Novel Technique for Handwritten Text Recognition Using Easy OCR. Semantic Scholar, 2023.

[3]李藝杰, 鄒坤霖, 孫煒等,基于Sauvola算法和神經網絡的圖像自適應二值化方法, 測控技術, 2020.

[4]郭浩,寧初明,韓壽松,等.基于DBNET與CRNN-CTC的自然環境文字識別系統[J].計算機應用與軟件,2023,40(09):132-136.

[5]楊遼,胡曉東,駱劍承等. 板坯號自動識別系統的研究與實現[J].計算機工程與設計,2011,32(02):696-699.DOI:10.16208/j.issn1000-7024.2011.02.056.

[6]霍憲剛,楊恒,趙立峰等. 異型連鑄鋼坯標識與識別裝備系統研發應用[J].山東冶金,2024,46(06):46-49.DOI:10.16727/j.cnki.issn1004-4620.2024.06.007.

[7]Wu, Y., Qian, L. P., Ni, K., et al. Delay-Minimization Nonorthogonal Multiple Access Enabled Multi-User Mobile Edge Computation Offloading. IEEE Journal of Selected Topics in Signal Processing, 2019

[8]Li, M., Lv, T., Cui, L., et al. TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models. AAAI, 2023。

[9]B. Shi, X. Bai, and C. Yao, "An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition," IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017.

[10]P. Pragada and D. R. CH, "Design of an Iterative Method for Telugu Language OCR Leveraging Transformer-Based Models and Adaptive Thresholding," SN Computer Science, 2025.

[11]Wang, S., Zhao, Y., Xu, J., et al. Edge server placement in mobile edge computing. Journal of Parallel and Distributed Computing, 2019

[12]Junhui Zhao, Qiuping Li, Yi Gong, et al. Computation Offloading and Resource Allocation For Cloud Assisted Mobile Edge Computing in Vehicular Networks. IEEE Transactions on Vehicular Technology, 2019 

 
 
[ 技術文獻搜索 ]  [ 加入收藏 ]  [ 告訴好友 ]  [ 打印本文 ]  [ 關閉窗口 ]

 

 
?
 
關于我們 聯系方式 付款方式 電子期刊 會員服務 版權聲明 冀ICP備13016017號-1