深度學習知識地圖 · 電腦視覺

OCR

光學字元辨識

在互動地圖中開啟 回深度學習知識地圖

觀念教學

拍一張名片,上面的字直接變成可以複製貼上的文字 — OCR 做的就是把「圖片裡的字」變成「機器讀得懂的字」。

核心觀念

OCR(Optical Character Recognition,光學字元辨識)將影像中的文字轉換為機器可讀文本。現代 OCR 是接力賽:CNN 負責「看圖」,定位文字區域、萃取特徵;RNN 或 Transformer 負責「理解序列」,把特徵解碼成一串文字。兩棒接好,準確率已經很高。

白話理解

財會部門月底堆成山的發票與收據:OCR 掃描後自動抓出統一編號、金額、日期,直接匯入系統 — 紙本到數位一次到位,對帳從三天縮成三小時。

關鍵細節

  • 典型場景:車牌辨識、文件數位化、票據辨識、證件掃描、手寫辨識
  • 優點:自動化「紙本 → 數位」,大幅節省人力
  • 弱點:手寫體、模糊影像、特殊字型仍有挑戰
  • 多語言混合(中英夾雜)辨識較困難
  • 評估指標:CER(Character Error Rate,字元錯誤率)WER(Word Error Rate,詞錯誤率),都是錯誤率,越低越好
🎯 口訣:OCR = CNN 看圖 + RNN 讀字;CER、WER 是錯誤率,越低越好。

iPAS 考點

分類題:OCR 屬電腦視覺應用(輸入是影像),別因輸出是文字就誤選 NLP — 實務常見「OCR 抓字、NLP 理解」前後接力。情境題給「大量紙本文件數位化」「車牌自動辨識」→ 答 OCR。指標題:CER 與 WER 是錯誤率,方向和準確率相反,陷阱選項最愛寫成「越高越好」。

應用場景

車牌辨識文件數位化票據辨識證件掃描

評估指標

Character Error Rate (CER)Word Error Rate (WER)

iPAS 歷屆考題詳解(1 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第一次中級AI應用規劃師第三科機器學習技術與應用 第41題

工程師使用 PyTorch 建立 OCR 訓練 pipeline,並對手寫字母資料集套用以下程式進行資料增強(Transform): import torchvision.transforms as transforms transform = transforms.Compose([  transforms.RandomHorizontalFlip(p=0.5),  transforms.RandomRotation(15),  transforms.ColorJitter(brightness=0.3),  transforms.ToTensor(), ]) 模型在訓練過程中顯示驗證損失(Validation Loss)持續下降,但實際部署後,系統在辨識「b/d/p/q」類字母錯誤率異常偏高。下列何者為最可能的根本原因?

  1. ARandomRotation(15) 角度過大導致特徵變形,應降至 5 度以內
  2. BRandomHorizontalFlip 破壞字母方向語義,使模型以 50% 機率學到鏡像錯誤標籤
  3. CColorJitter 改變筆畫灰階,導致邊緣偵測特徵失真
  4. DToTensor( ) 應放在所有幾何變換之前才能保持座標對應正確
看正解與逐選項詳解

正解:B

正確答案:(B) 【正解解析】 RandomHorizontalFlip(p=0.5) 對字母資料具破壞性:b 水平翻轉後字形即為 d、p 翻轉後即為 q(反之亦然),但標籤沒有跟著改變——等於有一半機率餵給模型「字形是 d 卻標成 b」的矛盾樣本。訓練中模型被迫在鏡像混淆中折衷;且只要驗證資料也經過同一套增強流程,驗證損失仍會持續下降,問題因此被掩蓋。一到真實部署,b/d/p/q 這組互為鏡像的字母錯誤率便顯著偏高,與題目症狀完全吻合。 【為何其他選項錯了?】 - (A):±15 度旋轉是手寫辨識的常規增強範圍,能增加字形多樣性,不會專門造成互為鏡像的字母對混淆。 - (C):ColorJitter 只調整亮度等灰階屬性,不改變字形的左右方向,與 b/d、p/q 的混淆機制無關。 - (D):慣例上 ToTensor 本來就放在幾何變換之後(先在 PIL 影像上做幾何變換、最後轉為張量),不存在座標對應錯誤的問題,此敘述與實務慣例不符。 提示:套用增強前先檢視:該變換是否會使某一類樣本變成另一類?字母與數字對鏡像翻轉尤其敏感。

相關節點