深度學習知識地圖 · 電腦視覺
OCR
光學字元辨識
觀念教學
拍一張名片,上面的字直接變成可以複製貼上的文字 — OCR 做的就是把「圖片裡的字」變成「機器讀得懂的字」。
核心觀念
OCR(Optical Character Recognition,光學字元辨識)將影像中的文字轉換為機器可讀文本。現代 OCR 是接力賽:CNN 負責「看圖」,定位文字區域、萃取特徵;RNN 或 Transformer 負責「理解序列」,把特徵解碼成一串文字。兩棒接好,準確率已經很高。
白話理解
財會部門月底堆成山的發票與收據:OCR 掃描後自動抓出統一編號、金額、日期,直接匯入系統 — 紙本到數位一次到位,對帳從三天縮成三小時。
關鍵細節
- 典型場景:車牌辨識、文件數位化、票據辨識、證件掃描、手寫辨識
- 優點:自動化「紙本 → 數位」,大幅節省人力
- 弱點:手寫體、模糊影像、特殊字型仍有挑戰
- 多語言混合(中英夾雜)辨識較困難
- 評估指標:CER(Character Error Rate,字元錯誤率)與 WER(Word Error Rate,詞錯誤率),都是錯誤率,越低越好
🎯 口訣:OCR = CNN 看圖 + RNN 讀字;CER、WER 是錯誤率,越低越好。
iPAS 考點
分類題:OCR 屬電腦視覺應用(輸入是影像),別因輸出是文字就誤選 NLP — 實務常見「OCR 抓字、NLP 理解」前後接力。情境題給「大量紙本文件數位化」「車牌自動辨識」→ 答 OCR。指標題:CER 與 WER 是錯誤率,方向和準確率相反,陷阱選項最愛寫成「越高越好」。
應用場景
評估指標
iPAS 歷屆考題詳解(1 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
工程師使用 PyTorch 建立 OCR 訓練 pipeline,並對手寫字母資料集套用以下程式進行資料增強(Transform): import torchvision.transforms as transforms transform = transforms.Compose([ transforms.RandomHorizontalFlip(p=0.5), transforms.RandomRotation(15), transforms.ColorJitter(brightness=0.3), transforms.ToTensor(), ]) 模型在訓練過程中顯示驗證損失(Validation Loss)持續下降,但實際部署後,系統在辨識「b/d/p/q」類字母錯誤率異常偏高。下列何者為最可能的根本原因?
- ARandomRotation(15) 角度過大導致特徵變形,應降至 5 度以內
- BRandomHorizontalFlip 破壞字母方向語義,使模型以 50% 機率學到鏡像錯誤標籤
- CColorJitter 改變筆畫灰階,導致邊緣偵測特徵失真
- DToTensor( ) 應放在所有幾何變換之前才能保持座標對應正確
看正解與逐選項詳解
正解:B