深度學習知識地圖 · 電腦視覺
電腦視覺
CNN, YOLO
觀念教學
電腦視覺(Computer Vision)讓機器「看見」並看懂影像:照片裡有什麼、東西在哪裡、輪廓長怎樣、字寫了什麼 — 人眼做的事,它都想接手。
核心觀念
四大任務由淺入深,各配各的尺:
- 影像分類(Classification):這張圖是什麼 — 看準確率與 Top-1 / Top-5 Accuracy(ImageNet 準確率是經典戰場)
- 物件偵測(Object Detection):什麼東西在哪裡、框出來 — 看 mAP 與 IoU(預測框和真實框的重疊度),即時性看 FPS
- 影像分割(Segmentation):逐像素描出輪廓 — 看 Dice Coefficient(醫學影像最愛)與 IoU
- OCR:讀出影像中的文字 — 看 CER / WER(字元與詞錯誤率)
白話理解
台灣電子廠的產線品檢:攝影機拍下電路板,模型即時判斷焊接瑕疵 — 分類(良品或瑕疵)加偵測(瑕疵在哪),高產量下用 FPS 確認跟得上產線,用 F1-Score 平衡漏檢與誤殺,取代人工目視。同一套「眼睛」換個場景,就是自動駕駛、人臉辨識、醫學影像、手機拍照美顏。
技術演進
CNN 用卷積抓局部特徵 → YOLO 單階段掃全圖、做到即時偵測 → ViT 把圖切塊、用全局注意力理解整張圖。一句話:局部 → 即時 → 全局。
自監督路線也是考點:CLIP 用網路上的圖文配對學圖像與文字的對應;DINO 只用純影像做自我蒸餾 — 兩者都免人工標註,差在資料型態。
🎯 口訣:分類問是什麼、偵測問在哪裡、分割描輪廓、OCR 讀文字。
iPAS 考點
兩個真題方向。其一,產線瑕疵檢測題常反著問「何者最不符合此應用展現的核心能力」— 情境展現的是影像辨識、物件偵測、即時視覺推論與自動化品檢;跟視覺無關的能力(自然語言理解、語音處理)就是答案。其二,CLIP 對 DINO:同為自監督學習,差別在訓練資料型態 — CLIP 吃圖文配對、DINO 只吃純影像。指標配對題也常見:偵測配 mAP 與 IoU、分割配 Dice、分類配 Top-5、即時配 FPS。
📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。
應用場景
評估指標
iPAS 歷屆考題詳解(4 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
某電子製造公司在產線上導入AI 系統,自動判斷電路板是否存在焊接瑕疵,並取代人工目視檢查。該系統需處理大量產品外觀影像,並在高產量環境下短時間內完成品質判定。下列何者最不符合此應用所展現的AI 核心技術能力?
- A自然語言處理(Natural Language Processing);
- B電腦視覺(Computer Vision);
- C異常偵測(Anomaly Detection);
- D診斷性分析(Diagnostic Analytics)
看正解與逐選項詳解
正解:A
CLIP 與DINO 皆屬於自監督學習(Self-supervised Learning)模型,但其訓練資料來源有所不同。下列何者最能正確敘述兩者在訓練資料型態上的差異?
- A皆使用有標註圖像資料進行監督式學習;
- B皆使用未標註圖像資料進行自監督學習;
- CCLIP 使用圖像與文字配對資料,DINO 使用未標註圖像資料;
- DCLIP 使用未標註圖像資料,DINO 使用圖像與文字配對資料
看正解與逐選項詳解
正解:C
某媒體公司計畫導入 CLIP(Contrastive Language–Image Pre- training)模型,以協助大量影像自動標註與搜尋,並希望在無需新增標訓資料的情況下,僅透過文字提示(Text Prompt)即可識別影像內容。請問此應用情境中,CLIP能夠達成的關鍵技術特性為何?
- A透過圖文對比式學習(Contrastive Learning)將影像與文字映射至共同嵌入空間(Shared Embedding Space),可直接以語意相似度進行零樣本分類
- B透過影像增強與特徵擴散降低標訓資料需求
- C以監督式學習結合多層感知器(Multilayer Perceptron, MLP)進行影像特徵分類
- D以自迴歸生成模型(Autoregressive Model)逐步生成文字標籤描述影像內容
看正解與逐選項詳解
正解:A
某 AI 團隊同時開發多個影像辨識系統,並在訓練流程中統一加入資料擴增策略(包含隨機水平翻轉)以提升模型泛化能力。實驗後發現,部分任務的測試表現明顯下降。下列哪一項任務最可能因該資料擴增策略引入語意錯誤(Semantic Inconsistency),使同一樣本在翻轉後對應不同類別標籤,進而影響模型學習?
- A寵物監控中的貓狗分類
- B車輛辨識中的車型分類
- C手寫數字辨識
- D道路場景中的行人偵測
看正解與逐選項詳解
正解:C