深度學習知識地圖 · 電腦視覺

電腦視覺

CNN, YOLO

在互動地圖中開啟 回深度學習知識地圖

觀念教學

電腦視覺(Computer Vision)讓機器「看見」並看懂影像:照片裡有什麼、東西在哪裡、輪廓長怎樣、字寫了什麼 — 人眼做的事,它都想接手。

核心觀念

四大任務由淺入深,各配各的尺:

  • 影像分類(Classification):這張圖是什麼 — 看準確率Top-1 / Top-5 Accuracy(ImageNet 準確率是經典戰場)
  • 物件偵測(Object Detection):什麼東西在哪裡、框出來 — 看 mAPIoU(預測框和真實框的重疊度),即時性看 FPS
  • 影像分割(Segmentation):逐像素描出輪廓 — 看 Dice Coefficient(醫學影像最愛)與 IoU
  • OCR:讀出影像中的文字 — 看 CER / WER(字元與詞錯誤率)

白話理解

台灣電子廠的產線品檢:攝影機拍下電路板,模型即時判斷焊接瑕疵 — 分類(良品或瑕疵)加偵測(瑕疵在哪),高產量下用 FPS 確認跟得上產線,用 F1-Score 平衡漏檢與誤殺,取代人工目視。同一套「眼睛」換個場景,就是自動駕駛、人臉辨識、醫學影像、手機拍照美顏。

技術演進

CNN 用卷積抓局部特徵YOLO 單階段掃全圖、做到即時偵測ViT 把圖切塊、用全局注意力理解整張圖。一句話:局部 → 即時 → 全局。

自監督路線也是考點:CLIP 用網路上的圖文配對學圖像與文字的對應;DINO 只用純影像做自我蒸餾 — 兩者都免人工標註,差在資料型態。

🎯 口訣:分類問是什麼、偵測問在哪裡、分割描輪廓、OCR 讀文字。

iPAS 考點

兩個真題方向。其一,產線瑕疵檢測題常反著問「何者最不符合此應用展現的核心能力」— 情境展現的是影像辨識、物件偵測、即時視覺推論與自動化品檢;跟視覺無關的能力(自然語言理解、語音處理)就是答案。其二,CLIP 對 DINO:同為自監督學習,差別在訓練資料型態 — CLIP 吃圖文配對、DINO 只吃純影像。指標配對題也常見:偵測配 mAP 與 IoU、分割配 Dice、分類配 Top-5、即時配 FPS。

📝 本節掛載 2 題 iPAS 歷屆試題 — 讀完往下到「iPAS 考題練習」直接實戰。

應用場景

影像分類人臉辨識醫學影像分析即時物件偵測自動駕駛監控系統機器人視覺醫學影像分割車道線/行人偵測去背/背景替換車牌辨識文件數位化票據辨識證件掃描物件偵測圖像分割

評估指標

準確率F1-ScoreTop-5 AccuracymAPIoUFPSDice CoefficientCERWERTop-1 AccuracyImageNet 準確率

iPAS 歷屆考題詳解(4 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第3題

某電子製造公司在產線上導入AI 系統,自動判斷電路板是否存在焊接瑕疵,並取代人工目視檢查。該系統需處理大量產品外觀影像,並在高產量環境下短時間內完成品質判定。下列何者最不符合此應用所展現的AI 核心技術能力?

  1. A自然語言處理(Natural Language Processing);
  2. B電腦視覺(Computer Vision);
  3. C異常偵測(Anomaly Detection);
  4. D診斷性分析(Diagnostic Analytics)
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 本題問「最不符合」該應用展現的 AI 核心技術能力。焊接瑕疵檢查處理的是產品外觀影像,核心能力是電腦視覺(影像辨識)、異常偵測(判定偏離正常的瑕疵樣本)與診斷性分析(判定品質狀態)。自然語言處理(NLP)處理的是文字與語言內容,與影像瑕疵判定沒有直接關聯,因此是最不符合的選項。 【為何其他選項錯了?】 - (B):電腦視覺正是處理產品外觀影像、辨識焊接瑕疵的核心技術,與本應用高度相關,不是「最不符合」的選項。 - (C):焊接瑕疵屬於偏離正常樣態的異常樣本,系統自動判定瑕疵有無,正是異常偵測能力的展現,與本應用密切相關。 - (D):系統判定產品是否存在瑕疵、支援品質判定,屬於分析「發生了什麼問題」的診斷性分析範疇,亦與本應用相關。 提示:「最不符合」型題目先找與情境無關的技術:影像瑕疵判定的場景中,處理文字語意的 NLP 關聯最低。
115年第二次初級AI應用規劃師第一科人工智慧基礎概論 第34題

CLIP 與DINO 皆屬於自監督學習(Self-supervised Learning)模型,但其訓練資料來源有所不同。下列何者最能正確敘述兩者在訓練資料型態上的差異?

  1. A皆使用有標註圖像資料進行監督式學習;
  2. B皆使用未標註圖像資料進行自監督學習;
  3. CCLIP 使用圖像與文字配對資料,DINO 使用未標註圖像資料;
  4. DCLIP 使用未標註圖像資料,DINO 使用圖像與文字配對資料
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 CLIP 以大規模「圖像-文字配對」資料進行對比式預訓練,學習影像與文字的跨模態對齊;DINO 則以「未標註圖像」進行自監督學習,透過自蒸餾等機制從影像本身學習視覺表徵。兩者同屬不依賴人工類別標註的訓練路線,但資料型態不同:CLIP 需要圖文配對資料,DINO 只需純影像資料。 【為何其他選項錯了?】 - (A):兩者皆非使用人工標註類別的傳統監督式學習;CLIP 的訓練訊號來自自然配對的圖文資料,DINO 則完全不使用標籤。 - (B):DINO 確實使用未標註圖像,但 CLIP 需要圖像與文字的配對資料,並非兩者皆只用未標註圖像。 - (D):資料來源描述對調:需要圖文配對資料的是 CLIP,使用未標註圖像的是 DINO。 提示:CLIP 對應「圖文配對」,DINO 對應「未標註影像自監督」;選項僅是這兩個特徵的排列組合。
114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第35題

某媒體公司計畫導入 CLIP(Contrastive Language–Image Pre- training)模型,以協助大量影像自動標註與搜尋,並希望在無需新增標訓資料的情況下,僅透過文字提示(Text Prompt)即可識別影像內容。請問此應用情境中,CLIP能夠達成的關鍵技術特性為何?

  1. A透過圖文對比式學習(Contrastive Learning)將影像與文字映射至共同嵌入空間(Shared Embedding Space),可直接以語意相似度進行零樣本分類
  2. B透過影像增強與特徵擴散降低標訓資料需求
  3. C以監督式學習結合多層感知器(Multilayer Perceptron, MLP)進行影像特徵分類
  4. D以自迴歸生成模型(Autoregressive Model)逐步生成文字標籤描述影像內容
看正解與逐選項詳解

正解:A

正確答案:(A) 【正解解析】 CLIP 以對比式學習(Contrastive Learning)在數億組圖文配對上訓練,讓影像編碼器與文字編碼器把成對的圖與文映射到共同嵌入空間(Shared Embedding Space)中相近的位置。分類時只要把「一張某某的照片」這類文字提示編碼成向量,和影像向量計算語意相似度,就能完成零樣本分類(Zero-shot Classification),不需新增標註資料,正符合題目「僅用文字提示識別影像」的需求。 【為何其他選項錯了?】 - (B):影像增強與特徵擴散是資料層技巧,不是 CLIP 的核心機制,也無法解釋「以文字當標籤直接分類」的能力。 - (C):CLIP 的預訓練不是傳統監督式分類,不依賴固定類別標籤,MLP 分類頭也不是它的關鍵特性。 - (D):逐步生成文字描述是影像描述(Image Captioning)或自迴歸模型的作法;CLIP 以相似度比對做判別,不生成文字。 提示:CLIP 將影像與文字映射到共同向量空間,文字提示即可作為分類標籤,故能零樣本分類。
115年第一次中級AI應用規劃師第三科機器學習技術與應用 第4題

某 AI 團隊同時開發多個影像辨識系統,並在訓練流程中統一加入資料擴增策略(包含隨機水平翻轉)以提升模型泛化能力。實驗後發現,部分任務的測試表現明顯下降。下列哪一項任務最可能因該資料擴增策略引入語意錯誤(Semantic Inconsistency),使同一樣本在翻轉後對應不同類別標籤,進而影響模型學習?

  1. A寵物監控中的貓狗分類
  2. B車輛辨識中的車型分類
  3. C手寫數字辨識
  4. D道路場景中的行人偵測
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 隨機水平翻轉的隱含假設是「鏡像後語意不變」。手寫數字的字形具有方向性:2、3、7 翻轉後筆畫方向顛倒、不再是合法寫法,部分字形鏡像後甚至更接近其他字元,但標籤仍是原本的類別——同一樣本翻轉後,影像語意與標籤已經對不上,模型等於被餵入標註錯誤的訓練資料,測試表現自然下降,這就是題目所稱的語意錯誤(Semantic Inconsistency)。 【為何其他選項錯了?】 - (A):貓翻轉後仍是貓、狗仍是狗,水平翻轉是貓狗分類最安全常用的增強手法之一。 - (B):車輛左右鏡像不會改變車型類別,車頭朝左或朝右都是同一款車。 - (D):行人偵測中,翻轉後行人仍是行人,只要邊界框座標一併翻轉即可,類別語意不受影響。 提示:對數字、字母、交通標誌等具方向性的符號類資料,鏡像增強可能改變語意,套用前須逐類檢視。

相關節點