深度學習知識地圖 · 電腦視覺
影像分割
U-Net, Mask R-CNN
觀念教學
電腦視覺四大核心任務,用「一張有貓有狗的照片」來理解:
1. 物件偵測(Object Detection)
用框框把物體圈出來,告訴你「這裡有一隻貓、那裡有一隻狗」。
只畫方框,不管輪廓細節。
代表模型:YOLO、Faster R-CNN
2. 語義分割(Semantic Segmentation)
把每個像素塗色:所有貓的像素塗紅色、所有狗的像素塗藍色、背景塗灰色。
但如果有兩隻貓,它們會被塗成同一個顏色,分不出誰是誰。
代表模型:U-Net、DeepLab
3. 實例分割(Instance Segmentation)
語義分割的升級版,不只塗色還分個體:貓A 紅色、貓B 橘色、狗 藍色。
每個物體都有自己的精確輪廓遮罩。
代表模型:Mask R-CNN
4. 全景分割(Panoptic Segmentation)
終極大合體,前景物體用實例分割(分個體),背景用語義分割(天空、道路、草地各塗一色)。
整張圖每個像素都有歸屬,沒有遺漏。
代表模型:Panoptic FPN、Mask2Former
簡單記法:偵測畫框框 → 語義塗顏色 → 實例分個體 → 全景全都包
應用場景
評估指標
iPAS 歷屆考題詳解(3 題)
先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。
在自駕車影像辨識系統中,開發團隊希望模型能同時辨識每個像素所屬的物件類別(例如道路、建築、行人),又能區分出同類物件的不同個體(例如多位行人)。此時最適合採用下列哪一項電腦視覺技術?
- A語義分割(Semantic Segmentation)
- B物件偵測(Object Detection)
- C實例分割(Instance Segmentation)
- D全景分割(Panoptic Segmentation)
看正解與逐選項詳解
正解:D
某自駕車感知系統需要在同一張影像中同時完成道路、建築、行人的逐像素分類,並且能夠區分畫面中兩名相鄰行人(標記為「行人#1」和「行人#2」)。工程師在選擇語義分割(Semantic Segmentation)與實例分割(Instance Segmentation)時,請問兩者的根本差異為何?
- A實例分割對每個像素進行分類但不產生 Bounding Box;語義分割產生Bounding Box 但不進行像素級標記
- B實例分割僅用於影像層級的類別分類,語義分割才進行逐像素標記
- C語義分割將每個像素分配至預定義類別,但同一類別內的不同個體無法區分;實例分割能對同一類別的不同物件(如兩名行人)分別建立獨立遮罩(Mask)
- D語義分割與實例分割皆為逐像素分類任務,但兩者在是否需要區分不同物件個體上並無差異
看正解與逐選項詳解
正解:C
某大型超市的防損系統需要即時偵測多名顧客各自手持的購物籃、手機與商品,並需對每個物件進行精確區域標記(Pixel-level Mask),同時能區分畫面中不同個體(即使不同顧客拿著相同商品,也需分別標記)。請問下列哪一項技術最適合此場景的需求?
- A影像分類(Image Classification)
- B目標檢測(Object Detection)
- C實例分割(Instance Segmentation)
- D語義分割(Semantic Segmentation)
看正解與逐選項詳解
正解:C