深度學習知識地圖 · 電腦視覺

影像分割

U-Net, Mask R-CNN

在互動地圖中開啟 回深度學習知識地圖

觀念教學

電腦視覺四大核心任務,用「一張有貓有狗的照片」來理解:

1. 物件偵測(Object Detection)

用框框把物體圈出來,告訴你「這裡有一隻貓、那裡有一隻狗」。
只畫方框,不管輪廓細節。
代表模型:YOLO、Faster R-CNN

2. 語義分割(Semantic Segmentation)

把每個像素塗色:所有貓的像素塗紅色、所有狗的像素塗藍色、背景塗灰色。
但如果有兩隻貓,它們會被塗成同一個顏色,分不出誰是誰。
代表模型:U-Net、DeepLab

3. 實例分割(Instance Segmentation)

語義分割的升級版,不只塗色還分個體:貓A 紅色、貓B 橘色、狗 藍色。
每個物體都有自己的精確輪廓遮罩。
代表模型:Mask R-CNN

4. 全景分割(Panoptic Segmentation)

終極大合體,前景物體用實例分割(分個體),背景用語義分割(天空、道路、草地各塗一色)。
整張圖每個像素都有歸屬,沒有遺漏。
代表模型:Panoptic FPN、Mask2Former

簡單記法:偵測畫框框 → 語義塗顏色 → 實例分個體 → 全景全都包

應用場景

物件偵測 - 畫框定位語義分割 - 像素分類實例分割 - 個體輪廓全景分割 - 全圖理解醫學影像 (腫瘤偵測)自動駕駛 (車道/行人)去背/背景替換

評估指標

IoU (Intersection over Union)Dice CoefficientmAP

iPAS 歷屆考題詳解(3 題)

先自行作答,再展開詳解。題目出處均為 iPAS AI 應用規劃師正式考題,著作權屬原主辦單位。

114年第二梯次中級AI應用規劃師第一科人工智慧技術應用與規劃 第34題

在自駕車影像辨識系統中,開發團隊希望模型能同時辨識每個像素所屬的物件類別(例如道路、建築、行人),又能區分出同類物件的不同個體(例如多位行人)。此時最適合採用下列哪一項電腦視覺技術?

  1. A語義分割(Semantic Segmentation)
  2. B物件偵測(Object Detection)
  3. C實例分割(Instance Segmentation)
  4. D全景分割(Panoptic Segmentation)
看正解與逐選項詳解

正解:D

正確答案:(D) 【正解解析】 題目同時要求兩件事:每個像素都要有類別標籤(連道路、建築這類不可數的背景「stuff」也要標),又要能區分同類物件的不同個體(行人甲與行人乙)。全景分割(Panoptic Segmentation)等於語義分割加實例分割的整合:對可數物件(things)給實例級標註、對背景區域給語義標註,是唯一同時滿足兩項需求的技術。 【為何其他選項錯了?】 - (A):語義分割(Semantic Segmentation)只給像素類別,同類的多位行人會合併為同一塊「行人」區域,無法區分個體。 - (B):物件偵測(Object Detection)只輸出邊界框,沒有像素級標註;道路、天空這類背景更不在偵測範圍內。 - (C):實例分割(Instance Segmentation)能區分個體,但通常只處理可數物件,不對道路、建築等背景做完整像素分類,缺少「每個像素都有類別」的另一半需求。 提示:語義分割覆蓋全圖類別、實例分割區分個體;兩項需求兼具即為全景分割。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第6題

某自駕車感知系統需要在同一張影像中同時完成道路、建築、行人的逐像素分類,並且能夠區分畫面中兩名相鄰行人(標記為「行人#1」和「行人#2」)。工程師在選擇語義分割(Semantic Segmentation)與實例分割(Instance Segmentation)時,請問兩者的根本差異為何?

  1. A實例分割對每個像素進行分類但不產生 Bounding Box;語義分割產生Bounding Box 但不進行像素級標記
  2. B實例分割僅用於影像層級的類別分類,語義分割才進行逐像素標記
  3. C語義分割將每個像素分配至預定義類別,但同一類別內的不同個體無法區分;實例分割能對同一類別的不同物件(如兩名行人)分別建立獨立遮罩(Mask)
  4. D語義分割與實例分割皆為逐像素分類任務,但兩者在是否需要區分不同物件個體上並無差異
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 語義分割(Semantic Segmentation)把每個像素分到預定義類別(道路、建築、行人),但同一類別的所有個體會被標成同一片——兩名相鄰行人在輸出中合併為同一塊「行人」區域,無法區分個體。實例分割(Instance Segmentation)則在像素級標記之上再區分個體,為行人#1、行人#2 各自產生獨立遮罩(Mask),Mask R-CNN 即是代表模型。自駕場景需要追蹤個別行人的動向,實例級的區分能力正是兩者的根本差異。 【為何其他選項錯了?】 - (A):描述完全顛倒。語義分割不產生 Bounding Box,而是逐像素分類;實例分割(如 Mask R-CNN)反而常以「偵測框加框內像素遮罩」的方式運作。 - (B):影像層級的類別分類是影像分類(Image Classification)的任務;實例分割是像素級任務,此選項把任務層級搞錯。 - (D):「並無差異」直接否定了兩者定義上的分野——是否區分同類別的不同個體,正是這兩個任務的分水嶺。 提示:語義分割只分類別,實例分割進一步區分同類別中的不同個體。
115年第一次中級AI應用規劃師第一科人工智慧技術應用與規劃 第7題

某大型超市的防損系統需要即時偵測多名顧客各自手持的購物籃、手機與商品,並需對每個物件進行精確區域標記(Pixel-level Mask),同時能區分畫面中不同個體(即使不同顧客拿著相同商品,也需分別標記)。請問下列哪一項技術最適合此場景的需求?

  1. A影像分類(Image Classification)
  2. B目標檢測(Object Detection)
  3. C實例分割(Instance Segmentation)
  4. D語義分割(Semantic Segmentation)
看正解與逐選項詳解

正解:C

正確答案:(C) 【正解解析】 拆解需求:一要「像素級精確區域標記(Mask)」,二要「區分不同個體」(不同顧客拿同款商品也要分開標)。同時滿足這兩項的只有實例分割(Instance Segmentation):它為每個物件個體輸出獨立的像素級遮罩,既有形狀輪廓又有個體身分,Mask R-CNN、YOLACT 等都是典型方案,適合防損系統追蹤各顧客手持的購物籃、手機與商品。 【為何其他選項錯了?】 - (A):影像分類只回答「這張圖裡有什麼」,對整張影像給一個標籤,沒有位置也沒有輪廓,無法滿足逐物件標記的需求。 - (B):目標檢測(Object Detection)輸出矩形 Bounding Box 與類別,能區分個體但只有粗略方框,無法滿足「像素級精確區域標記」的要求。 - (D):語義分割有像素級標記,但同類別會融成一片——兩位顧客的同款手機會被標成同一塊「手機」區域,無法區分個體。 提示:像素級 Mask 對應分割技術,區分個體對應 Instance;兩項需求同時成立,即為實例分割。

相關節點