四種計算機視覺任務的輸出結果比較示意圖

← INSIGHTS & PERSPECTIVES | 機器學習

計算機視覺四大任務介紹:分類、語義分割、目標檢測與實例分割

常見的 Computer Vision Tasks 盤點:影像分類、物件偵測、語意分割、實例分割、姿態估測等電腦視覺任務的定義、輸出形式與代表模型整理,快速建立 Computer Vision 的任務地圖與選型基礎觀念。

剛入門計算機視覺時,常常分不清分類、語義分割、目標檢測和實例分割的差別。這篇文章用一張圖和簡短的說明,整理這四種常見 CV 任務各自的輸出形式與典型應用,並附上代表性模型與資料集。

四種 CV 任務的差別在哪裡?

四種計算機視覺任務的輸出結果比較圖
  • 分類(Classification):只回答「圖裡是什麼」,輸出一個類別標籤。
  • 目標檢測(Object Detection):回答「圖裡有什麼、在哪裡」,輸出邊界框與類別。
  • 語義分割(Semantic Segmentation):為每個像素分類,同類物件不區分個體。
  • 實例分割(Instance Segmentation):像素級分類並區分每個獨立個體。

什麼是分類(Classification)?

分類任務是將輸入圖像分為不同的類別或類別之一。例如,給定一張圖像,分類任務的目標是確定圖像中顯示的對像是什麼,比如貓、狗、汽車、飛機等。這通常涉及訓練一個分類器,以便它能夠識別圖像中的特定特徵並將其歸類到正確的類別中。

什麼是語義分割(Semantic Segmentation)?

語義分割任務是為圖像中的每個像素分配一個類別標籤,從而實現像素級別的分類。與分類任務不同,語義分割不僅關注對象的類型,還考慮了對象的位置和邊界。這在許多應用中很有用,比如圖像分割、醫學圖像分析等。

語義分割旨在將圖像中的每個像素分配給預定義的語義類別。在語義分割中,每個像素都被標記為屬於某個特定的類別,如人、車、樹等。語義分割遵循像素級別的分類,因此通常使用像素級別的掩碼(即 "masks")來表示圖像中每個類別的區域。這些分割掩碼是二進制圖像,其中每個像素要嘛屬於某個類別,要嘛不屬於。

有名模型:U-Net

和實例分割最大的不同是它的輸入會是兩張圖片,一張為原圖,一張為掩碼的圖。

語義分割範例截圖:原圖
語義分割範例截圖:對應的掩碼圖

什麼是目標檢測(Object Detection)?

目標檢測任務涉及在圖像中識別並定位多個不同類別的對象。相比於分類任務,目標檢測不僅需要標識對象的類別,還需要確定它們的位置和邊界框。常見的目標檢測算法可以提供每個檢測到的對象的邊界框和類別信息。具代表性的演算法包括 Faster R-CNN、YOLO、SSD 等。

什麼是實例分割(Instance Segmentation)?

實例分割任務結合了目標檢測和語義分割的概念,不僅要對每個對象進行分類,還需要在像素級別區分出每個對象的邊界。實例分割旨在識別圖像中的每個獨立實例並為每個實例分配獨特的標籤,從而在一個圖像中區分出不同的對象。

例如 COCO Segmentation:COCO(Common Objects in Context)是一個廣泛使用的圖像識別和分割數據集,其中包含了多種物體類別的圖像以及每個圖像中物體的分割標註。COCO Segmentation 數據集中的分割信息通常是用多邊形輪廓來表示物體的形狀。這種分割方法在標註上更靈活,可以準確地表示物體的複雜形狀,但同時也需要更多的標註工作。

延伸閱讀

常見問題

Q語義分割和實例分割差在哪裡?

語義分割只按類別為每個像素分類,同一類的所有物件視為一體;實例分割則會在像素級別上區分每一個獨立物件,例如畫面中的兩隻狗會被標成兩個不同實例。

Q目標檢測有哪些代表模型?

Faster R-CNN、YOLO 系列、SSD 等。YOLO 因速度快、易用性高,是實務上最常被使用的選擇。

QCOCO 資料集的分割標註用什麼格式表示?

COCO Segmentation 用多邊形輪廓(polygon)表示物體形狀,標註彈性高、能表達複雜形狀,但標註成本也較高。

參考資料

最後更新

2026-08-28(原文發布於 2023-08-23,本文保留原始筆記內容並補上 GEO 結構。)

關於作者 {#author}

Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。

首次發布:2023-08-23