電腦視覺任務示意圖,包含影像分類與物件偵測

← INSIGHTS & PERSPECTIVES | 機器學習

常見的 Computer Vision Tasks 介紹:分類、語義分割、目標檢測與實例分割

整理四種常見的 Computer Vision Tasks:分類、語義分割、目標檢測與實例分割,說明各任務的輸出形式、代表模型如 U-Net、YOLO、Mask R-CNN,以及 COCO 資料集的應用,幫你快速建立電腦視覺任務的整體觀念。

下面是四種常見的計算機視覺任務的簡要介紹:

四種常見計算機視覺任務比較示意圖

什麼是分類(Classification)?

分類任務是將輸入圖像分為不同的類別或類別之一。例如,給定一張圖像,分類任務的目標是確定圖像中顯示的對像是什麼,比如貓、狗、汽車、飛機等。這通常涉及訓練一個分類器,以便它能夠識別圖像中的特定特徵並將其歸類到正確的類別中。

語義分割(Semantic Segmentation)是什麼?

語義分割任務是為圖像中的每個像素分配一個類別標籤,從而實現像素級別的分類。與分類任務不同,語義分割不僅關注對象的類型,還考慮了對象的位置和邊界。這在許多應用中很有用,比如圖像分割、醫學圖像分析等。

語義分割是一種計算機視覺任務,旨在將圖像中的每個像素分配給預定義的語義類別。在語義分割中,每個像素都被標記為屬於某個特定的類別,如人、車、樹等。語義分割遵循像素級別的分類,因此通常使用像素級別的掩碼(即 `masks`)來表示圖像中每個類別的區域。這些分割掩碼是二進製圖像,其中每個像素要嘛屬於某個類別,要嘛不屬於。

有名模型: U-Net

和實例分割最大的不同是他的輸入會是兩張圖片,一張為原圖,一張為掩碼的圖

語義分割輸入原圖與掩碼圖的範例
語義分割掩碼標註範例

目標檢測(Object Detection)怎麼做?

目標檢測任務涉及在圖像中識別並定位多個不同類別的對象。相比於分類任務,目標檢測不僅需要標識對象的類別,還需要確定它們的位置和邊界框。常見的目標檢測算法可以提供每個檢測到的對象的邊界框和類別信息。具代表性的演算法包括 Faster R-CNN、YOLO、SSD 等。

這篇文章介紹了許多我們常用的物件偵測模型: <https://zhuanlan.zhihu.com/p/38709522>

實例分割(Instance Segmentation)跟語義分割差在哪?

實例分割任務結合了目標檢測和語義分割的概念,不僅要對每個對象進行分類,還需要在像素級別區分出每個對象的邊界。實例分割旨在識別圖像中的每個獨立實例並為每個實例分配獨特的標籤,從而在一個圖像中區分出不同的對象。

例如: COCO Segmentation

COCO(Common Objects in Context)是一個廣泛使用的圖像識別和分割數據集,其中包含了多種物體類別的圖像以及每個圖像中物體的分割標註。COCO Segmentation 數據集中的分割信息通常是用多邊形輪廓來表示物體的形狀。這種分割方法在標註上更靈活,可以準確地表示物體的複雜形狀,但同時也需要更多的標註工作。

延伸閱讀

常見問題

Q分類和目標檢測最主要的差別是什麼?

分類只需要判斷整張圖像屬於哪一個類別,輸出是一個標籤。目標檢測則要在圖像中找出多個對象,同時給出每個對象的類別和邊界框位置。

Q語義分割和實例分割有什麼不同?

語義分割為每個像素分配類別標籤,但不區分同類別的不同個體。實例分割則結合目標檢測,會為每個獨立實例分配獨特標籤,在像素級別區分出不同對象。

Q語義分割常用的掩碼(mask)是什麼?

掩碼是一種二進製圖像,每個像素要嘛屬於某個類別、要嘛不屬於。語義分割的輸入通常是原圖加一張掩碼圖,用來表示各類別的區域。

QCOCO Segmentation 為什麼用多邊形標註?

多邊形輪廓在標註上更靈活,可以準確表示物體的複雜形狀。不過相對來說,也需要投入更多的標註工作量。

參考資料

最後更新

2026-08-28|原文發布於 2023-08-23,本文保留原始筆記內容並補上 GEO 結構。

關於作者 {#author}

Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。

首次發布:2023-08-23