多模態與應用

Computer Vision 電腦視覺是什麼?讓機器不只看到,還要看懂

Computer Vision 簡稱 CV,中文叫電腦視覺,是讓電腦能夠看懂並理解圖片與影片內容的技術。它是 AI 的一個重要分支,透過影像處理與深度學習模型,讓電腦從像素中擷取資訊、辨識物體、理解場景,進而做出判斷或決策。常見任務包含影像分類、物體偵測、影像分割、人臉辨識與文字辨識。
Computer Vision 電腦視覺是什麼?讓機器不只看到,還要看懂:文章重點卡

Computer Vision 電腦視覺是什麼?讓機器不只看到,還要看懂

手機相簿會自動把你朋友的照片歸成一類,過收費站不用停車就自動辨識車牌,這些背後都是同一項技術。

電腦視覺處理的是「看」這件事。它讓機器從一堆像素裡,讀出人類一眼就懂的資訊。

你將學到什麼

定義

讓電腦看懂圖片與影片內容,從像素中擷取資訊並做出判斷。

白話比喻

給機器一雙眼睛,還要教會它眼睛看到的是什麼。

五個步驟

輸入影像、前處理、特徵擷取、理解預測、輸出結果。

跟誰容易搞混

常跟文字辨識畫上等號,文字辨識只是它其中一項任務。

定義

Computer Vision 簡稱 CV,中文叫電腦視覺,是讓電腦能夠看懂和理解圖片、影片內容的技術。

它是 AI 的一個重要分支,透過影像處理與深度學習模型,讓電腦從像素中擷取資訊、辨識物體、理解場景,進而做出判斷或決策。

運作流程

  1. 輸入影像,把圖片或影片送進系統
  2. 影像前處理,調整大小、去噪、色彩轉換,讓影像更適合模型處理
  3. 特徵擷取,使用深度學習模型擷取影像中的重要特徵
  4. 理解與預測,根據特徵進行分析,辨識物體、分類影像、偵測位置或理解場景
  5. 輸出結果,回傳辨識結果或標註資訊

常見任務

任務在做什麼輸出長什麼樣
影像分類判斷整張圖片的類別海灘 95 分,城市 3 分,山景 1 分
物體偵測找出圖片中有哪些物體及位置用方框標出汽車、公車、行人
影像分割將影像中的每個像素分類把天空、道路、草地各自上色
人臉辨識辨識或驗證人物身分這張臉是誰,或是否為本人
文字辨識從圖片中擷取文字把招牌上的字轉成可編輯的文字

實際用例

智慧醫療用它做影像檢測、病灶偵測與輔助診斷;自動駕駛用它做環境感知、物體偵測與車道辨識;智慧安防用它做影像監控、人臉辨識與異常行為偵測。

零售與製造用它做商品辨識、瑕疵檢測與庫存管理;生活應用則更貼身,濾鏡特效、拍照辨識、擴增實境與以圖搜圖都算。

常見技術與模型

卷積神經網路擅長擷取影像特徵,是電腦視覺的基礎架構。物件偵測模型追求即時與速度,影像分割模型做像素級分類,常用於醫療與自動駕駛。

近年的視覺變換模型結合了 Transformer 架構,強化理解與泛化能力,也讓影像可以跟文字放進同一套 Embedding 語意向量 空間,做到以文找圖。經典的開源影像處理函式庫 OpenCV 則仍是很多專案的基本工具。

常見誤解誤解一,以為辨識準確率高就等於可以直接上線。實際場景的光線、角度與遮擋跟訓練資料差很多,落地前一定要用真實環境的樣本測過。誤解二,忽略隱私問題。人臉辨識牽涉個人生物特徵,蒐集與使用都有法規要求,不是技術做得到就可以做。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

電腦視覺跟 OCR 是同一件事嗎?
不是。OCR 是從圖片中擷取文字,屬於電腦視覺底下的一項任務。電腦視覺涵蓋的範圍大得多,還包含影像分類、物體偵測、影像分割與人臉辨識等等。可以說 OCR 是電腦視覺的一個子集。
影像分類跟物體偵測差在哪?
影像分類是判斷整張圖片屬於哪個類別,回答的是這張圖是什麼。物體偵測則要找出圖片中有哪些物體以及它們的位置,會用方框標出來,回答的是哪裡有什麼。影像分割更細,是把每個像素都分類。
多模態模型算電腦視覺嗎?
算是重疊的領域。多模態模型能同時處理影像與文字,你丟一張圖問它這是什麼,它會用自然語言回答。這類應用結合了視覺理解與語言生成,是電腦視覺近年最明顯的變化之一。