多模態與應用
Computer Vision 電腦視覺是什麼?讓機器不只看到,還要看懂
Computer Vision 電腦視覺是什麼?讓機器不只看到,還要看懂
手機相簿會自動把你朋友的照片歸成一類,過收費站不用停車就自動辨識車牌,這些背後都是同一項技術。
電腦視覺處理的是「看」這件事。它讓機器從一堆像素裡,讀出人類一眼就懂的資訊。
你將學到什麼
定義
讓電腦看懂圖片與影片內容,從像素中擷取資訊並做出判斷。
白話比喻
給機器一雙眼睛,還要教會它眼睛看到的是什麼。
五個步驟
輸入影像、前處理、特徵擷取、理解預測、輸出結果。
跟誰容易搞混
常跟文字辨識畫上等號,文字辨識只是它其中一項任務。
定義
Computer Vision 簡稱 CV,中文叫電腦視覺,是讓電腦能夠看懂和理解圖片、影片內容的技術。
它是 AI 的一個重要分支,透過影像處理與深度學習模型,讓電腦從像素中擷取資訊、辨識物體、理解場景,進而做出判斷或決策。
運作流程
- 輸入影像,把圖片或影片送進系統
- 影像前處理,調整大小、去噪、色彩轉換,讓影像更適合模型處理
- 特徵擷取,使用深度學習模型擷取影像中的重要特徵
- 理解與預測,根據特徵進行分析,辨識物體、分類影像、偵測位置或理解場景
- 輸出結果,回傳辨識結果或標註資訊
常見任務
| 任務 | 在做什麼 | 輸出長什麼樣 |
|---|---|---|
| 影像分類 | 判斷整張圖片的類別 | 海灘 95 分,城市 3 分,山景 1 分 |
| 物體偵測 | 找出圖片中有哪些物體及位置 | 用方框標出汽車、公車、行人 |
| 影像分割 | 將影像中的每個像素分類 | 把天空、道路、草地各自上色 |
| 人臉辨識 | 辨識或驗證人物身分 | 這張臉是誰,或是否為本人 |
| 文字辨識 | 從圖片中擷取文字 | 把招牌上的字轉成可編輯的文字 |
實際用例
智慧醫療用它做影像檢測、病灶偵測與輔助診斷;自動駕駛用它做環境感知、物體偵測與車道辨識;智慧安防用它做影像監控、人臉辨識與異常行為偵測。
零售與製造用它做商品辨識、瑕疵檢測與庫存管理;生活應用則更貼身,濾鏡特效、拍照辨識、擴增實境與以圖搜圖都算。
常見技術與模型
卷積神經網路擅長擷取影像特徵,是電腦視覺的基礎架構。物件偵測模型追求即時與速度,影像分割模型做像素級分類,常用於醫療與自動駕駛。
近年的視覺變換模型結合了 Transformer 架構,強化理解與泛化能力,也讓影像可以跟文字放進同一套 Embedding 語意向量 空間,做到以文找圖。經典的開源影像處理函式庫 OpenCV 則仍是很多專案的基本工具。
延伸學習
知識變現切割地圖(高清版下載,不含講義)
《知識變現切割地圖》的高清完整版。一張圖把語氣、心理、內容、產品、再利用五層模組攤在同一個平面上,讓你回頭盤點已有內容、規劃新的轉化節奏。課程附上地圖本身的完整解說與應用指南,教你怎麼讀這張圖、從哪一層開始用。完整版 PDF 可下載,放大看細節不會糊。
NT$ 680
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

