多模態與應用

OCR 是什麼?讓 AI 像人一樣看圖識字

OCR(圖片文字辨識)就是讓 AI 看懂圖片裡的字。它會先把圖片轉成看得懂的資訊,找出文字在哪裡、長什麼樣,再把它讀出來,最後變成可以編輯、複製、搜尋的文字。掃描的紙本文件、拍下來的發票、招牌與菜單,經過 OCR 之後才會從一張圖變成可以被程式處理的資料。
OCR 是什麼?讓 AI 像人一樣看圖識字:文章重點卡

OCR 是什麼?讓 AI 像人一樣看圖識字

一份掃描的 PDF 看起來有字,但你搜尋不到、也複製不了。因為對電腦來說,那整頁只是一張圖。

OCR 就是把那張圖變回文字的技術。它是文件數位化與知識庫建置的第一道關卡。

你將學到什麼

定義

把圖片裡的文字讀出來,變成可以編輯、複製、搜尋的文字。

白話比喻

像請一個人幫你把照片上的字,一個一個抄成電子檔。

六個步驟

輸入圖片、影像預處理、文字區域偵測、字元辨識、文字後處理、輸出文字。

限制

字體太藝術、解析度太低、光線不足、背景太複雜,辨識率都會掉。

定義

OCR 就是讓 AI 看懂圖片裡的字。先把圖片轉成看得懂的資訊,找出文字在哪裡、長什麼樣,再把它讀出來。

終點是一份可以編輯、複製、搜尋的文字。在那之前,那些字對程式來說只是一堆像素。

白話比喻

像請一個人幫你把牆上的公告抄下來。他要先看清楚字在哪一塊,再一個一個認出來,最後排好順序寫成一份文件。

字寫得潦草、光線太暗、牆面太花,他抄錯的機率就會變高。機器也是一樣。

六個核心步驟

  1. 輸入圖片:上傳照片、掃描檔或截圖。
  2. 影像預處理:調整亮度對比、去雜訊、校正角度。
  3. 文字區域偵測:找出圖片中有文字的區域位置。
  4. 字元辨識:辨識每個字,轉成文字。
  5. 文字後處理:修正錯字、排序、合併成完整內容。
  6. 輸出文字:輸出可編輯文字,可儲存或進一步應用。

常見的技術類型

類型辨識對象典型場景
光學字元辨識印刷體文字文件、發票、書籍
手寫文字辨識手寫內容筆記、表單、簽名
場景文字辨識自然場景中的文字招牌、告示、菜單
表格結構辨識表格並還原結構列、欄、儲存格

背後的關鍵技術包含影像特徵擷取、序列處理、注意力機制,以及用語言模型輔助修正錯字與標點。

實際用例

常見場景:紙本文件數位化、發票與帳單自動擷取金額與日期、表格資料擷取、招牌與菜單翻譯、車牌辨識。

在知識庫的流程裡,OCR 通常排在最前面:先把圖轉成文字,才輪得到 切片 與向量化。

常見誤解

最常見的誤解是「OCR 出來的字就是對的」。它是機率性的辨識,會錯字、會漏字、會把表格排錯行。重要的資料一定要留人工核對。

第二個誤解是以為 PDF 一定可以搜尋。掃描產生的 PDF 只是一疊圖片,沒跑過 OCR 之前,搜尋框裡什麼都找不到。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

OCR 跟電腦視覺是同一件事嗎?
不是。電腦視覺是更大的範圍,包含辨識物件、場景、人臉等各種影像理解。OCR 是其中專門處理文字的那一支,目標很明確:把圖上的字轉成可用的文字資料。
為什麼有些掃描檔 OCR 出來全是亂碼?
常見原因是解析度太低、有明顯歪斜或陰影、或者原稿本身是手寫。另一種狀況是掃描時的壓縮太重,筆畫黏在一起。遇到這種檔案,先做影像預處理,調整亮度對比與校正角度,效果會差很多。
OCR 完的文字可以直接進知識庫嗎?
建議先做一道品質檢查。辨識錯的字會一路帶進切片與向量,之後檢索到的就是錯的內容,而且很難追查。實務上會先看亂碼比例,超過一定門檻就擋下來,不要讓髒資料汙染整個索引。