多模態與應用
OCR 是什麼?讓 AI 像人一樣看圖識字
OCR 是什麼?讓 AI 像人一樣看圖識字
一份掃描的 PDF 看起來有字,但你搜尋不到、也複製不了。因為對電腦來說,那整頁只是一張圖。
OCR 就是把那張圖變回文字的技術。它是文件數位化與知識庫建置的第一道關卡。
你將學到什麼
定義
把圖片裡的文字讀出來,變成可以編輯、複製、搜尋的文字。
白話比喻
像請一個人幫你把照片上的字,一個一個抄成電子檔。
六個步驟
輸入圖片、影像預處理、文字區域偵測、字元辨識、文字後處理、輸出文字。
限制
字體太藝術、解析度太低、光線不足、背景太複雜,辨識率都會掉。
定義
OCR 就是讓 AI 看懂圖片裡的字。先把圖片轉成看得懂的資訊,找出文字在哪裡、長什麼樣,再把它讀出來。
終點是一份可以編輯、複製、搜尋的文字。在那之前,那些字對程式來說只是一堆像素。
白話比喻
像請一個人幫你把牆上的公告抄下來。他要先看清楚字在哪一塊,再一個一個認出來,最後排好順序寫成一份文件。
字寫得潦草、光線太暗、牆面太花,他抄錯的機率就會變高。機器也是一樣。
六個核心步驟
- 輸入圖片:上傳照片、掃描檔或截圖。
- 影像預處理:調整亮度對比、去雜訊、校正角度。
- 文字區域偵測:找出圖片中有文字的區域位置。
- 字元辨識:辨識每個字,轉成文字。
- 文字後處理:修正錯字、排序、合併成完整內容。
- 輸出文字:輸出可編輯文字,可儲存或進一步應用。
常見的技術類型
| 類型 | 辨識對象 | 典型場景 |
|---|---|---|
| 光學字元辨識 | 印刷體文字 | 文件、發票、書籍 |
| 手寫文字辨識 | 手寫內容 | 筆記、表單、簽名 |
| 場景文字辨識 | 自然場景中的文字 | 招牌、告示、菜單 |
| 表格結構辨識 | 表格並還原結構 | 列、欄、儲存格 |
背後的關鍵技術包含影像特徵擷取、序列處理、注意力機制,以及用語言模型輔助修正錯字與標點。
實際用例
常見場景:紙本文件數位化、發票與帳單自動擷取金額與日期、表格資料擷取、招牌與菜單翻譯、車牌辨識。
在知識庫的流程裡,OCR 通常排在最前面:先把圖轉成文字,才輪得到 切片 與向量化。
最常見的誤解是「OCR 出來的字就是對的」。它是機率性的辨識,會錯字、會漏字、會把表格排錯行。重要的資料一定要留人工核對。
第二個誤解是以為 PDF 一定可以搜尋。掃描產生的 PDF 只是一疊圖片,沒跑過 OCR 之前,搜尋框裡什麼都找不到。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

