生成與推論

Extraction 資訊擷取是什麼?把一堆文字變成能用的欄位

Extraction(資訊擷取 / 萃取)是讓 AI 從大量非結構化內容裡,把你指定的關鍵資訊找出來,整理成結構化資料。輸入可以是文件、網頁、圖片或郵件,輸出則是欄位、表格或標籤,例如從合約抓出甲方、乙方、金額、期限,從發票抓出店名、日期、品項、總金額。重點在於它只抓你要的那幾格,不負責幫你讀懂整篇,所以欄位定義得越清楚,結果越準。
Extraction 資訊擷取是什麼?把一堆文字變成能用的欄位:文章重點卡

Extraction 資訊擷取是什麼?把一堆文字變成能用的欄位

一疊發票要key進試算表、一批合約要整理成到期日清單、一堆履歷要拆成學歷與年資欄位。這種苦工就是資訊擷取要接手的事。

它是 AI 落地最快見效的一類應用,因為輸出可以直接進系統,不需要人再重打一次。

你將學到什麼

定義

從非結構化內容裡抓出指定欄位,整理成結構化資料。

白話比喻

像請助理拿螢光筆,只把合約裡的金額與到期日畫出來抄進表格。

輸出長什麼樣

欄位、表格、標籤,能直接餵給資料庫或試算表。

跟誰容易搞混

摘要是濃縮全文,分類是貼標籤,擷取是抓特定欄位。

定義

資訊擷取是把非結構化的內容,變成結構化的資料。來源可以是合約、新聞、發票、履歷、網頁或郵件。

流程大致是六步:輸入來源、理解內容、辨識目標欄位、抓出對應內容、整理成表格或欄位、輸出到後續系統。

白話比喻

像你請助理拿螢光筆去讀一疊合約,交代他只畫三樣:甲方、總金額、到期日。

他不需要讀懂整份合約的法律邏輯,只要把那三格找對、抄進表格。交代得越具體,抄回來的東西越能直接用。

擷取、摘要、分類差在哪?

功能目標輸出例子
擷取找出特定資訊結構化資料抓出日期與金額
摘要濃縮重點內容精簡文字生成文章重點
分類判斷內容類別類別標籤判斷為科技新聞

實際用例

常見的落地場景包括文件處理、商業分析、客服自動化、法律合規、醫療紀錄與財務會計。共同點是原本都要人一筆一筆重打。

實作上多半會搭配 JSON Mode結構化輸出,讓模型回傳固定格式,程式才接得住。前置的檔案處理則屬於 Parsing 內容拆解 的範圍。

常見誤解

最常見的誤解是把擷取當成理解全文。它只找你要的資訊,不會記住整篇文章,也不該期待它自己補上你沒定義的欄位。

第二個誤解是以為結果一定完整。原文本身模糊、格式混亂或缺少該資訊時,準確度就會掉,所以高風險欄位一定要留一道人工驗證。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

擷取跟摘要差在哪?
目標不同。摘要要濃縮整篇內容的重點,輸出是一段精簡文字;擷取只找你點名的那幾個欄位,輸出是結構化資料。要「這篇在講什麼」用摘要,要「這份合約的總金額是多少」用擷取。
怎麼讓擷取變準?
三件事最有效。第一,把欄位名稱與格式定義清楚,包含日期要哪種寫法、金額要不要含幣別。第二,給兩三個範例讓模型對齊你的期待。第三,來源資料先清乾淨,格式統一、去掉雜訊,準確率會明顯提升。
可以完全不看就直接進系統嗎?
低風險的資料可以,高風險的不建議。金額、契約、醫療、法律這類欄位仍要人工複核,因為原文模糊、格式混亂或根本缺漏的時候,模型可能給出看起來合理但錯誤的值。做法上可以只抽驗,或對信心低的項目跳出來讓人確認。