模型與訓練

Pre-training 預訓練是什麼?AI 學會語言的第一步

Pre-training(預訓練)是 AI 模型的第一階段學習,讓模型透過大量未標註的文字資料,學習語言的規律、世界知識與基本的推理模式,建立廣泛的理解能力。這個階段模型還沒有針對任何特定任務做訓練,就像一個讀遍萬卷書但還不會解題的學生。它學到的是通則,不是你的資料,之後還需要 Fine-tuning 或 RAG 才能用在具體任務上。
Pre-training 預訓練是什麼?AI 學會語言的第一步:文章重點卡

Pre-training 預訓練是什麼?AI 學會語言的第一步

每次介紹一個大型語言模型,介紹文裡總會出現一句「使用多少 TB 資料預訓練」,這個詞就是 Pre-training。

搞懂它,你才會明白為什麼模型什麼都知道一點,卻不一定準確理解你公司的內部規則。

你將學到什麼

定義

讓模型讀遍海量資料,學到通用語言能力與世界知識的第一階段訓練。

白話比喻

像剛出生但讀萬卷書的嬰兒,知識廣泛卻還不會特定任務。

跟誰容易搞混

跟 Fine-tuning 差在資料量與目的,前者打基礎,後者練專項。

定義

Pre-training 是 AI 模型的第一階段學習,讓模型透過大量文字資料,學習語言規律、世界知識與基本推理模式,建立廣泛的理解能力。

這個階段大多使用自監督學習,讓模型自己從資料裡預測下一個詞,不需要人工標註答案,所以能吃下遠比人工標註資料多得多的內容。

白話比喻

就像一個剛出生的嬰兒,還不會寫字、算數,但透過閱讀全世界的書,吸收各種知識,為未來學習各種技能打下基礎。

讀完這些書之後,嬰兒懂了很多常識,卻還沒開始學怎麼應用這些知識解題,這正是 Pre-training 完成後的狀態。

跟相近名詞的差別

項目Pre-training 預訓練Fine-tuning 微調
目標學習通用知識與語言理解學習特定任務的能力
資料海量、多樣、未標註較少、特定、已標註
結果通用基礎模型專用模型

實際用例

GPT 與 BERT 這類模型,都是先經過大規模 Pre-training 打好語言基礎,再依應用場景做 Fine-tuning 或接上 RAG 檢索增強生成,才變成能回答你問題的產品。

常見誤解常見誤解是以為模型什麼都知道,代表它讀過你公司的資料。事實上預訓練用的是公開通用資料,學到的是通則,不是你的資料,這也是為什麼企業導入 AI 還需要另外準備知識庫的原因。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

Pre-training 用的是誰的資料?
多半是公開的網頁文章、書籍、程式碼、百科與論壇對話等大規模未標註資料,通常以 TB 到 PB 計算。這些資料不是你公司或個人的專屬內容,所以模型學到的是通用能力,不會自動認得你的業務規則。
為什麼 Pre-training 之後還需要 Fine-tuning?
因為預訓練學到的是語言規律與通用知識,不是特定任務的解題能力。Fine-tuning 用少量、已標註的資料,教模型怎麼把通用能力用在具體任務上,例如客服應答或程式除錯。
預訓練的模型可以直接拿來回答我公司的問題嗎?
可以回答,但準確度沒有保證,因為它從沒看過你公司的資料。想讓回答依據你自己的內容,做法是搭配 Knowledge File 或 RAG,讓模型在回答前先參考你提供的文件。