Google Cloud 基礎

LLM 的「大」是多大?從訓練狗的比喻看懂大型語言模型

大型語言模型(LLM)是可以先預訓練、再微調的大型通用語言模型。「大」有兩層意思:訓練資料大到 PB 等級,參數數量以十億計。它的好處是一個模型能做翻譯、摘要、問答等多種任務,而且只需少量領域資料就能客製;當完整微調太昂貴時,參數高效調校(PETM)只訓練小型外掛層,不動基礎模型本體。
LLM 的「大」是多大?從訓練狗的比喻看懂大型語言模型:文章重點卡

LLM 的「大」是多大?從訓練狗的比喻看懂大型語言模型

每天都在用 ChatGPT 或 Gemini,但「大型語言模型」的「大」到底指什麼?為什麼同一個模型又會翻譯、又會摘要、又會寫程式?Google Cloud 的 Introduction to Large Language Models 用一個訓練狗的比喻,把這些問題講得非常清楚。

這門課是生成式 AI 學習路徑的第二站,由 Google Cloud 的客戶工程師授課。這篇整理課程的核心:預訓練與微調的關係、LLM 的三大好處、三種模型類型各自的提示方式,以及企業最關心的問題:微調太貴的時候怎麼辦。

你將學到什麼

預訓練與微調

家犬的基本服從訓練,與導盲犬的特種訓練。

「大」的兩層意思

PB 級的訓練資料,數十億計的參數。

三種 LLM 類型

通用型、指令調校型、對話調校型,提示法不同。

省錢的調校法

PETM 只調外掛層,不動模型本體。

訓練狗的比喻:預訓練與微調

課程對 LLM 的定義是:可以先預訓練(pre-train)、再針對特定目的微調(fine-tune)的大型通用語言模型。比喻是這樣的:養狗通常會教牠坐下、過來、趴下、等等這些基本指令,日常生活夠用了;但如果需要警犬、導盲犬或獵犬,就要再加特種訓練。

LLM 也一樣:先用大資料集做通用訓練,學會文字分類、問答、摘要、生成這些跨產業的共通能力;再用相對少量的領域資料,調校成零售、金融、娛樂等領域的專用模型。

海量通用資料PB 級文字預訓練基礎 LLM通用語言能力微調金融專用模型(少量領域資料)醫療專用模型(少量領域資料)零售專用模型(少量領域資料)
預訓練學通識,微調學專業:同一個底座可以調出不同領域的專用模型。

「大」有兩層意思:訓練資料大,有時達 PB 等級;參數多,參數是模型從訓練中學到的記憶與知識,決定它解題的本事。「通用」則有兩個原因:人類語言在不同任務間有共通性;以及現實的資源限制,只有少數組織有能力訓練這種等級的模型,那就讓他們做出基礎語言模型給大家用。

LLM 的三大好處

  • 一個模型,多種任務:翻譯、句子補全、文字分類、問答,同一個模型全包。
  • 幾乎不需要領域訓練資料:少量資料(few-shot)甚至零資料(zero-shot)就能上工。課程舉問答系統為例:以前要為 IT 客服、醫療、供應鏈各自準備領域知識來開發模型,生成式問答直接從脈絡生成答案,領域知識的門檻消失了。
  • 越餵越強:資料與參數持續增加,表現就持續成長。

這也改寫了開發的門檻。傳統機器學習開發需要專業知識、訓練範例、算力與硬體;用預訓練 LLM 開發,你不需要是專家、不需要訓練範例、不需要訓練模型,需要的只是把提示設計好。順帶一提,LLM 幾乎清一色建立在 Transformer 架構上:編碼器處理輸入序列,解碼器學著把它解成任務要的輸出。

三種 LLM,三種提示法

類型行為提示方式
通用語言模型根據訓練資料預測下一個字,像搜尋的自動完成給一段文字讓它接下去
指令調校模型訓練成回應輸入中的指令下明確指令:摘要這段、仿某風格寫詩、把文字分類成正負中性
對話調校模型指令調校的特例,訓練成多輪對話用自然的問句,放在來回的對話脈絡中效果最好

課程還講了一個重要觀察:思考鏈推理(chain-of-thought reasoning)。模型先輸出解釋理由的文字、再給答案時,答對的機率更高。經典例子:Roger 有五顆網球,又買了兩罐、每罐三顆,總共幾顆?直接要答案容易錯;引導模型先列出計算過程,答案就穩了。

調校的光譜:從提示到 PETM

什麼都會的模型有實務上的限制,任務專用的調校能讓 LLM 更可靠。

課程把客製化排成一道光譜:最輕的是提示設計;再來是調校(tuning),用範例資料讓模型適應新領域,例如法律或醫療;最重的是完整微調,帶自己的資料集重訓模型的每一個權重,訓練工作龐大、還要自己托管模型,昂貴到多數情境不現實。

務實的解法:參數高效調校(PETM)不動基礎模型本體,只訓練一小組外掛層,推論時掛上去即可換用。用自己的資料客製模型,卻不必複製整個模型,成本大幅下降。這是課程給企業使用者最務實的一條路。

想動手的話,Google Cloud 這邊的入口跟前一門課相同:Vertex AI Studio 探索與客製模型,Vertex AI Agent Builder 讓低程式背景的人也能建聊天機器人與客製搜尋,多模態的 Gemini 與持續更新的 Model Garden 則提供模型選擇。

我自己修完的體會是:懂了「預訓練學通識、微調學專業」這個結構,再看市面上任何「行業專用 AI」的產品,你都能一眼看出它是在哪一層做的功夫。

本文源起本文取材自 Coursera 上的「Introduction to Large Language Models」課程(Google Cloud),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

LLM 的「大」到底指什麼?
兩件事:一是訓練資料集的規模,有時達到 PB 等級;二是參數數量。參數可以理解成模型從訓練中學到的記憶與知識,參數決定模型解決問題(例如預測文字)的能力。
zero-shot 和 few-shot 是什麼意思?
few-shot 指用極少量資料就能讓模型學會新任務;zero-shot 更進一步,模型能處理訓練中從未明確教過的東西。這是 LLM 的一大優勢:拿去解決你的領域問題時,幾乎不需要準備大量訓練資料。
prompt design 跟 prompt engineering 差在哪?
prompt design 是為特定任務量身打造清楚、簡潔、資訊充分的提示,人人都需要;prompt engineering 是為了拉高效能的專門技術,會動用領域知識、範例與已知有效的關鍵字,只有對準確度要求很高的系統才需要。
完整微調太貴,有替代方案嗎?
有,叫參數高效調校(PETM,parameter-efficient tuning methods)。它不複製也不改動基礎模型本體,只訓練一小組外掛層,推論時再掛上去。相比之下,完整微調要重訓模型的每一個權重、還得自己托管模型,成本高出許多。