模型與訓練
RLHF 是什麼?為什麼 AI 會變得有禮貌又安全
RLHF 是什麼?為什麼 AI 會變得有禮貌又安全
同樣是讀了一大堆網路資料,為什麼現在的 AI 回答得又完整又有禮貌,而不是照著網路上的口氣講話?答案就是 RLHF。
這是現代大型語言模型的關鍵技術之一。搞懂它,你會知道模型的「態度」是怎麼被調出來的。
你將學到什麼
定義
用人類的偏好當獎勵信號,引導模型學會更有用、更安全、更符合價值觀的回答。
白話比喻
像新人實習:先讀完教科書,再由主管一次次告訴他哪個版本比較好。
六個步驟
預訓練、產生多種回答、人類評估、訓練獎勵模型、強化學習微調、輸出更好的回答。
跟誰容易搞混
常跟微調搞混。微調教的是知識與格式,RLHF 調的是偏好與價值。
定義
RLHF 是人類回饋強化學習。人類提供的回饋像「獎勵信號」,引導 AI 學習人類偏好,讓回答更好、更安全、更對齊價值。
它處理的是三件事:安全、有用、符合價值。這三件事沒辦法只靠讀資料學會,必須有人告訴模型哪一種比較好。
白話比喻
像帶一個新人。他讀完了所有教科書,知識沒問題,但講話方式還不對。
於是你請他對同一件事寫三個版本,你挑出最好的那個,並告訴他為什麼。挑久了,他就抓到你要的調性了。
六個步驟
- 預訓練模型:用大量資料學到知識,此時尚未對齊人類價值。
- 產生多種回答:模型對同一個問題產生多個答案。
- 人類評估回饋:人類評分或排序,選出更好的回答。
- 獎勵模型學習:把人類偏好訓練成一個會打分的獎勵模型。
- 強化學習微調:模型嘗試回答、獲得獎勵,依此更新參數。
- 更好的回答:輸出更有幫助、安全、符合人類價值的答案。
關鍵在第四步。獎勵模型是人類偏好的代理人,有了它,模型才能在沒有人在場的時候自己判斷「這個回答應該得幾分」。
跟相近名詞的差別
| 名詞 | 在調什麼 | 白話說法 |
|---|---|---|
| Fine-tuning 微調 | 特定領域的知識與輸出格式 | 教它這一行的專業 |
| RLHF | 回答的偏好與態度 | 教它怎麼講話比較好 |
| Alignment 對齊 | 整體行為與人類價值的一致性 | 目標,RLHF 是達成手段之一 |
| Guardrails 防護欄 | 執行時的即時攔截 | 已經訓練完了,在外面加圍欄 |
實際用例
四個常見成果:避免仇恨與暴力等不當內容、提供更正確可靠的資訊、更友善尊重的互動、更符合需求的創意產出。
你現在用的主流對話模型,幾乎都經過這道工序。這也是為什麼不同家的模型「個性」會有差異。
最常見的誤解是「RLHF 等於審查」。它調的是偏好排序,不是關鍵字黑名單。真正在執行時做即時攔截的是防護欄,那是另一層。
第二個誤解是以為模型會即時學習你的回饋。你在對話框裡按讚,不會馬上改變模型,那些資料要進到下一輪訓練才有作用。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

