模型與訓練

RLHF 是什麼?為什麼 AI 會變得有禮貌又安全

RLHF(Reinforcement Learning from Human Feedback,人類回饋強化學習)是一種訓練方法。做法是讓模型對同一個問題產生多個答案,請人類評分或排序選出比較好的那一個,用這些偏好訓練出一個獎勵模型,再用強化學習依據獎勵模型去微調模型的回答策略。它不是讓模型學新知識,而是讓模型學會人類偏好什麼樣的回答方式。
RLHF 是什麼?為什麼 AI 會變得有禮貌又安全:文章重點卡

RLHF 是什麼?為什麼 AI 會變得有禮貌又安全

同樣是讀了一大堆網路資料,為什麼現在的 AI 回答得又完整又有禮貌,而不是照著網路上的口氣講話?答案就是 RLHF。

這是現代大型語言模型的關鍵技術之一。搞懂它,你會知道模型的「態度」是怎麼被調出來的。

你將學到什麼

定義

用人類的偏好當獎勵信號,引導模型學會更有用、更安全、更符合價值觀的回答。

白話比喻

像新人實習:先讀完教科書,再由主管一次次告訴他哪個版本比較好。

六個步驟

預訓練、產生多種回答、人類評估、訓練獎勵模型、強化學習微調、輸出更好的回答。

跟誰容易搞混

常跟微調搞混。微調教的是知識與格式,RLHF 調的是偏好與價值。

定義

RLHF 是人類回饋強化學習。人類提供的回饋像「獎勵信號」,引導 AI 學習人類偏好,讓回答更好、更安全、更對齊價值。

它處理的是三件事:安全、有用、符合價值。這三件事沒辦法只靠讀資料學會,必須有人告訴模型哪一種比較好。

白話比喻

像帶一個新人。他讀完了所有教科書,知識沒問題,但講話方式還不對。

於是你請他對同一件事寫三個版本,你挑出最好的那個,並告訴他為什麼。挑久了,他就抓到你要的調性了。

六個步驟

  1. 預訓練模型:用大量資料學到知識,此時尚未對齊人類價值。
  2. 產生多種回答:模型對同一個問題產生多個答案。
  3. 人類評估回饋:人類評分或排序,選出更好的回答。
  4. 獎勵模型學習:把人類偏好訓練成一個會打分的獎勵模型。
  5. 強化學習微調:模型嘗試回答、獲得獎勵,依此更新參數。
  6. 更好的回答:輸出更有幫助、安全、符合人類價值的答案。

關鍵在第四步。獎勵模型是人類偏好的代理人,有了它,模型才能在沒有人在場的時候自己判斷「這個回答應該得幾分」。

跟相近名詞的差別

名詞在調什麼白話說法
Fine-tuning 微調特定領域的知識與輸出格式教它這一行的專業
RLHF回答的偏好與態度教它怎麼講話比較好
Alignment 對齊整體行為與人類價值的一致性目標,RLHF 是達成手段之一
Guardrails 防護欄執行時的即時攔截已經訓練完了,在外面加圍欄

實際用例

四個常見成果:避免仇恨與暴力等不當內容、提供更正確可靠的資訊、更友善尊重的互動、更符合需求的創意產出。

你現在用的主流對話模型,幾乎都經過這道工序。這也是為什麼不同家的模型「個性」會有差異。

常見誤解

最常見的誤解是「RLHF 等於審查」。它調的是偏好排序,不是關鍵字黑名單。真正在執行時做即時攔截的是防護欄,那是另一層。

第二個誤解是以為模型會即時學習你的回饋。你在對話框裡按讚,不會馬上改變模型,那些資料要進到下一輪訓練才有作用。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

RLHF 會讓模型變聰明嗎?
不完全是。RLHF 主要改變的是「回答方式」,讓輸出更完整、更有禮貌、更安全、更貼近提問者真正想要的東西。模型的底層知識來自預訓練,那部分不是 RLHF 負責的。
人類評估怎麼進行?
常見有三種做法:打分制,對單一回答給分數;排序制,把幾個回答由好到差排出順序;成對比較,一次看兩個答案選出比較好的那個。成對比較最省力,也最容易得到一致的判斷。
沒有經過 RLHF 的模型會怎樣?
回答可能不夠完整、不夠有禮貌,甚至不安全。它會照著訓練資料裡最常見的樣子接話,而網路上最常見的樣子不見得是你想要的樣子。