模型與訓練
RL 強化學習是什麼?用獎賞與懲罰把 AI 教到會
RL 全名 Reinforcement Learning,中文叫強化學習。它是讓 AI 智體在環境中採取行動,並根據結果獲得獎賞或懲罰,目標是學會最大化長期累積獎賞的訓練方式。核心是做中錯、錯中學,不需要人類事先準備標註答案,靠大量嘗試自己找出最好的策略。目前很多推理模型就是靠 RL 自己跟自己對弈升級出來的。
RL 強化學習是什麼?用獎賞與懲罰把 AI 教到會
你會在推理模型、AlphaGo、自駕車這些話題裡遇到 RL 這兩個字母。它是 AI 進化的秘密武器,用一句話講就是做中學、自我超越。
跟一般人想像的「餵資料給 AI」不一樣,強化學習不需要人先把答案寫好。它靠的是嘗試、拿回饋、調整,再嘗試。
你將學到什麼
定義
讓 AI 在環境中行動,用獎賞與懲罰學會最大化長期報酬。
白話比喻
像學騎腳踏車,跌倒、調整、再試,最後越騎越穩。
四步循環
觀察狀態、採取行動、獲得回饋、更新策略。
跟誰容易搞混
常跟監督學習混淆,差別在有沒有現成的標準答案。
定義
RL 的全名是 Reinforcement Learning,中文叫強化學習。它是讓 AI 智體在環境中採取行動,並根據結果獲得獎賞或懲罰的訓練方式。
它的目標不是答對眼前這一題,而是最大化長期累積獎賞。所以 AI 有可能故意選一步看起來吃虧的棋,只為了後面贏得更多。
白話比喻
強化學習就像學騎腳踏車。一開始一直跌倒,那是負回饋;多次嘗試後找到平衡,那是正回饋;越騎越穩,就是策略升級。
沒有人能寫一份「騎車標準答案」給你照抄。你只能自己試,摔了知道那樣不行,穩了知道這樣可以。AI 也是。
運作的四個步驟
- 觀察狀態,也就是現在環境長什麼樣子
- 採取行動,從可以做的動作裡挑一個
- 獲得回饋,環境給出獎賞或懲罰
- 學習更新策略,下次在同樣狀態下做得更好
這四步會不斷循環,直到 AI 學會最佳策略。整套系統的關鍵要素有狀態、行動、獎賞、策略、價值、環境與目標七項。
跟監督學習的差別
| 面向 | 監督學習 | 強化學習 |
|---|---|---|
| 資料 | 需要大量人工標註資料 | 不需要標註,自己探索 |
| 學什麼 | 輸入到輸出的對應關係 | 在某狀態下該採取什麼行動 |
| 回饋 | 一次就告訴你正確答案 | 透過獎賞與懲罰逐步學會 |
| 過程 | 看範例學 | 多次嘗試,從錯誤中學 |
實際用例
最有名的案例是圍棋 AI AlphaGo 與後來完全靠自我對弈的 AlphaZero,還有玩 Dota 2 的 OpenAI Five,都是從零開始、沒有人工標註、純靠自我對弈練出來的。
近年的推理模型也大量用到 RL。模型自己產生問題、自己解題、自己驗證評分,答對就給獎賞,於是策略一輪一輪升級。RL 也被視為通往 AGI 的核心技術之一。
常見誤解誤解一,以為強化學習就是「多餵一點資料」,其實它的重點在設計獎賞,獎賞設計錯了,AI 會學會鑽漏洞而不是把事做好。誤解二,以為 RL 一定比監督學習好。RL 要跑非常多次嘗試,成本高、訓練不穩定,在有現成標準答案的任務上,監督學習往往更划算。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook。
延伸學習
常見問答
強化學習跟監督學習差在哪?
監督學習需要大量人工標註資料,一次就告訴 AI 正確答案,學的是輸入對輸出的對應關係。強化學習不需要標註資料,AI 自己探索,透過獎賞與懲罰在多次嘗試與錯誤中學,學的是在什麼狀態下該採取什麼行動。
RLHF 跟 RL 是同一件事嗎?
RLHF 是強化學習的一種應用,全名 Reinforcement Learning from Human Feedback,人類回饋強化學習。差別在獎賞從哪裡來:一般 RL 的獎賞由環境或規則給出,RLHF 的獎賞來自人類對回答好壞的偏好排序,常用在對話模型的訓練後期。
為什麼推理模型很依賴 RL?
因為推理過程很難標註。人類不容易一步一步寫出所有正確的思考路徑,但可以判斷最後答案對不對。用答案對錯當獎賞,讓模型自己產生問題、自己解題、自己驗證評分,就能在沒有人工標註的情況下把推理能力練起來。
