模型與訓練

RL 強化學習是什麼?用獎賞與懲罰把 AI 教到會

RL 全名 Reinforcement Learning,中文叫強化學習。它是讓 AI 智體在環境中採取行動,並根據結果獲得獎賞或懲罰,目標是學會最大化長期累積獎賞的訓練方式。核心是做中錯、錯中學,不需要人類事先準備標註答案,靠大量嘗試自己找出最好的策略。目前很多推理模型就是靠 RL 自己跟自己對弈升級出來的。
RL 強化學習是什麼?用獎賞與懲罰把 AI 教到會:文章重點卡

RL 強化學習是什麼?用獎賞與懲罰把 AI 教到會

你會在推理模型、AlphaGo、自駕車這些話題裡遇到 RL 這兩個字母。它是 AI 進化的秘密武器,用一句話講就是做中學、自我超越。

跟一般人想像的「餵資料給 AI」不一樣,強化學習不需要人先把答案寫好。它靠的是嘗試、拿回饋、調整,再嘗試。

你將學到什麼

定義

讓 AI 在環境中行動,用獎賞與懲罰學會最大化長期報酬。

白話比喻

像學騎腳踏車,跌倒、調整、再試,最後越騎越穩。

四步循環

觀察狀態、採取行動、獲得回饋、更新策略。

跟誰容易搞混

常跟監督學習混淆,差別在有沒有現成的標準答案。

定義

RL 的全名是 Reinforcement Learning,中文叫強化學習。它是讓 AI 智體在環境中採取行動,並根據結果獲得獎賞或懲罰的訓練方式。

它的目標不是答對眼前這一題,而是最大化長期累積獎賞。所以 AI 有可能故意選一步看起來吃虧的棋,只為了後面贏得更多。

白話比喻

強化學習就像學騎腳踏車。一開始一直跌倒,那是負回饋;多次嘗試後找到平衡,那是正回饋;越騎越穩,就是策略升級。

沒有人能寫一份「騎車標準答案」給你照抄。你只能自己試,摔了知道那樣不行,穩了知道這樣可以。AI 也是。

運作的四個步驟

  1. 觀察狀態,也就是現在環境長什麼樣子
  2. 採取行動,從可以做的動作裡挑一個
  3. 獲得回饋,環境給出獎賞或懲罰
  4. 學習更新策略,下次在同樣狀態下做得更好

這四步會不斷循環,直到 AI 學會最佳策略。整套系統的關鍵要素有狀態、行動、獎賞、策略、價值、環境與目標七項。

跟監督學習的差別

面向監督學習強化學習
資料需要大量人工標註資料不需要標註,自己探索
學什麼輸入到輸出的對應關係在某狀態下該採取什麼行動
回饋一次就告訴你正確答案透過獎賞與懲罰逐步學會
過程看範例學多次嘗試,從錯誤中學

實際用例

最有名的案例是圍棋 AI AlphaGo 與後來完全靠自我對弈的 AlphaZero,還有玩 Dota 2 的 OpenAI Five,都是從零開始、沒有人工標註、純靠自我對弈練出來的。

近年的推理模型也大量用到 RL。模型自己產生問題、自己解題、自己驗證評分,答對就給獎賞,於是策略一輪一輪升級。RL 也被視為通往 AGI 的核心技術之一。

常見誤解誤解一,以為強化學習就是「多餵一點資料」,其實它的重點在設計獎賞,獎賞設計錯了,AI 會學會鑽漏洞而不是把事做好。誤解二,以為 RL 一定比監督學習好。RL 要跑非常多次嘗試,成本高、訓練不穩定,在有現成標準答案的任務上,監督學習往往更划算。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

強化學習跟監督學習差在哪?
監督學習需要大量人工標註資料,一次就告訴 AI 正確答案,學的是輸入對輸出的對應關係。強化學習不需要標註資料,AI 自己探索,透過獎賞與懲罰在多次嘗試與錯誤中學,學的是在什麼狀態下該採取什麼行動。
RLHF 跟 RL 是同一件事嗎?
RLHF 是強化學習的一種應用,全名 Reinforcement Learning from Human Feedback,人類回饋強化學習。差別在獎賞從哪裡來:一般 RL 的獎賞由環境或規則給出,RLHF 的獎賞來自人類對回答好壞的偏好排序,常用在對話模型的訓練後期。
為什麼推理模型很依賴 RL?
因為推理過程很難標註。人類不容易一步一步寫出所有正確的思考路徑,但可以判斷最後答案對不對。用答案對錯當獎賞,讓模型自己產生問題、自己解題、自己驗證評分,就能在沒有人工標註的情況下把推理能力練起來。