AI Agent

AI Agent 是什麼?IBM 課程從複合 AI 系統講到 ReAct

AI Agent 是把大型語言模型放在控制邏輯核心的複合 AI 系統:模型自己推理、規劃步驟,並呼叫搜尋、計算機、資料庫等外部工具完成任務,還能存取記憶讓體驗個人化。最常見的配置方式是 ReAct,讓模型在思考、行動、觀察之間循環,直到得出最終答案。
AI Agent 是什麼?IBM 課程從複合 AI 系統講到 ReAct:文章重點卡

AI Agent 是什麼?IBM 課程從複合 AI 系統講到 ReAct

「AI Agent」大概是這一年被講到最模糊的詞。修 IBM 的《Fundamentals of Building AI Agents》時,我最喜歡它的切入點:不從名詞定義開始,而是從「單靠模型為什麼不夠」講起,一路推到為什麼需要 Agent。

這篇整理課程的觀念部分:複合 AI 系統、控制邏輯、Agent 的三種能力與 ReAct 迴圈。看完你會知道 Agent 到底新在哪裡,以及它不是萬靈丹。

你將學到什麼

複合 AI 系統

為什麼單靠模型不夠,系統設計才是解法。

控制邏輯

程式說了算,還是讓 LLM 自己規劃。

Agent 三能力

推理、用工具行動、存取記憶。

ReAct 迴圈

思考、行動、觀察,循環到答案出現。

從單體模型到複合 AI 系統

課程用一個很好懂的例子開場:問模型「我今年還剩幾天假」。模型答不出來,因為它不認識你,也碰不到你公司的請假系統。單靠模型,它只知道訓練資料裡的世界,想教它新東西還得投入資料與資源去微調。

解法不是把模型調教得更聰明,而是圍繞模型建立系統:讓模型把你的問題轉成資料庫查詢,去請假資料庫撈出資料,再把結果組成一句人話回覆。這就是複合 AI 系統(compound AI system):模型只是其中一個元件,旁邊還有輸出驗證器、查詢拆解程式、資料庫與各種工具。

系統是模組化的,換零件比重新訓練模型快得多。常聽到的 RAG(檢索增強生成),就是最流行的複合 AI 系統之一。

控制邏輯:誰決定下一步

但多數複合 AI 系統有個限制:走哪條路是寫死的。那個假期查詢系統遇到「明天天氣如何」就掛了,因為它的程式只會查假期資料庫。這條「回答問題要走的路」叫做控制邏輯,傳統上由人來定義。

Agent 的關鍵轉變是:把控制邏輯交給大型語言模型。這件事之所以可行,是因為模型的推理能力大幅進步。課程用「思考快與慢」比喻光譜的兩端:一端是要系統照程式走、別偏離指令;另一端是要系統慢慢想,先擬計畫、逐步執行、卡住就調整。當 LLM 負責邏輯,就是所謂的代理式(agentic)方法。

LLM Agent 的三種能力

  • 推理:模型站在解題的核心位置,被提示先擬計畫,並對過程中的每一步進行推理。
  • 行動:透過外部程式(業界稱為工具)執行,例如網頁搜尋、資料庫查詢、計算機、一段程式碼,甚至另一個語言模型。模型自己決定何時呼叫、怎麼呼叫。
  • 記憶:儲存模型解題時的思考日誌,以及使用者的對話歷史,讓體驗更個人化,也能在之後取回先前的結論。

ReAct:邊想邊做的迴圈

配置 Agent 最流行的方式之一是 ReAct,名字就是推理(Reason)加行動(Act)。使用者的問題進到模型後,模型收到的指示大意是:別急著給第一個想到的答案,先規劃,再行動;需要就呼叫工具,拿到結果後觀察它,判斷是已經回答了問題、還是要調整計畫,如此循環直到得出最終答案。

使用者問題思考規劃行動呼叫工具觀察結果調整計畫答案夠好最終答案
ReAct 迴圈:模型在思考、行動、觀察之間循環,答案夠好才交卷。

課程的示範很生動:「下個月去佛羅里達玩,我這種容易曬傷的人該帶幾瓶兩盎司的防曬乳?」這個問題要查記憶裡的請假天數、查天氣預報估日曬時數、查公衛網站的防曬乳建議用量,最後還要做數學。沒有一條寫死的路徑能解它,但 Agent 可以自己把路走出來。

三種系統設計怎麼選

課程也把 AI 系統設計整理成一個光譜,三種範式各有適用場景:

類型流程適合代價
單一 LLM輸入 → 模型 → 輸出摘要、分類等單步任務無記憶、不適應情境
結構化工作流程照預先定義的步驟執行重複性、重合規的多步任務僵化,每個例外都要寫程式
自主 Agent規劃 → 行動 → 觀察循環複雜、開放式任務結果較難預測,成本較高
從簡單開始課程的建議很務實:能用單一 LLM 解決的就別上工作流程,能用工作流程的就別上 Agent。Agent 留給真正需要適應性與複雜推理的問題。實務上混合架構最常見,用工作流程的可靠性搭配 Agent 的彈性。

下一篇我會接著整理這門課的實作面:怎麼判斷一個任務該不該交給 Agent,以及部署上線前該做哪些防護。

本文源起本文取材自 Coursera 上的「Fundamentals of Building AI Agents」課程(IBM),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

AI Agent 和聊天機器人有什麼不同?
聊天機器人主要靠模型本身生成回應;Agent 則讓模型自己規劃步驟、呼叫外部工具(搜尋、資料庫、計算機)並觀察結果調整計畫,能完成多步驟的任務,而不只是回答問題。
什麼是複合 AI 系統?
在單一模型之外,加上輸出驗證器、查詢拆解、資料庫搜尋、各種工具等程式化元件組成的系統。它是模組化的,比重新調整模型更快、更容易因應需求變化。
所有任務都該用 Agent 嗎?
不是。狹窄、明確定義的問題用程式化流程更有效率;Agent 適合複雜、開放式、路徑難以事先定義的任務。課程建議永遠從最簡單的做法開始。
ReAct 是什麼?
ReAct 結合推理(Reason)與行動(Act):模型被提示先規劃再行動,需要時呼叫工具,觀察結果後決定要修正計畫還是給出最終答案。