Agent 與工作流

ReAct 推理行動框架是什麼?想一步、做一步、看結果再想

ReAct(Reason + Act,推理加行動)是一種讓模型交替進行「思考」與「行動」的框架。模型先推理下一步該做什麼,接著呼叫工具執行動作,拿到結果(Observation)之後再回頭推理,如此循環直到得出答案。它把純思考的推理鏈跟能對外操作的工具呼叫接在一起,是現代 Agent 最常見的運作骨架。
ReAct 推理行動框架是什麼?想一步、做一步、看結果再想:文章重點卡

ReAct 推理行動框架是什麼?想一步、做一步、看結果再想

為什麼有些 AI 只會空想,有些卻能一邊查資料一邊修正答案?差別就在有沒有這個循環。

ReAct 是把「想」跟「做」接起來的那一段設計,也是 Agent 能自己往前走的原因。

你將學到什麼

一句話定義

讓模型交替進行推理與行動,每做一步就看結果再想下一步。

白話比喻

像偵探辦案:想一個假設、去查一件事、看到證據再修正假設。

三個環節

Thought 想、Action 做、Observation 看結果,循環到收斂。

跟誰容易搞混

推理鏈只在腦中推導,ReAct 會真的去呼叫工具拿資料。

定義

ReAct 的全名是 Reason 加 Act,中文常稱推理行動框架。它讓模型交替進行推理與行動,而不是一次把答案想完。

一輪循環包含三個環節:Thought(我現在該做什麼)、Action(實際呼叫某個工具)、Observation(工具回傳了什麼)。

拿到觀察結果之後,模型回到 Thought 重新判斷,直到資訊足夠可以給出最終答案。

白話比喻

偵探不會坐在椅子上把整個案子想完。他會提出一個假設,然後出門查一件事,看到證據之後再修正假設。

ReAct 就是這個循環。它的價值不在於想得多聰明,而在於每一步都能被現實糾正。

一輪循環長什麼樣

環節在做什麼例子
Thought 推理判斷現在缺什麼資訊、下一步該做什麼我需要知道這家公司今年的營收
Action 行動選擇並呼叫合適的工具呼叫搜尋工具,關鍵字是公司名加年度財報
Observation 觀察接收工具回傳的結果拿到三筆搜尋結果與一段摘要
回到 Thought根據結果修正方向或決定收尾資料不夠具體,改查官方投資人關係頁

實際用例

問「這個月的訂單裡,退貨率最高的是哪個品項」,模型會先想到要查資料庫,呼叫查詢工具拿回數據,發現欄位不齊,再補查一次品項對照表,最後才算出答案。

這整段就是 ReAct。實際執行動作的能力來自 Tool Calling 工具呼叫,而把這個循環包成一個能自主完成任務的單位,就是 Agent

常見誤解最常見的誤解是以為 ReAct 是某一套框架或函式庫的名字。它其實是一種提示與流程的設計模式,各家工具都可以實作,你自己在對話裡手動照這個節奏走也算。另一個要注意的是成本:每一輪都是一次完整的模型呼叫加上工具呼叫,步數沒設上限的話,費用會比單次問答高出很多。想比較純推理的做法,可看 Chain-of-Thought 思維鏈
本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

ReAct 跟思維鏈差在哪?
思維鏈(Chain-of-Thought)是純粹在模型內部把推理過程展開,全程沒有跟外界互動,資訊來源只有模型自己記得的東西。ReAct 則在推理的中間插入實際動作,例如搜尋、查資料庫、跑計算,然後把回傳的結果納入下一輪推理。一個靠回想,一個靠查證。
它怎麼知道什麼時候要停?
通常由兩件事決定:模型自己判斷已經有足夠資訊可以回答,或是達到預設的最大步數上限。實務上一定要設步數上限與逾時,否則模型可能在錯誤的方向上反覆呼叫工具,把時間與費用都燒光,這是最常見的失控原因。
為什麼它比較不容易產生幻覺?
因為每一輪的推理都會被外部回傳的實際結果修正。模型如果猜錯了,下一步查到的資料就會跟它的假設對不上,它有機會調整方向。但這不代表不會出錯:如果工具本身回傳錯誤資訊,或模型誤讀了結果,一樣會推出錯的結論。