AI 基礎

生成式 AI 應用開發入門:RAG、框架與部署觀念一次看懂

開發生成式 AI 應用有三塊基石:用提示與脈絡控制模型行為;用 RAG 讓模型先檢索外部知識再回答,解決模型不認識你的資料的問題;用 LangChain 這類框架把模型、提示範本與工具串成流程。部署時再考量介面、成本、延遲與監控。
生成式 AI 應用開發入門:RAG、框架與部署觀念一次看懂:文章重點卡

生成式 AI 應用開發入門:RAG、框架與部署觀念一次看懂

會用 ChatGPT,跟做出一個生成式 AI 應用,中間隔著什麼?我修 IBM 的應用開發課之前,以為隔著的是高深的模型知識;修完發現,隔著的其實是幾個工程觀念:脈絡怎麼組、知識怎麼接、流程怎麼串、上線怎麼顧。

這篇把這幾個觀念用入門者聽得懂的方式講一遍。看完你不一定會寫程式,但你會知道一個 AI 應用是怎麼組起來的,以及每個環節在解決什麼問題。

你將學到什麼

從聊天到應用

差在提示範本、脈絡管理與流程編排。

RAG 原理

先檢索再生成,讓模型答得出你的資料。

框架的角色

LangChain 這類工具到底幫你省了什麼。

部署觀念

原型、介面、成本與監控的基本功。

從會聊天到做出應用,中間差了什麼

差的不是模型,而是模型周圍的工程:把常用提示做成範本、把使用者輸入與相關資料組進脈絡、把多個步驟串成流程、對輸出做驗證。應用開發的重點,是把「怎麼問」這件事自動化、標準化,讓每個使用者不必自己會下提示,也能得到穩定的結果。

換句話說:模型負責聰明,工程負責可靠。

RAG:讓模型答得出它沒背過的事

大型語言模型有兩個天生限制:知識停在訓練資料的時間點,而且不認識你的私有資料。檢索增強生成(Retrieval-Augmented Generation,RAG)是目前最主流的解法,流程分兩段:

  1. 事前準備:把你的文件切成小段,用嵌入模型轉成向量,存進向量資料庫。
  2. 回答當下:把使用者的問題也轉成向量,到資料庫找出語意最接近的段落,連同問題一起放進提示,讓模型根據這些段落作答。
事前準備文件切成段落轉成向量向量資料庫回答當下使用者問題檢索相關段落模型生成回答回答
RAG 的兩段流程:事前把文件變成向量索引,回答時先檢索再生成。

好處很直接:知識更新只要重建索引,不用重新訓練模型;回答可以附上出處,比較能查核;私有資料留在自己的資料庫。代價是多了「檢索品質」這個變數:切段方式、嵌入模型、檢索策略,都會影響最後的答案。

也別誤會 RAG 是把資料全部塞給模型就好:塞進脈絡的內容越多,成本越高、雜訊也越多。檢索的意義正是「只挑最相關的幾段」,讓模型在有限的脈絡裡拿到最有用的材料。

框架在幫你什麼:以 LangChain 為例

LangChain、LlamaIndex 這類開發框架,本質是把生成式 AI 應用裡重複出現的積木標準化:提示範本、模型介接(換一家模型供應商時不用重寫)、把多個步驟串成鏈(chain)、接上向量資料庫與外部工具。IBM 的課程路線也以 LangChain 為主軸,從提示範本一路教到 RAG 與 AI Agent。

但框架不是必需品。簡單的應用直接呼叫 API 反而乾淨;當你需要換模型、加檢索、串多步驟流程時,框架的價值才會浮現。先理解原理,再決定要不要用框架,順序不要反過來。

介面與部署:從原型到上線

應用要有人用,先得有介面。原型階段可以用 Gradio 這類工具,幾行程式就把模型包成網頁介面,方便快速給人試用、蒐集回饋。真的要上線,還要多想幾件事:

  • 成本:生成式模型按 token 計費,脈絡塞得越多越貴,要設計上限與快取。
  • 延遲:檢索加生成需要時間,介面要有串流輸出或進度提示,別讓使用者盯著空白畫面。
  • 防線:對幻覺、敏感內容與提示注入設檢查;使用者輸入永遠當資料、不當指令。
  • 監控:記錄問題與回答、蒐集回饋。上線不是結束,是迭代的開始。

給想入門的人的路線

我會這樣排順序:先把提示工程的基本功練熟;再理解 RAG 的原理,親手做一個小小的知識庫問答;接著用框架把流程整理成可維護的程式;最後才煩惱部署與監控。每一步都有免費工具可以練,門檻比想像中低。

本文源起本文取材自 Coursera 上的「Develop Generative AI Applications」課程(IBM),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

RAG 和微調(fine-tuning)怎麼選?
資料常變動、需要引用來源、預算有限時,先選 RAG:只要更新知識庫,不用重新訓練模型。微調適合改變模型的語氣與行為模式,兩者也可以並用。
一定要用 LangChain 嗎?
不一定。框架幫你處理提示範本、串接模型與工具、管理流程這些重複工作;簡單的應用直接呼叫模型 API 就夠。專案變複雜、要換模型或加檢索時,框架的價值才明顯。
向量資料庫是做什麼的?
它儲存文字轉成的向量(embedding),並支援相似度搜尋:把問題也轉成向量後,找出語意最接近的文件片段。這是 RAG 檢索階段的核心元件。
生成式 AI 應用上線前要注意什麼?
至少四件事:建立測試題組評估回答品質、對幻覺與敏感內容設防線、估算 token 成本與回應延遲,以及上線後持續蒐集回饋與記錄。