RAG 與知識庫
RAG 檢索增強生成是什麼?讓 AI 先查資料再回答
RAG 檢索增強生成是什麼?讓 AI 先查資料再回答
問 AI 「我們公司出差報銷上限多少」,它不可能知道,因為那份規定只存在你們的雲端硬碟裡。硬問就會得到編造的數字。
RAG 就是幫它把那份文件先找出來再作答。這是企業導入 AI 最常走的第一條路。
你將學到什麼
定義
先從外部知識庫檢索相關內容,再讓模型根據這些內容生成答案。
白話比喻
開書考。不要求背起來,但要求你翻到那一頁再作答,還要註明頁碼。
五個步驟
提問、檢索、增強、生成、附上來源引用。
最大好處
知識庫一改,回答立刻跟著改,不用重新訓練模型。
定義
RAG 是結合外部知識庫的生成方式,讓回答更準確、可追溯、有依據。它不改模型,只改模型手上拿到的材料。
流程是五步:使用者提問、在知識庫中檢索相關內容、把檢索到的內容加進問題裡、模型據此生成答案、附上來源引用方便追溯。
白話比喻
像一場開書考。老師不要求你把整本背起來,但要求你翻到正確那一頁再作答。
而且答案卷上要寫「這題出自第幾頁」。翻對頁的人答得又快又準,翻錯頁的人照樣會寫錯,這也是檢索品質決定一切的原因。
知識庫是怎麼建起來的
| 步驟 | 做什麼 |
|---|---|
| 資料擷取 | 從文件、網頁、資料庫、雲端硬碟等來源取得原始資料 |
| 資料清理 | 去除雜訊、統一格式 |
| 切片分段 | 把內容切成一小段一小段 |
| 向量化 | 把文字轉成向量表示 |
| 建立索引 | 存進向量資料庫供檢索 |
實際用例
常見場景包括企業內部知識問答、文件與報告分析、客服與技術支援、研究與市場情報、教育與學習輔助。共同特徵是資料是你自己的、會變動、而且不能答錯。
做得好的幾個關鍵:持續更新知識庫、設定適當的切片策略、調整檢索參數平衡召回率與精準度、提供清楚的來源引用、持續監控效果。跟微調的取捨可以看 知識庫 RAG 跟模型微調的差別。
最常見的誤解是以為 RAG 讓模型「學會」了你的資料。它沒有學,只是每次臨時把資料翻給它看,關掉知識庫就什麼都不知道。
第二個誤解是把 RAG 當成搜尋引擎的替代品。它的強項是把找到的內容整理成答案,找得對不對仍取決於檢索那一段,那一段做不好,後面全白做。相關概念可以看 Grounding 資訊錨定。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

