RAG 與知識庫
Retrieval 檢索是什麼?在對的地方找到對的資料
Retrieval 檢索是什麼?在對的地方找到對的資料
當你的 AI 明明有知識庫,卻答得零零落落,八成不是生成出問題,而是檢索沒找對資料。
檢索是整條 RAG 流程裡最值得先調校的一段,因為它決定了後面所有環節拿到什麼材料。
你將學到什麼
定義
從文件、網頁、資料庫等大量來源中,找出與問題最相關內容片段的過程。
白話比喻
像在圖書館找書。找對書架比讀得快更重要,拿錯書讀再認真也答錯。
跟誰容易搞混
常跟 Generation 生成與 Re-ranking 重排序混在一起講,三者是前後接續的環節。
定義
檢索是從文件、網頁、資料庫等龐大來源中,根據使用者的問題找出最相關的內容片段。簡單說:在對的地方,找到對的資料。
它在 RAG 流程裡排第二棒:使用者提問、檢索、生成、回答使用者。檢索的目標有四個:相關性、準確性、效率性、可靠性。
白話比喻
把 AI 想成一個要回答問題的圖書館員。檢索就是他決定走到哪個書架、抽出哪幾本書的那個動作。
如果一開始就走錯書架,後面讀得再仔細、寫得再漂亮,答案都是錯的。這就是為什麼檢索被稱為 RAG 的基石。
四種檢索方法的差別
| 方法 | 怎麼運作 | 適用情境 |
|---|---|---|
| 關鍵字檢索 | 透過關鍵字比對文件內容 | 精確詞匹配、結構化資料 |
| 語意檢索 | 把文字向量化後,依語意相似度搜尋 | 自然語言問答、長文本 |
| 混合搜尋 | 結合關鍵字與語意的檢索結果 | 大多數實際應用場景 |
| 重排序 | 對初步結果再做一次精準的相關性排序 | 高要求的精準問答系統 |
實際用例
企業內部知識助理從公司文件、SOP、會議紀錄中檢索資訊;客服問答系統從 FAQ 與產品文件中檢索答案;研究與學術支援從論文與報告中檢索相關內容。
影響檢索效果的關鍵因素有五個:資料品質、切割策略、向量模型、索引與參數設定、後處理機制。其中前兩項的影響通常最大。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
HE101|Harness Engineering Foundation(3 小時)
三小時的地圖課,不是操作課。把 Model 與 AI System 分開,拆解一套 AI Harness 的八個組成(Goal、Context、Knowledge、Rules、Tools、Workflow、Evaluation、Iteration),再帶你逆向拆解四個你已經在用的系統,最後畫出自己的第一張 Harness Blueprint。5 章 27 課,附學員講義 PDF 與術語速查表。
NT$ 2,599

