RAG 與知識庫

Retrieval 檢索是什麼?在對的地方找到對的資料

Retrieval 檢索,是指在龐大的資料來源中,根據使用者的問題找出最相關內容片段的過程。它是 RAG 檢索增強生成的第一段,也是整條流程的基石:檢索不準,後面的生成再好也救不回來。
Retrieval 檢索是什麼?在對的地方找到對的資料:文章重點卡

Retrieval 檢索是什麼?在對的地方找到對的資料

當你的 AI 明明有知識庫,卻答得零零落落,八成不是生成出問題,而是檢索沒找對資料。

檢索是整條 RAG 流程裡最值得先調校的一段,因為它決定了後面所有環節拿到什麼材料。

你將學到什麼

定義

從文件、網頁、資料庫等大量來源中,找出與問題最相關內容片段的過程。

白話比喻

像在圖書館找書。找對書架比讀得快更重要,拿錯書讀再認真也答錯。

跟誰容易搞混

常跟 Generation 生成與 Re-ranking 重排序混在一起講,三者是前後接續的環節。

定義

檢索是從文件、網頁、資料庫等龐大來源中,根據使用者的問題找出最相關的內容片段。簡單說:在對的地方,找到對的資料。

它在 RAG 流程裡排第二棒:使用者提問、檢索、生成、回答使用者。檢索的目標有四個:相關性、準確性、效率性、可靠性。

白話比喻

把 AI 想成一個要回答問題的圖書館員。檢索就是他決定走到哪個書架、抽出哪幾本書的那個動作。

如果一開始就走錯書架,後面讀得再仔細、寫得再漂亮,答案都是錯的。這就是為什麼檢索被稱為 RAG 的基石。

四種檢索方法的差別

方法怎麼運作適用情境
關鍵字檢索透過關鍵字比對文件內容精確詞匹配、結構化資料
語意檢索把文字向量化後,依語意相似度搜尋自然語言問答、長文本
混合搜尋結合關鍵字與語意的檢索結果大多數實際應用場景
重排序對初步結果再做一次精準的相關性排序高要求的精準問答系統

實際用例

企業內部知識助理從公司文件、SOP、會議紀錄中檢索資訊;客服問答系統從 FAQ 與產品文件中檢索答案;研究與學術支援從論文與報告中檢索相關內容。

影響檢索效果的關鍵因素有五個:資料品質、切割策略、向量模型、索引與參數設定、後處理機制。其中前兩項的影響通常最大。

常見誤解最常見的誤解是把檢索不準怪到模型頭上,跑去換更貴的生成模型。實際上先該檢查的是資料有沒有更新、切片切得對不對。另一個誤解是只看找回來的東西準不準,忘了看該找到的有沒有被漏掉。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

檢索有哪幾種方法?
常見四種:關鍵字檢索、語意檢索、混合檢索、重排序。實務上多半先用混合檢索取出候選,再用重排序精選。
檢索效果不好,先調哪裡?
先看切割策略與資料品質,這兩件影響最大。接著才是換向量模型、調整 Top K 與相似度計算方式。
怎麼知道檢索到底好不好?
看召回率與精確率,再加上排序位置的指標。相關的內容有沒有被找回來,找回來的內容有多少真的相關,兩者要一起看。