RAG 與知識庫

Hybrid Search 混合搜尋是什麼?關鍵字與語意各取所長的檢索做法

Hybrid Search(混合搜尋)是把兩種檢索技術合在一起用:關鍵字比對負責精準命中特定字詞,語意向量檢索負責理解概念與同義詞。查詢會同時送進兩邊,各自取回候選結果,再合併去重、重新排序,最後把最相關的參考資料交給模型。目的是互補彼此的盲點,提升召回率與相關性。
Hybrid Search 混合搜尋是什麼?關鍵字與語意各取所長的檢索做法:文章重點卡

Hybrid Search 混合搜尋是什麼?關鍵字與語意各取所長的檢索做法

做知識庫最容易踩到的坑,是查產品型號查不到、查概念又撈回一堆不相干的東西。這兩個問題其實來自兩種不同的檢索方式,各有各的盲點。

混合搜尋就是不二選一的解法:兩種都用,然後把結果合起來重排。它是目前高要求 RAG 系統的標準配備。

你將學到什麼

定義

同時做關鍵字比對與語意向量檢索,再融合重排結果。

白話比喻

一個人負責照字面找,一個人負責照意思找,最後一起交卷。

為什麼要混

關鍵字漏掉同義詞,語意搜尋對專有名詞不敏感,剛好互補。

跟誰容易搞混

它不是第三種演算法,而是把兩種既有方法組合起來用。

定義

Hybrid Search 中文叫混合搜尋,是結合兩種不同檢索技術的做法:同時利用關鍵字匹配的精準度,與語意理解的廣度。

它的目的很明確,就是互補不足。兩種方法各有盲點,合起來用可以提升召回率與相關性,讓知識庫的檢索更完整也更可靠。

白話比喻

像找資料時派兩個人去書庫。一個人照書名逐字比對,另一個人照主題與意思去翻。

照字面找的那位不會漏掉型號與編號,照意思找的那位不會漏掉換句話說的段落。兩份清單合起來,才是完整的答案。

三種方式差在哪

比較項目關鍵字搜尋語意向量搜尋混合搜尋
核心技術關鍵字匹配語意向量相似度兩種方法結合
優點精準、可解釋性高語意理解好、廣度高精準與廣度兼具
缺點遺漏語意相關的內容可能不精準、誤召回計算難度較高
適用場景精確問答、法規條文、代號與專有名詞概念性問題、同義詞查詢、自然語言問答各種場景,特別是高要求的知識庫應用

舉例最清楚:查「心臟病治療」時,純關鍵字可能遺漏標題寫著「心血管疾病療法」的文件;查「蘋果公司財報」時,純語意搜尋可能撈回一堆跟水果蘋果有關的內容。

運作流程

  1. 使用者輸入查詢。
  2. 查詢同時送進關鍵字檢索與語意向量檢索。
  3. 各自回傳排名在前的候選結果。
  4. 合併候選結果並去除重複。
  5. 重新排序或加權融合,把最相關的排到最前面。
  6. 把最相關的參考資料輸出給模型使用。

實際用例

企業內部知識庫是最典型的場景:既要精準找到「產品型號 AX100 規格」,也要理解「AX100 的技術參數」問的是同一件事。

法規查詢也一樣,要能精準命中法條編號,也要理解「罰則」與「處罰規定」是同義。這一層做好,模型拿到的資料才乾淨,回答才不會被 知識截止日 之外的舊資訊拖住。

常見誤解最常見的誤解是把混合搜尋當成一種新演算法,去找「混合搜尋模型」。它其實是一種組合策略,重點在權重怎麼調、結果怎麼融合、要不要再接重排模型。另一個誤解是以為開了混合搜尋就一定更好,如果候選數設太小或權重沒調過,效果可能還不如單用一種。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

關鍵字搜尋和語意搜尋各有什麼問題?
關鍵字搜尋精準、可解釋性高,但無法理解同義詞與近義詞,容易遺漏用詞不同但語意相關的內容。語意搜尋理解廣度好,但對關鍵細節與專有名詞不夠敏感,可能撈回不精準的結果。
混合搜尋怎麼把兩邊結果合起來?
常見做法有三種:倒數排名融合,結合兩邊的排名,平衡效果最佳;加權融合,依需求調整關鍵字與向量的權重;交集加擴展,先取交集再擴展相關結果。之後通常再用重排模型精排一次。
什麼情況一定要用混合搜尋?
資料裡有大量型號、法條編號、專有名詞或代號,同時使用者又會用口語提問的時候。企業內部知識庫、法規查詢與醫療學術檢索都是典型場景。