RAG 與知識庫
Re-ranking 重排序是什麼?先廣撒網,再精準挑
Re-ranking 重排序是什麼?先廣撒網,再精準挑
知識庫問答明明資料都有,答案卻總是抓到半相關的段落。多半不是資料的問題,是排序的問題。
重排序解決的就是這件事。檢索負責「廣」,重排序負責「準」,兩段分工之後,最終回答的品質會明顯不一樣。
你將學到什麼
定義
對初步檢索出的候選結果,用更強的模型重新打分排序,把最相關的排到最前面。
白話比喻
像履歷篩選。先用關鍵字刷掉大部分,再讓主管細看剩下的幾份,決定誰排第一。
跟誰容易搞混
跟檢索不同。檢索是把候選找出來,重排序是決定這批候選誰最相關。
定義
Re-ranking 重排序,是在向量檢索之後加的一道步驟。先用快速但相對粗略的檢索模型找出一批候選文件,再用更強大的重排序模型,對這些候選做更精準的相關性打分,重新排序。
在知識庫問答的完整流程裡,它排在第三步:使用者提問、初步檢索、重排序、取前幾筆高品質內容、交給模型生成最終回答。
一句話記住分工:檢索負責「廣」,重排序負責「準」。
白話比喻
像招募流程。第一關用關鍵字快速刷掉大部分履歷,留下五十份;第二關主管一份一份細看,決定誰進面試。第一關要快,第二關要準,兩關的工具本來就不該一樣。
效果差在哪?初步檢索的分數往往很接近,第一名和第五名只差零點零幾,排序其實不可靠。重排序重新打分之後,真正最相關的那筆才會浮上來。
檢索跟重排序差在哪?
| 比較點 | 初步檢索 | 重排序 |
|---|---|---|
| 目標 | 快速找出可能相關的集合 | 精準判斷哪些最相關 |
| 編碼方式 | 查詢與文件各自獨立編碼 | 查詢與文件一起編碼,理解更深 |
| 速度 | 非常快,毫秒級 | 較慢,百毫秒到秒級 |
| 成本 | 低 | 較高 |
| 輸出量 | 候選數十到上千筆 | 精排後留下數筆到數十筆 |
| 角色 | 召回 | 精排 |
實際用例
以一個健康知識庫為例。使用者問「怎麼改善睡眠品質」,初步檢索撈回五筆,分數從零點七幾到零點八幾,排第一的其實是相關度較低的那筆。重排序之後,真正談改善方法的那篇被推到第一,回答品質立刻不同。
要不要加這一段?如果你的知識庫問答常常「資料明明有卻答不到重點」,加重排序是最直接的改善。搭配 混合搜尋 一起用,召回與精排都補齊,效果更明顯。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
思維邏輯自我訓練:九週訓練計畫(含入門練習版)
九週六十三天,把思考練成可以重複執行的流程。從打開思考肌群、知識濾網、觀點盲區,一路走到輸出引擎。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面當地基,再進入九週的每日訓練。每一週都有訓練目標與高低任務差設計的任務表。
NT$ 1,699

