RAG 與知識庫
Metadata Filtering 中繼資料過濾是什麼?先篩範圍再比語意
Metadata Filtering 中繼資料過濾是什麼?先篩範圍再比語意
知識庫做好了,但同事問今年的請假規定,系統卻撈出去年那份。兩份文件講的幾乎一樣,向量分不出來哪份比較新。
這時候要加的不是更強的模型,而是中繼資料過濾。它負責的是語意管不到的那一半。
你將學到什麼
定義
先用欄位條件縮小範圍,再對剩下的內容比對語意相似度。
白話比喻
先走到正確的樓層與書架,再在那一區找書。
解決什麼問題
語意很像但條件不符,例如版本過期、部門不對、沒有權限。
跟誰容易搞混
常跟混合搜尋混淆,混合搜尋加的是關鍵字,過濾加的是條件。
定義
Metadata Filtering 中文叫中繼資料過濾。中繼資料指的是描述這份文件本身的資訊,例如它是誰寫的、什麼時候寫的、屬於哪個部門、是第幾版。
過濾的意思是:檢索時先用這些欄位把候選範圍縮小,再對剩下的內容做語意相似度比對。順序很重要,先篩再比,不是比完再說。
白話比喻
在圖書館找書時,你不會從一樓開始逐架翻。你會先走到正確的樓層與分類區,再在那一區裡找。
中繼資料就是那些樓層與分類標示。沒有它,語意檢索得在整棟樓裡找,又慢又容易撈到不相干的東西。
常用的欄位
| 欄位 | 用來篩什麼 | 典型情境 |
|---|---|---|
| 日期與版本 | 只要現行有效的版本 | 今年的差旅規定,不要去年那份 |
| 部門與專案 | 只看某個範圍的文件 | 只查行銷部的文件 |
| 文件類型 | 區分合約、簡報、會議紀錄 | 只找合約,不要簡報 |
| 語言 | 避免混入其他語言的版本 | 只回中文版說明 |
| 權限範圍 | 使用者看得到的才進候選 | 一般同仁看不到人事資料 |
兩種做法
第一種是先篩再比對。先用條件把不符合的排除,再對剩下的做相似度計算,結果最準確,多數向量資料庫都支援。缺點是條件下太緊時可能篩到沒東西可比。
第二種是先比對再篩。先取出相似度最高的一批,再把不符條件的丟掉,實作簡單,但常常篩完數量不夠,得回頭多取幾筆。實務上優先選第一種。
實際用例
企業知識庫最常見的兩個用途是權限隔離與版本控管。權限必須靠欄位硬篩,絕對不能寄望模型自己判斷「這個人不該看到這份」。版本則是靠日期與狀態欄位,只讓現行版本進入候選。
整條檢索路徑是這樣的:文件切片後做 Embedding 語意向量 存進向量資料庫,查詢時先用中繼資料篩範圍、再比語意,最後把找到的段落連同出處回給使用者,也就是 Citation 引用來源 那一步。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
知識變現切割地圖(高清版下載及陪跑型教材)
《知識變現切割地圖》的完整陪跑版:地圖高清檔,加上五章 27 萬字的網頁版講義與200 張練習卡。從語感引流設計、互動與轉化、內容分層與產品路徑,到角色鏡像與心理設計、內容資源切割再利用,一層一層把「會做內容」變成「能賣內容」。每一節後面都接著可以直接動手填的練習卡。
NT$ 19,800

