RAG 與知識庫
Contextual Retrieval 是什麼?切片前先補上它的來歷
Contextual Retrieval 是什麼?切片前先補上它的來歷
知識庫建好了卻答不準,最常見的原因不在模型,在切片。一段話被切下來之後,「它」是誰、「這個方案」是哪個方案,都不見了。
情境式檢索處理的就是這件事:在切片進入索引之前,先幫它補上來歷。
你將學到什麼
定義
切片嵌入之前,先為每段補上所屬文件與章節的脈絡說明。
白話比喻
像替每張剪報加一行註記,寫清楚剪自哪份報紙的哪個版面。
解決什麼
片段離開原文後失去指涉,導致檢索比對不到、撈回來也讀不懂。
代價
建索引時要多一道處理,成本與時間都會增加。
定義
情境式檢索是在切片與嵌入之前,先為每一段補上它所屬的脈絡。把脈絡與原文一起拿去做向量化,而不是只嵌入孤立的那段文字。
補的內容通常是三件事:出自哪份文件、屬於哪個章節、這一段在談什麼。
白話比喻
像整理一疊剪報。你把每篇文章剪下來丟進盒子,過幾個月再翻,會完全看不懂那半頁在講誰。
如果剪的時候順手在角落寫一行「某報某版,談某某政策」,那疊剪報才有用。情境式檢索做的就是這一行註記。
它在解決什麼問題
一般的 切片 是把長文切成小段再各自轉成向量。問題在於:中文寫作大量省略主詞,代名詞也很多。
「它的續約條件是這樣」這種句子,離開原文之後就無法比對到任何查詢。加上脈絡之後,這段才會被正確地檢索到。
跟相近做法的差別
| 做法 | 補什麼 | 解決的問題 |
|---|---|---|
| Overlap 切片重疊 | 相鄰片段共用一小段文字 | 句子在邊界被切斷 |
| Contextual Retrieval | 整份文件層級的脈絡說明 | 片段失去指涉與主題 |
| Metadata Filtering | 來源、日期、分類等欄位 | 檢索前先縮小範圍 |
| Re-ranking 重排序 | 取回後再精算相關度 | 撈回來的順序不夠準 |
實際用例
適合的資料:合約與法規、技術文件、長篇報告、課程講義。共通點是章節之間相依性高,單看一段常常不知道在講誰。
實務上會搭配 混合搜尋 一起用。脈絡補得好,語意檢索的命中率會提升,關鍵字那一路也更容易對上專有名詞。
最常見的誤解是把脈絡直接拼進原文然後一起存回知識庫。補上去的說明是為了嵌入用的,回傳給使用者的內容還是要以原文為準,否則引用會出現原文裡沒有的句子。
第二個誤解是以為補了脈絡就不用管切片大小。切得太碎,補再多脈絡也救不回來,兩件事要一起調。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
HE301|Harness Engineering Architecture(12 小時)
兩天十二小時的架構課,處理的是「第一百次仍然成功」。從能力設計出發,逐層拆解知識、脈絡、記憶、規則、工具、工作流、評估與多代理八種架構,每一種都給治理方式與真實案例。12 章 114 課圖文講義、52 張對照表,附兩天的學員講義與投影片 PDF。課程於 2026 年 8 月 30 日實體開課,完整錄影將於課後上傳。
NT$ 12,999

