RAG 與知識庫
HyDE 假設性文件嵌入是什麼?先生成假答案再拿去檢索
HyDE 假設性文件嵌入是什麼?先生成假答案再拿去檢索
有時候問題的措辭跟知識庫裡真正的答案文件用詞差很多,直接拿問題去檢索反而找不到重點,這時候 HyDE 就派上用場。
你將學到什麼
定義
先讓模型生成一份假設性答案,再拿這份假答案去做向量檢索的技巧。
白話比喻
像先自己猜一個答案草稿,再拿這份草稿去圖書館比對,往往比拿問題本身去找更準。
跟誰容易搞混
跟一般的 Embedding 檢索不同,一般做法是直接把問題轉向量,HyDE 多了一道先生成假答案的手續。
定義
HyDE(Hypothetical Document Embeddings,假設性文件嵌入)是一種提升 Retrieval 檢索 準確度的技巧,核心做法是先生成假答案,再拿假答案去檢索。
流程是先把使用者的問題交給大型語言模型,請它生成一份假設性的答案文件,再把這份假答案轉成 Embedding 語意地圖,拿去跟知識庫裡的真實文件做相似度比對。
白話比喻
HyDE 就像考試遇到不熟的題目,先憑印象寫一份自己猜測的答案草稿,再拿這份草稿去圖書館找相關的參考資料,會比直接拿題目原文去找書更容易找對書架。
因為草稿的用詞跟真正教科書上的用詞比較接近,題目本身的措辭反而常常跟書上的寫法有落差,這正是 HyDE 想解決的問題。
HyDE 跟一般檢索差在哪?
| 比較項目 | 一般檢索 | HyDE 檢索 |
|---|---|---|
| 檢索依據 | 直接把問題轉成向量 | 先生成假答案,再把假答案轉成向量 |
| 適合情境 | 問題與答案用詞接近時 | 問題與答案措辭落差較大時 |
| 額外成本 | 無 | 多一次生成假答案的模型呼叫 |
| 命中率 | 措辭落差大時容易漏檢 | 通常較能命中真正相關的文件 |
實際用例
常見應用場景是企業內部的知識庫問答,員工的提問方式通常很口語,例如「請假流程」,但規章文件裡可能寫著正式的條文用詞,這時候用 HyDE 生成一份假設性的規章式回答再去檢索,往往更容易命中正確的段落。
實務上 HyDE 常搭配 Hybrid Search 混合搜尋 一起使用,先用假答案做語意檢索補齊語意相近但用詞不同的內容,再搭配關鍵字比對確保精準命中的部分不會漏掉。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

