RAG 與知識庫

Vector Database 是什麼?讓 AI 用語意找資料的倉庫

Vector Database(向量資料庫)是專門用來儲存、索引與檢索向量資料的資料庫。它把文件、圖片、音訊等非結構化資料先轉成向量,再依語意相似度而不是關鍵字比對,快速找到最相關的內容。它是檢索增強生成架構裡的關鍵基礎設施:使用者的問題也會被轉成向量,資料庫比對之後回傳最接近的幾段內容,交給模型生成答案。
Vector Database 是什麼?讓 AI 用語意找資料的倉庫:文章重點卡

Vector Database 是什麼?讓 AI 用語意找資料的倉庫

你把一百份文件丟給 AI,它怎麼在三秒內找出最相關的那三段?靠的不是關鍵字搜尋,是向量資料庫。

這是知識庫能運作的基礎設施。搞懂它,你會知道為什麼「切片」跟「嵌入模型」那麼重要。

你將學到什麼

定義

專門儲存、索引與檢索向量的資料庫,依語意相似度而不是關鍵字比對。

白話比喻

像一間依照「意思」擺書的圖書館,而不是依照書名筆畫排。

五個步驟

資料來源、切分、向量化、存進資料庫建索引、檢索與應用。

跟誰容易搞混

常跟一般資料庫搞混。前者查「像不像」,後者查「等不等於」。

定義

向量資料庫是專門用來儲存、索引與檢索向量資料的資料庫。它能根據語意相似度而非關鍵字,快速找到最相關的內容。

四個特點:語意搜尋、高效檢索、可擴充性、以及與模型和知識庫架構的彈性整合。

白話比喻

一般資料庫像照書名筆畫排的書架,你要記得書名才找得到。向量資料庫像照「內容在講什麼」擺書。

你走進去說「我想找講如何帶新人的書」,它會把管理、教練、溝通那幾櫃一起端給你,就算書名裡沒有「新人」兩個字。

資料怎麼變成可檢索的向量

  1. 資料來源:文件、網頁、資料庫等多種格式的資料。
  2. 資料切分:切成小段落,也就是 Chunking 切片
  3. 向量化:用 Embedding 模型把文字轉成向量。
  4. 儲存與建索引:向量加上中繼資料一起存進資料庫。
  5. 檢索與應用:語意相似度搜尋,把結果提供給模型生成答案。

RAG 架構裡,使用者的問題也走同一條路:先向量化,再比對,取回最相關的幾段,組成上下文交給模型。

跟相近名詞的差別

名詞它負責什麼白話說法
Embedding把文字轉成向量翻譯成座標
Vector Database存放向量並建立索引放座標的倉庫
Vector Search在向量空間裡找最近的鄰居查詢動作本身
BM25傳統關鍵字比對字面上要對得上

實際用例

常見場景:企業知識庫與內部問答、智慧客服、內容推薦、法遵與內稽的條文檢索、技術文件查詢、個人知識管理。

實務上的四個關鍵:切分策略、嵌入模型品質、取回筆數的設定、以及定期更新資料保持新鮮度。

常見誤解

最常見的誤解是「有了向量資料庫,檢索就會準」。真正影響準確度的是切分策略與嵌入模型,資料庫只負責把向量放好、找得快。

第二個誤解是以為語意搜尋可以完全取代關鍵字。專有名詞、型號、法條編號這類東西,關鍵字比對反而更可靠,所以實務上常用 混合搜尋。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

向量資料庫跟一般資料庫差在哪?
一般資料庫做的是精確比對,你問「客戶編號等於多少」,它回傳完全符合的那一筆。向量資料庫做的是相似度比對,你問一個意思,它回傳語意上最接近的幾筆,即使字面完全不同。兩者解決的問題不一樣。
為什麼需要中繼資料?
光靠語意相似度會撈到不該撈的東西。中繼資料像來源、頁碼、日期、分類,可以在檢索前先過濾,也可以用來做權限管控與資料遮蔽,並且讓結果的可解釋性變高,你會知道答案是從哪一份文件的哪一頁來的。
資料更新了要重新建整個索引嗎?
通常不用。多數向量資料庫支援即時新增與更新,改動哪幾段就重算哪幾段的向量。但如果換了嵌入模型,向量空間就變了,這時候整批資料都要重新向量化,不能新舊混用。