RAG 與知識庫
Vector Database 是什麼?讓 AI 用語意找資料的倉庫
Vector Database 是什麼?讓 AI 用語意找資料的倉庫
你把一百份文件丟給 AI,它怎麼在三秒內找出最相關的那三段?靠的不是關鍵字搜尋,是向量資料庫。
這是知識庫能運作的基礎設施。搞懂它,你會知道為什麼「切片」跟「嵌入模型」那麼重要。
你將學到什麼
定義
專門儲存、索引與檢索向量的資料庫,依語意相似度而不是關鍵字比對。
白話比喻
像一間依照「意思」擺書的圖書館,而不是依照書名筆畫排。
五個步驟
資料來源、切分、向量化、存進資料庫建索引、檢索與應用。
跟誰容易搞混
常跟一般資料庫搞混。前者查「像不像」,後者查「等不等於」。
定義
向量資料庫是專門用來儲存、索引與檢索向量資料的資料庫。它能根據語意相似度而非關鍵字,快速找到最相關的內容。
四個特點:語意搜尋、高效檢索、可擴充性、以及與模型和知識庫架構的彈性整合。
白話比喻
一般資料庫像照書名筆畫排的書架,你要記得書名才找得到。向量資料庫像照「內容在講什麼」擺書。
你走進去說「我想找講如何帶新人的書」,它會把管理、教練、溝通那幾櫃一起端給你,就算書名裡沒有「新人」兩個字。
資料怎麼變成可檢索的向量
- 資料來源:文件、網頁、資料庫等多種格式的資料。
- 資料切分:切成小段落,也就是 Chunking 切片。
- 向量化:用 Embedding 模型把文字轉成向量。
- 儲存與建索引:向量加上中繼資料一起存進資料庫。
- 檢索與應用:語意相似度搜尋,把結果提供給模型生成答案。
在 RAG 架構裡,使用者的問題也走同一條路:先向量化,再比對,取回最相關的幾段,組成上下文交給模型。
跟相近名詞的差別
| 名詞 | 它負責什麼 | 白話說法 |
|---|---|---|
| Embedding | 把文字轉成向量 | 翻譯成座標 |
| Vector Database | 存放向量並建立索引 | 放座標的倉庫 |
| Vector Search | 在向量空間裡找最近的鄰居 | 查詢動作本身 |
| BM25 | 傳統關鍵字比對 | 字面上要對得上 |
實際用例
常見場景:企業知識庫與內部問答、智慧客服、內容推薦、法遵與內稽的條文檢索、技術文件查詢、個人知識管理。
實務上的四個關鍵:切分策略、嵌入模型品質、取回筆數的設定、以及定期更新資料保持新鮮度。
最常見的誤解是「有了向量資料庫,檢索就會準」。真正影響準確度的是切分策略與嵌入模型,資料庫只負責把向量放好、找得快。
第二個誤解是以為語意搜尋可以完全取代關鍵字。專有名詞、型號、法條編號這類東西,關鍵字比對反而更可靠,所以實務上常用 混合搜尋。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
知識變現切割地圖(高清版下載及陪跑型教材)
《知識變現切割地圖》的完整陪跑版:地圖高清檔,加上五章 27 萬字的網頁版講義與200 張練習卡。從語感引流設計、互動與轉化、內容分層與產品路徑,到角色鏡像與心理設計、內容資源切割再利用,一層一層把「會做內容」變成「能賣內容」。每一節後面都接著可以直接動手填的練習卡。
NT$ 19,800

