RAG 與知識庫
Vector Search 向量搜尋是什麼?讓 AI 懂你的意思而不是字面
Vector Search 向量搜尋是什麼?讓 AI 懂你的意思而不是字面
你在知識庫裡搜「機器學習怎麼入門」,結果一片空白,因為你的文件標題寫的是「深度學習初始指南」。
關鍵字搜尋只認字面,向量搜尋認的是意思。這一篇講清楚它怎麼辦到。
你將學到什麼
定義
向量搜尋把文字轉成向量,在高維空間中比較語義相似度,找出最相關的內容。
白話比喻
關鍵字搜尋像對答案,字對才算;向量搜尋像聽懂你的意思,換個講法也找得到。
跟誰容易搞混
BM25 是精準關鍵字比對,兩者各有強項,實務上常合起來用,那就是混合搜尋。
定義
Vector Search(向量搜尋)透過把文字、圖片、語音等資料轉換成向量,在高維度空間中比較語義相似度,找出最相關的結果。
它的核心是「語義理解」。它不看關鍵字,而是理解你真正想要的意思,找出最符合語意的答案。
運作流程
- 使用者輸入查詢,用自然語言問就好。
- 用 Embedding 模型把查詢轉換成向量。
- 在向量資料庫中搜尋已建好的文件向量。
- 計算相似度並排序,常用的度量是餘弦相似度。
- 回傳最相關的前幾筆結果。
白話比喻
傳統關鍵字搜尋像對答案,字要對得上才算數。你查「機器學習 入門」,可能只撈到標題剛好含有相同關鍵字的那幾份。
向量搜尋像聽懂你的意思。同樣一句「機器學習入門」,它能找到深度學習初始指南、AI 新手教學、如何進入資料科學領域這些用詞不同但概念相近的內容。
跟關鍵字搜尋差在哪
| 比較項目 | Keyword Search 關鍵字搜尋 | Vector Search 向量搜尋 |
|---|---|---|
| 搜尋方式 | 精準關鍵字匹配 | 語義相似度匹配 |
| 理解能力 | 低,只匹配字面 | 高,理解語義 |
| 結果準確度 | 可能遺漏相關內容 | 找出更多相關內容 |
| 適用場景 | 精確查找特定詞彙 | 語義搜尋、問答、推薦 |
實際用例
最常見的四個場景是智慧客服、文件檢索、推薦系統、知識庫問答。共同點都是使用者不會用你文件裡的原話發問。
常見的向量資料庫有 Pinecone、Weaviate、Milvus、Qdrant、Chroma、FAISS。它們支援高維向量索引、快速近似搜尋,也支援用中繼資料先過濾再搜。
常見的 Embedding 模型則有 OpenAI 的 text-embedding-3、Google 的 text-embedding,以及開源的 sentence-transformers。
優點與限制
- 優點,理解語義,超越關鍵字匹配;找出更相關但不同表述的內容;對同義詞與相近概念更敏感;提升搜尋體驗與準確度。
- 限制,需要先建立向量,有計算成本;效果依賴 Embedding 模型的品質;可能回傳語義相似但不精確的內容;向量維度高,需要較多儲存空間。
所以它適合語義搜尋、問答與推薦,不適合單獨拿來查型號、代碼或法條編號這類要求逐字命中的情境。
延伸學習
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599
知識變現切割地圖(高清版下載及陪跑型教材)
《知識變現切割地圖》的完整陪跑版:地圖高清檔,加上五章 27 萬字的網頁版講義與200 張練習卡。從語感引流設計、互動與轉化、內容分層與產品路徑,到角色鏡像與心理設計、內容資源切割再利用,一層一層把「會做內容」變成「能賣內容」。每一節後面都接著可以直接動手填的練習卡。
NT$ 19,800

