RAG 與知識庫

Vector Search 向量搜尋是什麼?讓 AI 懂你的意思而不是字面

Vector Search(向量搜尋)是一種基於語義理解的搜尋技術。它先用 Embedding 模型把文字、圖片或語音轉換成向量,再到高維空間中比較語義相似度,找出最相關的內容,而不只是關鍵字匹配。因為理解的是意思而非字面,它能找到用詞不同但概念相近的資料,是 RAG 與知識庫問答的核心。
Vector Search 向量搜尋是什麼?讓 AI 懂你的意思而不是字面:文章重點卡

Vector Search 向量搜尋是什麼?讓 AI 懂你的意思而不是字面

你在知識庫裡搜「機器學習怎麼入門」,結果一片空白,因為你的文件標題寫的是「深度學習初始指南」。

關鍵字搜尋只認字面,向量搜尋認的是意思。這一篇講清楚它怎麼辦到。

你將學到什麼

定義

向量搜尋把文字轉成向量,在高維空間中比較語義相似度,找出最相關的內容。

白話比喻

關鍵字搜尋像對答案,字對才算;向量搜尋像聽懂你的意思,換個講法也找得到。

跟誰容易搞混

BM25 是精準關鍵字比對,兩者各有強項,實務上常合起來用,那就是混合搜尋。

定義

Vector Search(向量搜尋)透過把文字、圖片、語音等資料轉換成向量,在高維度空間中比較語義相似度,找出最相關的結果。

它的核心是「語義理解」。它不看關鍵字,而是理解你真正想要的意思,找出最符合語意的答案。

運作流程

  1. 使用者輸入查詢,用自然語言問就好。
  2. Embedding 模型把查詢轉換成向量。
  3. 在向量資料庫中搜尋已建好的文件向量。
  4. 計算相似度並排序,常用的度量是餘弦相似度。
  5. 回傳最相關的前幾筆結果。

白話比喻

傳統關鍵字搜尋像對答案,字要對得上才算數。你查「機器學習 入門」,可能只撈到標題剛好含有相同關鍵字的那幾份。

向量搜尋像聽懂你的意思。同樣一句「機器學習入門」,它能找到深度學習初始指南、AI 新手教學、如何進入資料科學領域這些用詞不同但概念相近的內容。

跟關鍵字搜尋差在哪

比較項目Keyword Search 關鍵字搜尋Vector Search 向量搜尋
搜尋方式精準關鍵字匹配語義相似度匹配
理解能力低,只匹配字面高,理解語義
結果準確度可能遺漏相關內容找出更多相關內容
適用場景精確查找特定詞彙語義搜尋、問答、推薦

實際用例

最常見的四個場景是智慧客服、文件檢索、推薦系統、知識庫問答。共同點都是使用者不會用你文件裡的原話發問。

常見的向量資料庫有 Pinecone、Weaviate、Milvus、Qdrant、Chroma、FAISS。它們支援高維向量索引、快速近似搜尋,也支援用中繼資料先過濾再搜。

常見的 Embedding 模型則有 OpenAI 的 text-embedding-3、Google 的 text-embedding,以及開源的 sentence-transformers。

優點與限制

  • 優點,理解語義,超越關鍵字匹配;找出更相關但不同表述的內容;對同義詞與相近概念更敏感;提升搜尋體驗與準確度。
  • 限制,需要先建立向量,有計算成本;效果依賴 Embedding 模型的品質;可能回傳語義相似但不精確的內容;向量維度高,需要較多儲存空間。

所以它適合語義搜尋、問答與推薦,不適合單獨拿來查型號、代碼或法條編號這類要求逐字命中的情境。

常見誤解最常見的誤解是「有了向量搜尋就不需要關鍵字比對」。實際上它可能回傳語義相似但不精確的內容,遇到型號、代碼、專有名詞反而輸給 BM25。實務建議是走混合搜尋,讓兩種方法互補。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

向量搜尋一定比關鍵字搜尋好嗎?
不一定。查特定型號、專有名詞、法條編號這類需要精準命中的情境,關鍵字比對反而更可靠。向量搜尋強在語意,但可能回傳語義相似卻不精確的內容。所以實務上常用混合搜尋,兩邊一起跑再合併排序。
相似度是怎麼算的?
最常用的是餘弦相似度。它比較兩個向量的方向,數值越接近 1 代表語義越相似,0 代表無關,負值代表相反。系統會算完所有候選再取前幾名回傳。
它有什麼成本與限制?
資料要先建立向量,這一步有計算成本;效果依賴 Embedding 模型的品質;向量維度高,需要較多儲存空間。資料更新後也要重新建立向量,否則搜到的是舊內容。