RAG 與知識庫

Embedding 語意向量是什麼?把文字變成座標的語意地圖

Embedding 中文叫語意向量,也常被講成語意地圖。它是把文字、詞語、句子或圖片轉換成一串數字向量,這串數字會把語意用空間中的位置表達出來。位置越近代表語意越相似,位置越遠代表關聯越低。AI 其實看不懂文字本身,它看的是位置,這也是語意搜尋、推薦與 RAG 檢索背後的共同基礎。
Embedding 語意向量是什麼?把文字變成座標的語意地圖:文章重點卡

Embedding 語意向量是什麼?把文字變成座標的語意地圖

你搜尋「提神飲料」,系統卻找出「咖啡」跟「茶」,關鍵字明明一個字都沒對上。這件事是怎麼做到的?答案就是 Embedding。

這是建知識庫、做語意搜尋、做推薦系統時都會遇到的底層概念。搞懂它,很多 AI 功能會突然變得有道理。

你將學到什麼

定義

把文字或圖片轉換成一串數字向量,用位置表達語意。

白話比喻

一張語意地圖,咖啡跟拿鐵住得近,跟汽車住得遠。

關鍵原則

距離近代表關聯高,距離遠代表關聯低。

跟誰容易搞混

常跟向量資料庫混淆,一個是轉換方式,一個是存放地方。

定義

Embedding 是把文字、詞語、句子、圖片等內容,轉換成一串數字向量。這串數字會把語意用位置表達出來。

流程很單純:原始輸入丟進 Embedding 模型,輸出一串數字陣列。那串數字人看不懂,但那正是 AI 看得懂的語意。

白話比喻

AI 不是查字典理解文字,而是用語意地圖。例如「咖啡」附近住著拿鐵、提神、星巴克、卡布奇諾,「汽車」則跟輪胎、引擎住在另一區,離咖啡很遠。

把所有概念放到多維空間裡,位置就決定了彼此的關係。這張地圖通常有幾百到上千個維度,不是我們能直接畫出來的三維空間。

四個重點概念

  • AI 看不懂文字本身
  • AI 只看位置
  • 位置越近,越有關係
  • 位置越遠,越不相關

AI 拿它來做什麼

用途在做什麼例子
語意搜尋不是關鍵字比對,而是找意思像的內容搜尋提神飲料,找到咖啡與茶
自動分類根據語意把內容分到最合適的類別客服訊息自動歸到問題分類
相似內容推薦推薦跟你喜歡的東西相似的內容或商品電商推薦、文章推薦
跨語言理解不同語言但意思相同,在地圖上會靠得很近你好與 Hello 位置相近
知識關聯與推理從已知概念推導出相關的新知識由 A 到 B、B 到 C 推出 A 到 C

實際用例

建知識庫時,文件會先切片,每一片轉成向量存進向量資料庫。使用者提問時,問題也轉成向量,系統再去找距離最近的幾片內容當作依據。

這條路徑接下去就是 Citation 引用來源:找到的段落不只拿來回答,還要標出處,答案才可驗證。想再縮小檢索範圍,可以搭配 Metadata Filtering 中繼資料過濾

常見誤解誤解一,以為 Embedding 是壓縮或加密,其實它是換一種 AI 看得懂的表達方式,還原不回原文。誤解二,以為語意相近就等於事實正確,向量只管意思像不像,不管內容對不對,所以檢索回來的段落仍然要標來源、要人看過。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

為什麼距離可以代表語意?
因為 Embedding 模型在訓練時讀過大量文本,學會了一件事:出現在類似情境裡的詞語,應該被放在空間中的相近位置。咖啡與拿鐵常常一起出現,於是它們的位置就靠在一起,汽車跟輪胎則自成一區。
Embedding 跟向量資料庫是同一件事嗎?
不是。Embedding 是把內容轉成向量的過程與結果,向量資料庫是專門存放這些向量並支援相似度查詢的資料庫。先有 Embedding,才有東西可以存進向量資料庫。
同一份資料換一個 Embedding 模型可以嗎?
不建議混用。不同模型產生的向量維度與座標系統不一樣,等於兩張畫法不同的地圖,硬放在一起比距離會得到亂七八糟的結果。換模型時,整個知識庫要重新建立索引。