RAG 與知識庫
Embedding 語意向量是什麼?把文字變成座標的語意地圖
Embedding 語意向量是什麼?把文字變成座標的語意地圖
你搜尋「提神飲料」,系統卻找出「咖啡」跟「茶」,關鍵字明明一個字都沒對上。這件事是怎麼做到的?答案就是 Embedding。
這是建知識庫、做語意搜尋、做推薦系統時都會遇到的底層概念。搞懂它,很多 AI 功能會突然變得有道理。
你將學到什麼
定義
把文字或圖片轉換成一串數字向量,用位置表達語意。
白話比喻
一張語意地圖,咖啡跟拿鐵住得近,跟汽車住得遠。
關鍵原則
距離近代表關聯高,距離遠代表關聯低。
跟誰容易搞混
常跟向量資料庫混淆,一個是轉換方式,一個是存放地方。
定義
Embedding 是把文字、詞語、句子、圖片等內容,轉換成一串數字向量。這串數字會把語意用位置表達出來。
流程很單純:原始輸入丟進 Embedding 模型,輸出一串數字陣列。那串數字人看不懂,但那正是 AI 看得懂的語意。
白話比喻
AI 不是查字典理解文字,而是用語意地圖。例如「咖啡」附近住著拿鐵、提神、星巴克、卡布奇諾,「汽車」則跟輪胎、引擎住在另一區,離咖啡很遠。
把所有概念放到多維空間裡,位置就決定了彼此的關係。這張地圖通常有幾百到上千個維度,不是我們能直接畫出來的三維空間。
四個重點概念
- AI 看不懂文字本身
- AI 只看位置
- 位置越近,越有關係
- 位置越遠,越不相關
AI 拿它來做什麼
| 用途 | 在做什麼 | 例子 |
|---|---|---|
| 語意搜尋 | 不是關鍵字比對,而是找意思像的內容 | 搜尋提神飲料,找到咖啡與茶 |
| 自動分類 | 根據語意把內容分到最合適的類別 | 客服訊息自動歸到問題分類 |
| 相似內容推薦 | 推薦跟你喜歡的東西相似的內容或商品 | 電商推薦、文章推薦 |
| 跨語言理解 | 不同語言但意思相同,在地圖上會靠得很近 | 你好與 Hello 位置相近 |
| 知識關聯與推理 | 從已知概念推導出相關的新知識 | 由 A 到 B、B 到 C 推出 A 到 C |
實際用例
建知識庫時,文件會先切片,每一片轉成向量存進向量資料庫。使用者提問時,問題也轉成向量,系統再去找距離最近的幾片內容當作依據。
這條路徑接下去就是 Citation 引用來源:找到的段落不只拿來回答,還要標出處,答案才可驗證。想再縮小檢索範圍,可以搭配 Metadata Filtering 中繼資料過濾。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
知識變現切割地圖(高清版下載及陪跑型教材)
《知識變現切割地圖》的完整陪跑版:地圖高清檔,加上五章 27 萬字的網頁版講義與200 張練習卡。從語感引流設計、互動與轉化、內容分層與產品路徑,到角色鏡像與心理設計、內容資源切割再利用,一層一層把「會做內容」變成「能賣內容」。每一節後面都接著可以直接動手填的練習卡。
NT$ 19,800

