watsonx AI
開放式湖倉架構:watsonx.data 與 Apache Iceberg
開放式湖倉架構:watsonx.data 與 Apache Iceberg
資料架構師大概都聽過這句老話:資料倉儲貴但好治理,資料湖便宜但一團亂。這句話講了十幾年,講到後來變成一種宿命論,好像魚與熊掌真的不能兼得。
watsonx.data 想解的正是這件事,而它給的答案不是發明新東西,是把整套架構建在開放標準之上,讓「資料留在原地」跟「資料被好好治理」不再互斥。
你將學到什麼
三層拆開,才是湖倉
運算、中介資料、儲存各自獨立,不同查詢引擎才能共用同一份資料而不必複製。
Iceberg 給的是交易保證
開放表格式讓多個引擎同時讀寫同一份資料,還能保住交易一致性與結構演進。
資料虛擬化省的不是效能,是搬遷成本
資料留在原本的雲端或地端環境,用統一的元資料層查詢,不必先搬家才能分析。
2026 年在補的是互通性
跨 Databricks、Snowflake 這類平台的零複製存取,是今年更新的重點方向。
資料湖倉這個詞常被簡化成資料湖加資料倉儲,但真正的重點不是把兩者黏在一起,是把運算、中介資料與儲存三層拆開來獨立設計。
先搞懂拆開三層在解決什麼
傳統資料倉儲把運算與儲存綁在一起,擴充運算就得跟著擴充儲存,成本很難只針對真正需要的部分調整。
watsonx.data 把儲存交給物件儲存負責,把中介資料獨立成一層目錄服務,運算則開放給多種查詢引擎接上來,三者各自可以獨立擴充。
這個拆分帶來一個實際好處:同一份資料可以同時被不同引擎讀取,不需要為了讓另一個團隊分析,就複製一份出去。
Apache Iceberg 補的是交易一致性
物件儲存本身沒有交易語意,多個工作同時寫入很容易互相踩到。Iceberg 這類開放表格式,在物件儲存之上補上原子提交與結構演進能力。
2026 年的更新持續強化這一層:單一交易內完成的原子提交,讓資料一致性更有保障;同一個儲存空間現在也能對應多個 Iceberg 目錄,各自用不同路徑區隔。
- 結構演進:欄位可以新增或調整,不需要重寫整份歷史資料。
- 時間旅行查詢:可以查詢資料在某個時間點的樣子,方便除錯與稽核。
- 分割設計:支援依欄位值、時間區間等方式分割資料,減少每次查詢要掃描的範圍。
把既有的 Delta Lake 資料轉換到 Iceberg 時,官方的作法是盡量保留原始資料檔案、資料表屬性與分割設計,而不是整批重新寫入。這代表格式轉換可以是漸進的工程任務,不必當成一次要賭上停機時間的大遷移。
資料虛擬化:資料不搬,治理規則搬
資料虛擬化的核心想法是反過來的:與其把資料搬到治理工具能管的地方,不如讓治理規則跟著查詢一起跑到資料原本所在的地方。
2026 年的更新把這個概念延伸到跨平台查詢:可以直接查詢 Databricks Unity Catalog、Snowflake、Salesforce 裡的資料,而不必先複製一份,同時仍維持單一版本的真實資料來源。
| 作法 | 資料搬去哪裡 | 適合情境 |
|---|---|---|
| 全面遷移進湖倉 | 資料實際搬進 Iceberg 管理的物件儲存 | 跨部門高頻查詢、要長期保留與稽核的核心資料 |
| 資料虛擬化 / 零複製查詢 | 資料留在原地,只跨平台查詢中介資料 | 資料仍在其他雲端服務、且更新頻繁的來源系統 |
對資料治理成本的實際幫助
治理成本真正的痛點很少是工具貴,是同一套存取權限與資料分類規則,要在每個系統裡重寫一次。
2026 年更新加入了以 Ranger 政策套用到目錄的能力,代表存取控制可以在中介資料層統一定義,不必為每個查詢引擎各自設一套規則。
帳戶層級的中介資料共用,也讓同一個地區內的多個實例可以共用結構定義,減少團隊各自維護一份重複目錄的狀況。這類設計省下的是治理規則被重複維護的隱性成本,而不是一次性的授權費用。
順帶留意:AI 應用正在把湖倉當成資料層
watsonx.data 也整合了向量資料庫能力,讓向量可以跟結構化資料放在同一套治理框架下管理,這對要做檢索增強生成應用的團隊是個實際的簡化。
2026 年的更新也開始支援透過標準協定,讓 AI 代理人以受控方式存取湖倉裡的資料,這代表資料架構師接下來要面對的存取對象,不會只有人類分析師與報表工具。
資料架構師的盤點清單
- 現有資料分散在幾種雲端與地端環境?各自用哪種表格式或根本沒有表格式?
- 哪些資料是跨部門高頻查詢的核心資料,值得投入遷移到 Iceberg 管理的湖倉?
- 哪些資料留在原本的來源系統、用零複製查詢就夠,不必急著搬?
- 存取控制與資料分類規則,現在是不是在每個系統裡各寫一份?能不能收斂到中介資料層統一管理?
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
HE301|Harness Engineering Architecture(12 小時)
兩天十二小時的架構課,處理的是「第一百次仍然成功」。從能力設計出發,逐層拆解知識、脈絡、記憶、規則、工具、工作流、評估與多代理八種架構,每一種都給治理方式與真實案例。12 章 114 課圖文講義、52 張對照表,附兩天的學員講義與投影片 PDF。課程於 2026 年 8 月 30 日實體開課,完整錄影將於課後上傳。
NT$ 12,999

