企業平台
為什麼在 Google Cloud Vertex AI 上用 Claude?請求旅程與生成原理
為什麼在 Google Cloud Vertex AI 上用 Claude?請求旅程與生成原理
公司整套系統都在 Google Cloud 上,想把 Claude 接進來?你不需要另外開帳號管金鑰,Vertex AI 就是為這件事準備的入口:模型在 Model Garden 裡啟用,權限跟著 GCP 專案走,帳單也併在一起。
這一篇是 Vertex AI 系列的第一篇,先不動手寫程式,把兩個地基打穩:一個請求從使用者按下送出到回應出現,完整走過哪五個階段;以及 Claude 拿到你的文字之後,到底怎麼把回答一個字一個字生出來。地基穩了,下一篇設定環境時每一步都會很有感。
你將學到什麼
Vertex AI 是什麼
在 GCP 專案裡呼叫 Claude 的代管入口。
請求的五個階段
從按下送出到回應出現的完整旅程。
為什麼要有伺服器
憑證不能進前端,中介層是必要的。
文字怎麼生成
斷詞、嵌入、語境化、生成四步看懂原理。
Vertex AI 是什麼,為什麼選它
Vertex AI 是 Google Cloud 的 AI 平台,Anthropic 的 Claude 模型就上架在它的 Model Garden 裡。你在自己的 GCP 專案中啟用模型後,就能用 Anthropic 官方 SDK(提供 Python、TypeScript、Go、Ruby 版本)或 Google 官方的 Vertex SDK 呼叫它,本系列的程式範例用的是 Python 版。對企業來說,好處跟「在自家雲上用 AI」的邏輯一致:不用評估新供應商、不用另外管金鑰,權限與帳務都沿用既有的 GCP 專案。
一個請求的五個階段
使用者在你的聊天介面輸入一句話、按下送出,看似瞬間出現的回應,其實走完了五個階段:請求到你的伺服器、伺服器轉發到 Vertex、模型處理、回應回到伺服器、最後送回使用者端。理解每一站在做什麼,之後除錯時你才知道問題該往哪一段查。
發往 Vertex 的每個請求都要帶四樣東西:識別身分的憑證、要用哪個模型、裝著使用者輸入的 messages 清單,以及限制生成長度的 max tokens。使用者的文字會被包成一則 user 訊息,放進訊息清單送出。
為什麼一定要有自己的伺服器
- API 請求需要保密憑證,這些憑證絕不能出現在使用者端的程式碼裡。
- 前端程式碼任何人都看得到,憑證放進去等於直接公開。
- 你的伺服器是安全的中介:由它驗證使用者、代為呼叫 Vertex、再把結果轉回前端。
這條規則沒有例外。之後不管你做的是聊天機器人、內部工具還是客服系統,架構圖的中間永遠有一台你控管的伺服器。而且中介層帶來的不只是安全:你可以在這一層驗證使用者身分、記錄用量、統一管理不同功能要用哪個模型,這些都是產品上線後遲早要做的事。
Claude 怎麼生成文字:四個階段
請求進到模型之後,Claude 會走四個階段。第一步斷詞(tokenization):把輸入拆成一個個 token,可能是整個單字、半個單字、空格或符號。第二步嵌入(embedding):每個 token 轉換成一長串數字,你可以把它想成「用數字寫成的字義」,涵蓋這個詞所有可能的意思。
第三步語境化(contextualization):一個詞往往有多種意思,例如 quantum 可能指物理、指運算,也可能只是「非常小」。這一步讓每個嵌入依照前後文互相調整,把最合理的那個意思凸顯出來。第四步生成(generation):調整過的嵌入通過輸出層,算出每個候選詞的機率。
Claude 不一定挑機率最高的詞,而是在機率與隨機性之間取捨,讓回應更自然、更有變化。選出一個詞之後,把它接到序列尾端,整個流程再跑一次,直到停止。
理解「一次生成一個 token、每個 token 都重跑一輪」這件事,對你後面的判斷很有幫助:為什麼長回應比較慢、為什麼 token 數直接等於成本、為什麼串流可以讓文字逐塊出現,答案都藏在這個迭代結構裡。
什麼時候停下來
每生成一個 token,Claude 都會檢查該不該繼續:
- 達到 max tokens:碰到你設定的長度上限。
- 自然結束:生成了序列結束符號,那是一個看不見的特殊訊號,代表模型認為講完了。
- 碰到 stop sequence:生成了你預先定義的停止字串。
生成結束後,Vertex 回傳的內容除了訊息文字,還有 usage(輸入與輸出的 token 數)與 stop reason(停止原因)。別忽略這兩個欄位:它們是你監控成本、判斷回應是不是被截斷的依據。
這條路適合誰
系統已經在 Google Cloud 上、想沿用既有專案的權限與帳務、對資料路徑有控管要求的團隊,走 Vertex AI 最順。反過來說,若你沒有雲端平台的包袱、只想最快打出第一個呼叫,直接用 Anthropic API 也完全可以,模型本身沒有差別。
整趟旅程總結成三句話:永遠用伺服器當中介、理解文字生成是一步一步迭代出來的、善用回應裡的中繼資料。下一篇我們動手設定環境,打出第一個請求。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
HE101|Harness Engineering Foundation(3 小時)
三小時的地圖課,不是操作課。把 Model 與 AI System 分開,拆解一套 AI Harness 的八個組成(Goal、Context、Knowledge、Rules、Tools、Workflow、Evaluation、Iteration),再帶你逆向拆解四個你已經在用的系統,最後畫出自己的第一張 Harness Blueprint。5 章 27 課,附學員講義 PDF 與術語速查表。
NT$ 2,599

