企業平台

為什麼在 Google Cloud Vertex AI 上用 Claude?請求旅程與生成原理

Vertex AI 是 Google Cloud 的 AI 平台,讓你在自己的 GCP 專案裡呼叫 Claude:到 Model Garden 啟用模型、用 gcloud 憑證授權,就能透過 Anthropic SDK 直接使用。適合系統已在 Google Cloud 上、想沿用既有專案權限與帳務流程的團隊。
為什麼在 Google Cloud Vertex AI 上用 Claude?請求旅程與生成原理:文章重點卡

為什麼在 Google Cloud Vertex AI 上用 Claude?請求旅程與生成原理

公司整套系統都在 Google Cloud 上,想把 Claude 接進來?你不需要另外開帳號管金鑰,Vertex AI 就是為這件事準備的入口:模型在 Model Garden 裡啟用,權限跟著 GCP 專案走,帳單也併在一起。

這一篇是 Vertex AI 系列的第一篇,先不動手寫程式,把兩個地基打穩:一個請求從使用者按下送出到回應出現,完整走過哪五個階段;以及 Claude 拿到你的文字之後,到底怎麼把回答一個字一個字生出來。地基穩了,下一篇設定環境時每一步都會很有感。

你將學到什麼

Vertex AI 是什麼

在 GCP 專案裡呼叫 Claude 的代管入口。

請求的五個階段

從按下送出到回應出現的完整旅程。

為什麼要有伺服器

憑證不能進前端,中介層是必要的。

文字怎麼生成

斷詞、嵌入、語境化、生成四步看懂原理。

Vertex AI 是什麼,為什麼選它

Vertex AI 是 Google Cloud 的 AI 平台,Anthropic 的 Claude 模型就上架在它的 Model Garden 裡。你在自己的 GCP 專案中啟用模型後,就能用 Anthropic 官方 SDK(提供 Python、TypeScript、Go、Ruby 版本)或 Google 官方的 Vertex SDK 呼叫它,本系列的程式範例用的是 Python 版。對企業來說,好處跟「在自家雲上用 AI」的邏輯一致:不用評估新供應商、不用另外管金鑰,權限與帳務都沿用既有的 GCP 專案。

一個請求的五個階段

使用者在你的聊天介面輸入一句話、按下送出,看似瞬間出現的回應,其實走完了五個階段:請求到你的伺服器、伺服器轉發到 Vertex、模型處理、回應回到伺服器、最後送回使用者端。理解每一站在做什麼,之後除錯時你才知道問題該往哪一段查。

使用者端你的伺服器Vertex AIClaude 模型處理送出訊息轉發請求顯示回應回傳結果
請求的完整旅程:五個階段在幾秒內走完,而你的伺服器是掌控全場的中介。

發往 Vertex 的每個請求都要帶四樣東西:識別身分的憑證、要用哪個模型、裝著使用者輸入的 messages 清單,以及限制生成長度的 max tokens。使用者的文字會被包成一則 user 訊息,放進訊息清單送出。

為什麼一定要有自己的伺服器

  • API 請求需要保密憑證,這些憑證絕不能出現在使用者端的程式碼裡。
  • 前端程式碼任何人都看得到,憑證放進去等於直接公開。
  • 你的伺服器是安全的中介:由它驗證使用者、代為呼叫 Vertex、再把結果轉回前端。

這條規則沒有例外。之後不管你做的是聊天機器人、內部工具還是客服系統,架構圖的中間永遠有一台你控管的伺服器。而且中介層帶來的不只是安全:你可以在這一層驗證使用者身分、記錄用量、統一管理不同功能要用哪個模型,這些都是產品上線後遲早要做的事。

Claude 怎麼生成文字:四個階段

請求進到模型之後,Claude 會走四個階段。第一步斷詞(tokenization):把輸入拆成一個個 token,可能是整個單字、半個單字、空格或符號。第二步嵌入(embedding):每個 token 轉換成一長串數字,你可以把它想成「用數字寫成的字義」,涵蓋這個詞所有可能的意思。

第三步語境化(contextualization):一個詞往往有多種意思,例如 quantum 可能指物理、指運算,也可能只是「非常小」。這一步讓每個嵌入依照前後文互相調整,把最合理的那個意思凸顯出來。第四步生成(generation):調整過的嵌入通過輸出層,算出每個候選詞的機率。

Claude 不一定挑機率最高的詞,而是在機率與隨機性之間取捨,讓回應更自然、更有變化。選出一個詞之後,把它接到序列尾端,整個流程再跑一次,直到停止。

理解「一次生成一個 token、每個 token 都重跑一輪」這件事,對你後面的判斷很有幫助:為什麼長回應比較慢、為什麼 token 數直接等於成本、為什麼串流可以讓文字逐塊出現,答案都藏在這個迭代結構裡。

什麼時候停下來

每生成一個 token,Claude 都會檢查該不該繼續:

  • 達到 max tokens:碰到你設定的長度上限。
  • 自然結束:生成了序列結束符號,那是一個看不見的特殊訊號,代表模型認為講完了。
  • 碰到 stop sequence:生成了你預先定義的停止字串。

生成結束後,Vertex 回傳的內容除了訊息文字,還有 usage(輸入與輸出的 token 數)與 stop reason(停止原因)。別忽略這兩個欄位:它們是你監控成本、判斷回應是不是被截斷的依據。

這條路適合誰

系統已經在 Google Cloud 上、想沿用既有專案的權限與帳務、對資料路徑有控管要求的團隊,走 Vertex AI 最順。反過來說,若你沒有雲端平台的包袱、只想最快打出第一個呼叫,直接用 Anthropic API 也完全可以,模型本身沒有差別。

整趟旅程總結成三句話:永遠用伺服器當中介、理解文字生成是一步一步迭代出來的、善用回應裡的中繼資料。下一篇我們動手設定環境,打出第一個請求。

參考出處本文取材自 Anthropic 官方 Claude Academy 免費課程「Claude with Google Cloud's Vertex AI」,由酒Ann 消化後以自己的視角重新編寫。想看英文原版課程,可到 Claude Academy 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

用 Vertex AI 呼叫 Claude,跟直接用 Anthropic API 差在哪?
模型能力相同,差在營運面:Vertex AI 走 GCP 專案的權限與帳單,用 gcloud 憑證授權,不必另外管理 API 金鑰,適合系統已在 Google Cloud 上的團隊。
可以從前端直接呼叫 Vertex AI 嗎?
不行。API 請求需要保密的憑證,放進前端程式碼等於公開給所有人。一律由你控管的伺服器作為中介,代為發出請求。
Claude 什麼時候停止生成?
每生成一個 token 就檢查三個條件:達到 max_tokens 上限、生成了序列結束符號、或碰到你預先定義的 stop sequence,任一成立就停。
回應裡除了文字還有什麼?
還有 usage(輸入與輸出的 token 數)與 stop reason(模型停止的原因)。這些中繼資料是監控用量、理解模型行為的重要依據。