Google Cloud 基礎

生成式 AI 到底是什麼?Google Cloud 入門課用一張同心圓講清楚

生成式 AI 是深度學習的一個子集,能根據從既有內容學到的統計模式產生全新的文字、圖像、音訊或影片。判斷方法很簡單:模型輸出若是數字、類別或機率,就不是生成式 AI;輸出若是自然語言、圖像或音訊,就是。它的基石是預先訓練好、可再微調到各種下游任務的基礎模型(foundation model)。
生成式 AI 到底是什麼?Google Cloud 入門課用一張同心圓講清楚:文章重點卡

生成式 AI 到底是什麼?Google Cloud 入門課用一張同心圓講清楚

「生成式 AI」這個詞天天聽,但如果有人要你用一句話說清楚它跟 AI、機器學習、深度學習的關係,你答得出來嗎?我修 Google Cloud 的 Introduction to Generative AI 這門短課時,最大的收穫就是把這幾個常被混用的詞,排成了一張清楚的層次圖。

這門課是 Google Cloud 生成式 AI 學習路徑的第一站,由開發者關係工程師授課,節奏輕快、比喻很多。這篇文章把課程的骨架整理出來:名詞的層次、兩種模型的分野、判斷生成式 AI 的口訣,以及基礎模型與工具生態。

你將學到什麼

四層同心圓

AI、機器學習、深度學習、生成式 AI 的層次關係。

兩種模型

判別式負責分類預測,生成式負責產生新內容。

一句話判斷法

看輸出是數字類別,還是文字圖像音訊。

基礎模型

預訓練加微調的通用底座,與五種文字模型類型。

四層同心圓:從 AI 到生成式 AI

課程開場先把名詞的層次排好。AI 是一門學科,就像物理是科學的一門學科:它是資訊科學的分支,研究如何打造能推理、學習、自主行動的智慧系統。

機器學習是 AI 的子領域:用輸入資料訓練出模型,讓模型能對沒見過的新資料做出有用的預測,也就是讓電腦不必被逐條寫死規則就能學習。

人工智慧機器學習深度學習生成式 AI
生成式 AI 在整個 AI 版圖中的位置:深度學習的子集。

深度學習是機器學習的一種,用受人腦啟發的人工神經網路,多層神經元讓它能處理比傳統機器學習更複雜的模式,而且有標籤與無標籤的資料都能吃(小量標籤加大量無標籤一起用,就叫半監督式學習)。生成式 AI 則是深度學習的子集,大型語言模型(LLM)也是。

四個詞,一層包一層。

監督式與非監督式:有沒有標籤

機器學習模型最常見的兩類是監督式與非監督式,關鍵差別只有一個:資料有沒有標籤

課程的例子很生活化:你開一家披薩店,手上有歷史帳單金額與小費的資料,還標了外送或自取,監督式模型就能從過去的例子學會預測未來的小費;而拿員工的年資與收入做分群、看誰在快速升遷軌道上,事先沒有答案標籤,靠資料自然聚成群,就是非監督式的「探索」。

監督式的訓練過程本質上是最佳化:模型不斷縮小預測值與實際值之間的誤差。

判別式與生成式:分類 vs 創造

深度學習模型又可以分成兩型。判別式模型學的是輸入與標籤之間的關係,用來分類或預測:給它一張照片,它告訴你「這是狗、不是貓」。生成式模型學的是資料本身的機率分布,能生成與訓練資料相似的新實例:它不只認得狗,還能畫出一隻新的狗

一句話判斷法課程給了一個好記的口訣:輸出是數字、類別或機率(預測銷售額、垃圾郵件與否),就不是生成式 AI;輸出是自然語言、圖像或音訊,就是生成式 AI。

生成式語言模型的本質是模式比對系統:從海量文字中學會語言的模式,然後預測接下來最可能出現什麼。「我在做三明治,塗了花生醬和……」它會接「果醬」,因為訓練資料裡這個組合出現得最多。

讓這件事在 2018 年產生革命性突破的架構是 Transformer:高層次來看由編碼器與解碼器組成,編碼器處理輸入序列,解碼器學著把它解成任務需要的輸出。

基礎模型與五種文字模型

這一波生成式 AI 的基石是基礎模型(foundation model):在極大量資料上預先訓練好的大型模型,設計成可再微調到情感分析、圖片描述、物件辨識等各種下游任務。同一個底座,換個微調就是另一個專用工具。以文字為輸入的模型,課程分成五類:

類型做什麼
Text-to-Text文字進、文字出,例如翻譯與問答
Text-to-Image用大量附文字說明的圖片訓練,代表方法是擴散模型(diffusion)
Text-to-Video / 3D從一句話到整份腳本,生成對應的影片或 3D 物件
Text-to-Task根據文字執行動作:搜尋、預測、操作介面、改文件

程式碼也是生成式 AI 的主場:除錯、逐行解釋程式、寫 SQL 查詢、跨語言轉換、生成文件與教學,課程用「把 Pandas DataFrame 轉成 JSON」示範了一遍完整流程。

在 Google Cloud 上動手:三個工具

  • Vertex AI Studio:快速探索與客製生成式 AI 模型,附預訓練模型庫、微調工具、部署工具與開發者社群。
  • Vertex AI Agent Builder:不太會寫程式也能建自己的聊天機器人、數位助理、客製搜尋引擎與知識庫。
  • Gemini:多模態模型,文字、圖像、音訊、程式碼都能理解。Model Garden 則持續收錄新模型供選用。

我修完的感想是:這門課最值錢的不是任何單一知識點,而是那張同心圓。名詞的位置排對了,之後讀任何 AI 新聞、評估任何工具,你都知道它落在圖上的哪一層、該用哪一層的標準去要求它。

本文源起本文取材自 Coursera 上的「Introduction to Generative AI」課程(Google Cloud),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

生成式 AI 的正式定義是什麼?
根據課程:生成式 AI 是一種根據從既有內容學到的東西來創造新內容的人工智慧。從既有內容學習的過程叫訓練,產物是一個統計模型;收到提示時,模型用它預測合理的回應,藉此生成新內容。
怎麼快速判斷一個模型是不是生成式 AI?
看輸出。輸出是數字(例如預測銷售額)、類別(垃圾郵件與否)或機率,就不是生成式 AI;輸出是自然語言、圖像、音訊或影片,就是生成式 AI。
什麼是基礎模型(foundation model)?
在海量資料上預先訓練好的大型 AI 模型,設計成可以再微調(fine-tune)去適應各種下游任務,例如情感分析、圖片描述、物件辨識。Vertex AI 的 Model Garden 就收錄了語言與視覺等各類基礎模型。
為什麼模型會產生幻覺?
課程列出四個常見原因:訓練資料不夠多、訓練資料有雜訊或髒污、提示給的脈絡不足、提示給的限制條件不足。幻覺會讓輸出難以理解,甚至產生錯誤或誤導的資訊,所以輸出必須查核。