多模態與應用

Diffusion Model 擴散模型是什麼?AI 畫圖其實是在擦雜訊

Diffusion Model(擴散模型)是一種生成模型,也是 Midjourney、Stable Diffusion 這類繪圖 AI 的核心原理。它訓練時學會如何把真實圖像逐步「加噪」變成隨機雜訊,生成時反過來一步步「去噪」,並在每一步根據文字提示判斷下一步該長什麼樣,最後從雜訊中擦出清晰的圖像。
Diffusion Model 擴散模型是什麼?AI 畫圖其實是在擦雜訊:文章重點卡

Diffusion Model 擴散模型是什麼?AI 畫圖其實是在擦雜訊

AI 生圖看起來像變魔術,其實它不是憑空畫圖,而是從一堆雜訊中一步步找回秩序。

懂了這件事,你就會知道為什麼步數越多品質越好、為什麼提示詞在每一步都有影響。

你將學到什麼

定義

擴散模型是一種生成模型,訓練時學會加噪,生成時反過來一步步去噪還原圖像。

白話比喻

像看沒訊號的電視雜訊,訊號一點一點變好,先看到輪廓,最後畫面完整清晰。

跟誰容易搞混

文字生成圖片是能力名稱,擴散模型是實現這個能力的技術原理,兩個不同層次。

定義

擴散模型(Diffusion Model)是一種生成模型,它學會如何把「隨機雜訊」逐步變成「真實圖像」。訓練時先學會加噪,生成時再學會去噪。

酒Ann 的一句話總結是:AI 不是憑空畫圖,而是從混亂中找回秩序,一步步還原出有意義、符合你想像的畫面。

運作流程

訓練階段叫前向過程。把一張原始圖像逐步加入雜訊,從一點雜訊、更多雜訊、非常多雜訊,一直到幾乎是純雜訊,模型從中學會雜訊是怎麼疊上去的。

生成階段叫反向過程。從純雜訊出發,去掉一些雜訊、再去掉更多,畫面越來越清晰,最後接近成品。

關鍵在於,AI 在每一步都會根據文字提示預測:下一步應該長什麼樣?這就是提示詞真正起作用的地方。

白話比喻

想像一台收不到訊號的電視。一開始滿螢幕雜訊,什麼都看不到;訊號變好一點,開始看到輪廓;再好一點,細節越來越多;最後畫質完美呈現。

也可以想成從模糊的記憶裡一點一點想起細節,直到整個畫面清晰。

跟其他生成模型差在哪

模型類型代表模型生成方式優點缺點
擴散模型Midjourney、Stable Diffusion逐步去噪生成圖像品質高、細節好、穩定性強速度較慢,需要較多步數
GAN 模型StyleGAN、早期繪圖 AI生成器與判別器互相競爭速度快容易不穩定,細節較差
自回歸模型早期像素生成模型一格一格依序生成概念簡單畫面品質較低,不適合高解析圖像

實際用例

它的關鍵技術有四項:U-Net 架構負責圖像的編碼與解碼;時間步嵌入讓 AI 知道現在處於哪一步;文字條件引導根據提示詞引導去噪方向;噪聲排程決定加噪與去噪的強度與分佈。

因為結構開放,它的可擴充性也高,可以搭配 ControlNetLoRA 等外掛強化能力,做到構圖控制與風格特化。

常見誤解最常見的誤解是「AI 把看過的圖拼起來」。擴散模型並不是在檢索或拼貼素材,它做的是從雜訊還原的預測,這也是為什麼它可以創造出超高解析度、現實中不存在的畫面。想接著看能力層面的說明,可以讀 Text-to-Image 文字生成圖片
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

為什麼步數越多,圖越好?
因為每一步只擦掉一部分雜訊並補上細節,步數越多,模型修正的機會越多,細節越豐富。代價是速度越慢,所以工具通常讓你在品質與速度之間選一個平衡點。
擴散模型跟 GAN 差在哪?
GAN 用生成器與判別器互相競爭,速度快但訓練容易不穩定、細節較差。擴散模型逐步去噪生成,品質高、細節好、穩定性強,代價是速度較慢、需要較多步數。
提示詞是在哪一步發揮作用的?
在每一步都有作用。模型在每一次去噪時,都會根據文字提示預測「下一步應該長什麼樣」,這就是文字條件引導。所以提示詞改一個字,整條去噪路徑都會不同。