多模態與應用

Text-to-Image 文字生成圖片是什麼?用一段描述換一張圖

Text-to-Image(T2I,文字生成圖片)是輸入一段文字描述,讓 AI 解析當中的主體、場景、細節、風格與光影資訊,再從零生成一張符合描述的圖片。不需要繪畫技巧,人人都能把想像視覺化。
Text-to-Image 文字生成圖片是什麼?用一段描述換一張圖:文章重點卡

Text-to-Image 文字生成圖片是什麼?用一段描述換一張圖

以前要一張圖,你得會畫,或者付錢請人畫。現在你只要把腦中的畫面用文字說清楚,AI 就替你畫出來。

這件事的門檻不在工具,在你會不會描述。這篇講清楚它怎麼運作,以及怎麼寫才會準。

你將學到什麼

定義

輸入文字描述,AI 從零生成一張符合描述的圖片。

白話比喻

文字是魔法,AI 是畫筆,想像力才是真正的限制。

跟誰容易搞混

T2I 從零開始生成,I2I 是拿一張既有的圖去改。

定義

Text-to-Image(T2I,文字生成圖片)是輸入一段文字描述,讓 AI 理解你的想像,自動生成獨一無二的圖片。

常見的工具有 Midjourney、DALL·E、Stable Diffusion、Adobe Firefly、Leonardo.Ai。它們各有擅長,藝術感、可客製化程度、生態整合都不太一樣。

白話比喻

把它想成一位聽描述作畫的插畫師。你講得越具體,他畫得越接近你腦中的畫面。

你只說「畫一隻狗」,他會憑自己的習慣決定品種、姿勢與背景。你說「戴帽子的柴犬坐在草地上微笑,手繪風格」,結果就完全不同了。

它怎麼運作

  1. 輸入文字描述:用文字說出你想要的畫面、風格、細節與氛圍。
  2. AI 理解語意:解析文字中的物件、場景、風格與光線資訊。
  3. 生成圖片:從零開始創作,輸出符合描述的高品質圖片。

第三步背後的技術多半是 擴散模型,它從一團雜訊出發,一步步去噪,最後長成一張圖。

寫出好描述的五個要素

要素要回答的問題範例
主體畫的是什麼?一位女孩
場景在哪裡?在櫻花樹下散步
細節怎麼樣?微風中花瓣飄落
風格什麼風格?日系插畫風格
氛圍與光影什麼情緒感受?柔和的陽光,夢幻的氛圍

五個都寫齊,成功率會明顯提高。這也是 畫像生成提示詞 跟聊天用的提示詞最大的不同:它重描述而不重推理。

實際用例

最常見的是社群貼文與部落格配圖、廣告與行銷素材、簡報視覺、商品與包裝模擬、遊戲與角色設計。

對一般工作者最實用的其實是概念發想。在真的花錢做設計之前,先用 T2I 把幾個方向視覺化,溝通成本會低很多。

常見誤解最常見的誤解是期待一次就到位。實際流程是多嘗試與微調:改描述、換關鍵詞、調光影角度材質,甚至上傳參考圖輔助。另一個誤解是把 T2I 跟 Image-to-Image 搞混,前者從零生成,後者是拿既有的圖去改,要修圖就該用後者。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

為什麼同一段描述每次生成的圖都不一樣?
因為生成過程帶有隨機性,每一次的起始雜訊不同。想要結果穩定,可以固定隨機種子,或用參考圖來約束構圖與風格。
生成的圖可以商用嗎?
要看你使用的平台條款與方案,不同工具規定差很多,有些還會限制訓練資料來源的用途。商用前務必看清楚該平台當下的授權說明,不要靠印象判斷。
描述要寫多細?
越具體越好,但要有結構。主體、場景、細節、風格、氛圍五個面向都寫到,比堆一長串形容詞有效得多。