多模態與應用

ControlNet 是什麼?用線稿跟骨架鎖住畫面構圖

ControlNet(條件控制生成)是加在擴散模型旁邊的一個控制網路。你除了提示詞之外,再給它一張條件圖,例如邊緣線稿、深度圖或人體姿勢骨架,模型就會照著這個結構生成畫面。它讓構圖與姿勢從碰運氣變成可以指定,是生圖流程中最重要的控制手段之一。
ControlNet 是什麼?用線稿跟骨架鎖住畫面構圖:文章重點卡

ControlNet 是什麼?用線稿跟骨架鎖住畫面構圖

文字生圖最難的一件事,是講清楚人要站在哪、鏡頭要多高、東西要擺哪裡。與其用形容詞猜,不如直接畫給它看。

你將學到什麼

定義

在擴散模型旁加一個控制網路,用條件圖指定畫面的結構。

白話比喻

像先打好鉛筆稿再上色:骨架你決定,顏色與細節交給模型。

跟誰容易搞混

以圖生圖是拿整張原圖改寫,ControlNet 只取結構,內容可以完全換。

定義

ControlNet 是加在擴散模型旁邊的條件控制網路。除了提示詞之外,你再給它一張條件圖,模型就會照著這張圖的結構來生成。

這樣一來,構圖、姿勢與空間關係從碰運氣變成可以指定,而畫面的風格、材質與細節仍然交給模型發揮。

白話比喻

它像先打鉛筆稿再上色。鉛筆稿決定人站在哪、手往哪擺、鏡頭多高,上色的人不會去動這些。

換句話說,你負責骨架,模型負責血肉。這是把生圖從抽獎變成可控流程的關鍵一步。

跟其他生圖控制方式的差別

方式你給的東西它保留什麼
Text-to-Image 文生圖只有提示詞什麼都不保留,每次重擲
Image-to-Image 以圖生圖整張原圖加提示詞原圖的整體樣貌與構圖
ControlNet 條件控制條件圖加提示詞只保留結構,內容可完全更換

實際用例

常見的條件類型有幾種。邊緣與線稿用來鎖住輪廓,適合產品、建築與插畫;深度圖用來鎖住前後層次,適合場景與空間。

人體姿勢骨架則是最常被用到的一種,可以指定人物的動作與鏡頭角度,讓同一個姿勢換上不同服裝、不同場景。

實務上很適合做一致性產出:品牌形象照要求每一張的取景一致,或是一整套教材插圖要維持相同的視角與比例,都靠這一招。

常見誤解最常見的誤解是把它當成畫質增強工具。它控制的是結構,不是細節品質。另一個誤區是條件圖給得太滿,線稿把每一筆都畫死,模型就沒有發揮空間,出來的圖會顯得僵硬。條件給到夠鎖住你在意的那件事就好。
本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

ControlNet 跟 Image-to-Image 差在哪?
以圖生圖是拿整張原圖當起點去改寫,畫面內容會被原圖影響;ControlNet 只抽取結構條件,例如線稿或姿勢,畫面內容可以完全換掉,構圖仍然照你指定的來。
常見的條件類型有哪些?
邊緣偵測與線稿用來鎖輪廓,深度圖用來鎖空間層次,人體姿勢骨架用來鎖動作,塗鴉則適合把粗略草稿變成完整畫面。
一定要會畫圖才能用嗎?
不用。條件圖通常可以從既有照片自動抽取,例如從一張參考照抽出姿勢骨架或邊緣線,再拿去控制新的生成。