科技

什麼是 ControlNet?它如何搭配 Stable Diffusion 模型運作?

·3 分鐘閱讀

漩渦、色彩、藝術

Image by artvizual from Pixabay

ControlNet 是 Stable Diffusion 這個文字轉圖像 AI 模型的強力擴充。它像是一位特別的「引導者」,協助 AI 生成更準確、更細緻的圖像。想像你想幫朋友畫一張肖像,並且希望雙眼的位置能對得剛剛好;ControlNet 就像一張格線或範本,讓你確保眼睛落在正確的位置。

運作方式如下:

  1. 你提供一張「控制圖像」(control image):可以是一張草圖、一張線稿,或甚至是一張照片。這張圖為 ControlNet 提供最終成品該長什麼樣子的藍圖。
  2. Stable Diffusion 參考這張控制圖像:AI 模型會以這張控制圖像作為參考,引導整個生成流程,盡量在最終輸出中還原控制圖像的細節、線條與形狀。
  3. 你會得到更準確的圖像:成品會是一張更準確、更細緻,並且與你提供的控制圖像高度相符的圖像。

舉例來說,假設你想生成一張「一隻貓坐在椅子上」的圖。用一般的 Stable Diffusion 模型,你只要輸入「一隻貓坐在椅子上」,它大概就能生出一張還不錯的圖。但若你搭配 ControlNet,並提供一張簡單的貓與椅子草圖作為控制圖像,就能讓 AI 生成更貼近草圖的畫面,貓的姿勢會落在正確的位置,椅子的樣貌也會更準確。

參考資料

  1. ControlNet – Wikipedia(ControlNet-維基百科)
  2. ControlNet: A Complete Guide(ControlNet:完整指南)

延伸閱讀