跳至主要內容
首頁/部落格/Qwen-Image-2.1 安裝教學:ComfyUI 與 diffusers 兩條路線,從下載到第一張圖
Qwen開源模型AI圖像生成ComfyUI安裝教學

Qwen-Image-2.1 安裝教學:ComfyUI 與 diffusers 兩條路線,從下載到第一張圖

·16 分鐘閱讀
Qwen-Image-2.1 安裝教學:ComfyUI 與 diffusers 兩條路線,從下載到第一張圖
發布:
16 分鐘閱讀

Qwen-Image-2.1 的安裝有兩條路線:不寫程式的人走 ComfyUI,工程團隊走 diffusers。 兩條都能在同一台機器上完成,差別在你要的是操作介面還是可以接進系統的 API

在開始之前先確認一件事:這個版本的權重採研究授權,只能用於研究與評估,商用需另外取得授權。授權與能力的完整說明見 Qwen-Image-2.1 是什麼?企業商用前要先看懂授權。以下流程請以「技術評估」的前提進行。

先確認硬體:你的顯示卡跑得動嗎

官方沒有公布最低需求,目前可參考的是社群回報:

環境回報結果建議做法
RTX 4090(24GB)1MP 圖約 5 秒直接用原生權重
約 15.6 GB VRAM某一設定下可運行原生權重,關閉其他佔用
12~16GB VRAM原生權重容易爆記憶體改用 GGUF 量化 + text encoder 卸載
筆電 CPU每張約 3 分鐘僅適合確認流程,不適合量產

判斷原則很簡單:24GB 以上走原生權重,24GB 以下先走 GGUF 量化。 自架的完整成本(顯示卡折舊、電費、維運工時)算法見 AI 導入成本怎麼算

路線 A:ComfyUI 安裝(不需要寫程式)

步驟 1:更新 ComfyUI 到支援版本

Qwen-Image-2.1 需要有原生支援的 ComfyUI 版本。如果你已經裝過舊版,先透過 ComfyUI Manager 或 git pull 更新到最新,再重新啟動,否則載入範本時會找不到對應節點。

步驟 2:下載三類模型檔案

從 Hugging Face 的 Comfy-Org/Qwen-Image-2.1 下載,整個倉庫約 74.3 GB,但你只需要三個檔案:

類型檔名(擇一)放置資料夾
Diffusion modelqwen_image_2.1_bf16.safetensors(品質優先)或 qwen_image_2.1_int8_convrot.safetensors(省記憶體)ComfyUI/models/diffusion_models/
Text encoderqwen3vl_8b_bf16.safetensorsqwen3vl_8b_int8_convrot.safetensorsqwen3vl_8b_w4a8.safetensorsComfyUI/models/text_encoders/
VAEqwen_image_2.1_vae_bf16.safetensorsComfyUI/models/vae/

倉庫中另有 qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensorspe_i2i 版本,分別對應文生圖與圖生圖的提示詞增強;第一次安裝可以先略過,確認基本流程能跑再加。

步驟 3:載入官方範本

重新啟動 ComfyUI 後,從選單的工作流範本瀏覽器找到 Qwen-Image-2.1 的文生圖與圖像編輯範本並載入。範本會自動接好節點,你只需要在三個 loader 節點分別選到剛才下載的檔案。

步驟 4:跑第一張圖驗證

不要一開始就設 2K 與 40 步。 先用較小解析度、較少步數(例如 20 步)跑一張,確認整條流程沒有紅色錯誤節點,再調回官方預設的 40 步與 2K 解析度。這一步能把「檔案放錯資料夾」和「記憶體不足」兩類問題分開。

步驟 5:VRAM 不足時改用 GGUF 量化

如果出現記憶體不足,改走量化路線:

  1. 透過 ComfyUI Manager 安裝 ComfyUI-GGUF 自訂節點,或手動 clone 到 custom_nodes/
  2. 下載社群發布的 Qwen-Image-2.1 GGUF 權重,放進 ComfyUI/models/unet/。量化等級由小到大為 Q2_K、Q3_K_M、Q4_K_M、Q5_K_M、Q6_K、Q8_0,Q4_K_M 是體積與品質的平衡點
  3. 把範本中的 diffusion model 載入節點換成 GGUF 專用的 Unet Loader (GGUF),選擇下載的 .gguf 檔。
  4. 讓 text encoder 留在系統記憶體、只把量化後的 diffusion model 放 VRAM,依社群實測可省下約 9~17 GB VRAM,對速度影響很小。
  5. 仍然不足時,加上 --lowvram 啟動參數。

社群 GGUF 權重由第三方轉檔,品質與安全性請自行確認來源;原始權重的授權條件同樣適用於量化版本。

來源:Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱;Comfy-Org/Qwen-Image-2.1,Hugging Face,2026-09-22 查閱;How to Use Qwen-Image 2.1 GGUF in ComfyUI,Kombitz,2026-09-20。

路線 B:diffusers 安裝(要接進系統的團隊)

步驟 1:安裝套件

官方 README 列出的相依版本如下,建議在乾淨的虛擬環境執行:

pip install "torch>=2.4.0"
pip install "transformers>=5.17"
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow

diffusers 需要裝 git 版本,因為 QwenImage21Pipeline 尚未進入正式釋出版。

步驟 2:文生圖跑通第一張

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt='A neon shop sign that reads "QWEN IMAGE 2.1", rainy night, reflections on wet pavement',
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

image.save("t2i_example.png")

記憶體不足時,把 .to("cuda") 換成 pipe.enable_model_cpu_offload(),讓模型分段搬進 VRAM。

步驟 3:圖像編輯與透明圖

編輯只要多傳一個 image 參數,同一個 pipeline 就能做:

from PIL import Image

image = pipe(
    prompt="Change the background to a sunset beach",
    image=Image.open("input.png"),
    num_inference_steps=40,
    generator=torch.Generator("cuda").manual_seed(42),
).images[0]

透明圖(RGBA)靠提示詞格式觸發,官方建議的寫法是前後各加一句:

prompt = (
    "This is an RGBA image with transparency. "
    "A cute cartoon dragon sticker. "
    "The image has alpha channel and the background is transparent."
)

這是這個版本對電商最有價值的能力:商品去背不用再接第二個工具。

步驟 4:設定輸出比例

官方支援的原生 2K 比例如下,直接把對應的寬高傳進 pipeline:

aspect_ratios = {
    "1:1":  (2048, 2048),
    "4:3":  (2400, 1792),
    "3:4":  (1792, 2400),
    "3:2":  (2528, 1696),
    "2:3":  (1696, 2528),
    "16:9": (2752, 1536),
    "9:16": (1536, 2752),
}

選用:用 vLLM 做成服務端點

如果要讓多個內部工具共用同一張卡,可以起一個服務:

vllm serve Qwen/Qwen-Image-2.1 --omni --port 8091

多卡環境可加上 --step-execution --max-num-seqs 8。要對外開放時,權限邊界與呼叫紀錄必須先設好,作法見 AI Agent 的權限邊界怎麼設

來源:Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱;Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱。

常見錯誤排查

症狀常見原因處理方式
CUDA out of memory原生權重超過顯示卡容量enable_model_cpu_offload()、ComfyUI 加 --lowvram、換 GGUF Q4_K_M
ImportError: QwenImage21Pipelinediffusers 裝到正式釋出版改裝 git+https://github.com/huggingface/diffusers
ComfyUI 節點顯示紅色ComfyUI 版本過舊或檔案放錯資料夾更新 ComfyUI、確認三類檔案分別在 diffusion_models/text_encoders/vae/
透明圖仍有白底提示詞沒用官方 RGBA 格式補上「This is an RGBA image…」前後句,並確認存檔為 PNG
出圖速度極慢跑在 CPU 上確認 torch.cuda.is_available() 為 True,並檢查驅動與 CUDA 版本

裝完之後:先做這三件事再決定要不要留下

  1. 固定 seed 做對照:用同一組 seed 與提示詞跑現有工具與 Qwen-Image-2.1,比較可直接交付的比例,而不是比較單張最佳結果。
  2. 測你自己的素材:商品去背的邊緣、人物一致性、中文字排版,這三項最能決定它能不能進你的工作流。
  3. 記錄授權判斷:把「本次使用屬研究或評估用途」寫進內部文件;若之後要轉商用,需另行向 Qwen 取得授權。選型與供應商風險的判斷框架見 AI 供應商選型的法律與延續性風險

需要立刻產出商用素材的團隊,現階段仍建議使用有明確商用條款的付費服務,比較請見 ChatGPT Images 2.0 中小企業導入指南

來源與更新提醒

模型檔名、相依套件版本與 ComfyUI 範本可能隨版本更新而變動;社群回報的硬體數字會因環境差異很大。本文為依官方文件與公開資料整理的操作流程,不構成法律意見,商用授權範圍請以 Qwen 官方條款為準。


相關推薦與延伸閱讀

常見問題

分享這篇文章:
FacebookLINE

準備好讓 AI 幫你工作了嗎?

現在開始你的數位轉型,預約 30 分鐘諮詢,我們協助你找到最合適的 AI 切入點。

30 分鐘深度了解你的業務,給你具體建議

Content Standards

內容維護與資料來源

內容維護與更正

內容維護窗口:優創智能 YOTRON 內容團隊。個別文章的作者、發布與內容更新日期以該頁標示為準。

網站版本更新:

資料來源與方法

文章中的外部資料、工具規格與比較基準以文內連結及標示日期為準;觀點、測試方法與實作建議由優創智能內容團隊整理。

聯絡與內容更正(Contact)

需要查核、補充或更正內容,可透過聯絡頁,或寄信至[email protected]。公司與團隊資訊可見關於我們

聯絡方式:電話02-2720-8130、Email [email protected]