Qwen-Image-2.1 的安裝有兩條路線:不寫程式的人走 ComfyUI,工程團隊走 diffusers。 兩條都能在同一台機器上完成,差別在你要的是操作介面還是可以接進系統的 API。
在開始之前先確認一件事:這個版本的權重採研究授權,只能用於研究與評估,商用需另外取得授權。授權與能力的完整說明見 Qwen-Image-2.1 是什麼?企業商用前要先看懂授權。以下流程請以「技術評估」的前提進行。
先確認硬體:你的顯示卡跑得動嗎
官方沒有公布最低需求,目前可參考的是社群回報:
| 環境 | 回報結果 | 建議做法 |
|---|---|---|
| RTX 4090(24GB) | 1MP 圖約 5 秒 | 直接用原生權重 |
| 約 15.6 GB VRAM | 某一設定下可運行 | 原生權重,關閉其他佔用 |
| 12~16GB VRAM | 原生權重容易爆記憶體 | 改用 GGUF 量化 + text encoder 卸載 |
| 筆電 CPU | 每張約 3 分鐘 | 僅適合確認流程,不適合量產 |
判斷原則很簡單:24GB 以上走原生權重,24GB 以下先走 GGUF 量化。 自架的完整成本(顯示卡折舊、電費、維運工時)算法見 AI 導入成本怎麼算。
路線 A:ComfyUI 安裝(不需要寫程式)
步驟 1:更新 ComfyUI 到支援版本
Qwen-Image-2.1 需要有原生支援的 ComfyUI 版本。如果你已經裝過舊版,先透過 ComfyUI Manager 或 git pull 更新到最新,再重新啟動,否則載入範本時會找不到對應節點。
步驟 2:下載三類模型檔案
從 Hugging Face 的 Comfy-Org/Qwen-Image-2.1 下載,整個倉庫約 74.3 GB,但你只需要三個檔案:
| 類型 | 檔名(擇一) | 放置資料夾 |
|---|---|---|
| Diffusion model | qwen_image_2.1_bf16.safetensors(品質優先)或 qwen_image_2.1_int8_convrot.safetensors(省記憶體) | ComfyUI/models/diffusion_models/ |
| Text encoder | qwen3vl_8b_bf16.safetensors、qwen3vl_8b_int8_convrot.safetensors 或 qwen3vl_8b_w4a8.safetensors | ComfyUI/models/text_encoders/ |
| VAE | qwen_image_2.1_vae_bf16.safetensors | ComfyUI/models/vae/ |
倉庫中另有 qwen3.5_9b_qwen_image_2.1_pe_t2i.int8_convrot.safetensors 與 pe_i2i 版本,分別對應文生圖與圖生圖的提示詞增強;第一次安裝可以先略過,確認基本流程能跑再加。
步驟 3:載入官方範本
重新啟動 ComfyUI 後,從選單的工作流範本瀏覽器找到 Qwen-Image-2.1 的文生圖與圖像編輯範本並載入。範本會自動接好節點,你只需要在三個 loader 節點分別選到剛才下載的檔案。
步驟 4:跑第一張圖驗證
不要一開始就設 2K 與 40 步。 先用較小解析度、較少步數(例如 20 步)跑一張,確認整條流程沒有紅色錯誤節點,再調回官方預設的 40 步與 2K 解析度。這一步能把「檔案放錯資料夾」和「記憶體不足」兩類問題分開。
步驟 5:VRAM 不足時改用 GGUF 量化
如果出現記憶體不足,改走量化路線:
- 透過 ComfyUI Manager 安裝 ComfyUI-GGUF 自訂節點,或手動 clone 到
custom_nodes/。 - 下載社群發布的 Qwen-Image-2.1 GGUF 權重,放進
ComfyUI/models/unet/。量化等級由小到大為 Q2_K、Q3_K_M、Q4_K_M、Q5_K_M、Q6_K、Q8_0,Q4_K_M 是體積與品質的平衡點。 - 把範本中的 diffusion model 載入節點換成 GGUF 專用的 Unet Loader (GGUF),選擇下載的
.gguf檔。 - 讓 text encoder 留在系統記憶體、只把量化後的 diffusion model 放 VRAM,依社群實測可省下約 9~17 GB VRAM,對速度影響很小。
- 仍然不足時,加上
--lowvram啟動參數。
社群 GGUF 權重由第三方轉檔,品質與安全性請自行確認來源;原始權重的授權條件同樣適用於量化版本。
來源:Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱;Comfy-Org/Qwen-Image-2.1,Hugging Face,2026-09-22 查閱;How to Use Qwen-Image 2.1 GGUF in ComfyUI,Kombitz,2026-09-20。
路線 B:diffusers 安裝(要接進系統的團隊)
步驟 1:安裝套件
官方 README 列出的相依版本如下,建議在乾淨的虛擬環境執行:
pip install "torch>=2.4.0"
pip install "transformers>=5.17"
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow
diffusers 需要裝 git 版本,因為 QwenImage21Pipeline 尚未進入正式釋出版。
步驟 2:文生圖跑通第一張
import torch
from diffusers import QwenImage21Pipeline
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
image = pipe(
prompt='A neon shop sign that reads "QWEN IMAGE 2.1", rainy night, reflections on wet pavement',
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
image.save("t2i_example.png")
記憶體不足時,把 .to("cuda") 換成 pipe.enable_model_cpu_offload(),讓模型分段搬進 VRAM。
步驟 3:圖像編輯與透明圖
編輯只要多傳一個 image 參數,同一個 pipeline 就能做:
from PIL import Image
image = pipe(
prompt="Change the background to a sunset beach",
image=Image.open("input.png"),
num_inference_steps=40,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
透明圖(RGBA)靠提示詞格式觸發,官方建議的寫法是前後各加一句:
prompt = (
"This is an RGBA image with transparency. "
"A cute cartoon dragon sticker. "
"The image has alpha channel and the background is transparent."
)
這是這個版本對電商最有價值的能力:商品去背不用再接第二個工具。
步驟 4:設定輸出比例
官方支援的原生 2K 比例如下,直接把對應的寬高傳進 pipeline:
aspect_ratios = {
"1:1": (2048, 2048),
"4:3": (2400, 1792),
"3:4": (1792, 2400),
"3:2": (2528, 1696),
"2:3": (1696, 2528),
"16:9": (2752, 1536),
"9:16": (1536, 2752),
}
選用:用 vLLM 做成服務端點
如果要讓多個內部工具共用同一張卡,可以起一個服務:
vllm serve Qwen/Qwen-Image-2.1 --omni --port 8091
多卡環境可加上 --step-execution --max-num-seqs 8。要對外開放時,權限邊界與呼叫紀錄必須先設好,作法見 AI Agent 的權限邊界怎麼設。
來源:Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱;Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱。
常見錯誤排查
| 症狀 | 常見原因 | 處理方式 |
|---|---|---|
CUDA out of memory | 原生權重超過顯示卡容量 | 改 enable_model_cpu_offload()、ComfyUI 加 --lowvram、換 GGUF Q4_K_M |
ImportError: QwenImage21Pipeline | diffusers 裝到正式釋出版 | 改裝 git+https://github.com/huggingface/diffusers |
| ComfyUI 節點顯示紅色 | ComfyUI 版本過舊或檔案放錯資料夾 | 更新 ComfyUI、確認三類檔案分別在 diffusion_models/、text_encoders/、vae/ |
| 透明圖仍有白底 | 提示詞沒用官方 RGBA 格式 | 補上「This is an RGBA image…」前後句,並確認存檔為 PNG |
| 出圖速度極慢 | 跑在 CPU 上 | 確認 torch.cuda.is_available() 為 True,並檢查驅動與 CUDA 版本 |
裝完之後:先做這三件事再決定要不要留下
- 固定 seed 做對照:用同一組 seed 與提示詞跑現有工具與 Qwen-Image-2.1,比較可直接交付的比例,而不是比較單張最佳結果。
- 測你自己的素材:商品去背的邊緣、人物一致性、中文字排版,這三項最能決定它能不能進你的工作流。
- 記錄授權判斷:把「本次使用屬研究或評估用途」寫進內部文件;若之後要轉商用,需另行向 Qwen 取得授權。選型與供應商風險的判斷框架見 AI 供應商選型的法律與延續性風險。
需要立刻產出商用素材的團隊,現階段仍建議使用有明確商用條款的付費服務,比較請見 ChatGPT Images 2.0 中小企業導入指南。
來源與更新提醒
- Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱。
- Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱。
- Comfy-Org/Qwen-Image-2.1 權重倉庫,Hugging Face,2026-09-22 查閱。
- How to Use Qwen-Image 2.1 GGUF in ComfyUI,Kombitz,2026-09-20。
- Qwen-Image-2.1: 7B Open Weights You Cannot Ship,CellCog,2026-09-20。
模型檔名、相依套件版本與 ComfyUI 範本可能隨版本更新而變動;社群回報的硬體數字會因環境差異很大。本文為依官方文件與公開資料整理的操作流程,不構成法律意見,商用授權範圍請以 Qwen 官方條款為準。
相關推薦與延伸閱讀
- Qwen-Image-2.1 是什麼?7B 開源生圖模型,企業商用前要先看懂授權:阿里 Qwen 團隊於 2026 年 9 月 20 日開源 Qwen-Image-2.1:7B 視覺生成參數、原生 2K、透明 RGBA、最多 10 張參考圖編
- ChatGPT Images 2.0 是什麼?中小企業用 gpt-image-2 降低設計成本:整理 gpt-image-2 的繁體中文渲染、2K 生成、API 費用與限制,並比較 AI 生圖與外包設計的成本,協助你判斷是否值得導入。
- OpenAI 同一週發布 GPT Image 2.0 與 GPT-5.5:台灣企業現在能用什麼?:OpenAI 同一週發布 GPT Image 2.0 與 GPT-5.5。本文整理兩者的核心突破、API 定價,以及台灣企業可以立即導入的場景。
常見問題
相關服務

