阿里 Qwen 團隊在 2026 年 9 月 20 日開源 Qwen-Image-2.1,一天之內社群就出現「開源生圖第一、贏過 Nano Banana 2.0」的說法。對台灣中小企業來說,這句話的重點其實不在名次。
先給結論:Qwen-Image-2.1 的能力值得評估,但這次權重採研究授權,不能直接拿來做商用素材。 下面整理五件在下載權重之前應該先看懂的事。
1. 規格:7B 視覺生成,一個模型做完生成與編輯
官方倉庫列出的架構是 Single-Stream DiT 搭配 block-causal attention,視覺生成部分約 7B 參數、32 層;文字編碼器使用 Qwen3-VL 8B;VAE 為 64 通道 RGBA autoencoder,空間壓縮 16 倍;排程器為 Flow Matching 搭配 Euler discrete。
對非技術讀者,這些名詞可以翻成四個可用的能力:
- 原生透明:直接產生去背的 RGBA 圖,也能編輯透明圖層、從照片中抽出主體,不必再跑一次去背工具。
- 多圖參考:最多 10 張參考圖做合成,並保留人物與商品的一致性。
- 局部編輯:用圈選、塗抹標註或另外給遮罩指定要改的區域。
- 原生 2K:支援 1:1(2048×2048)、4:3(2400×1792)、16:9(2752×1536)等多種比例。
值得注意的是「一個模型做完生成與編輯」這件事。過去的典型流程是生圖一個模型、去背一個工具、換背景再一個工作流;把這些收斂到同一個模型,對素材量大的電商與零售團隊,省下的是流程接點,不只是運算費用。
來源:Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱;Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱。
2. 授權:這次是研究授權,不是 Apache 2.0
這是整篇文章最需要記住的一段。
Qwen-Image-2.1 的 LICENSE 是 Qwen Research License Agreement。條款第 2(a) 條授權範圍明寫「FOR NON-COMMERCIAL PURPOSES ONLY」,定義為研究或評估用途;第 2(b) 條進一步寫明,未另外取得商用授權前不得將材料用於任何商業目的。另外,若用它的輸出去訓練或改良其他要發布的模型,文件中必須顯著標示「Built with Qwen」或「Improved using Qwen」。
前代 Qwen-Image 採用的是 Apache 2.0,可自由商用。所以「Qwen 又開源了一個可以直接用的生圖模型」這個直覺,在 2.1 上並不成立。
對企業的實際影響很具體:
- 用它產生的圖直接放上官網、廣告或商品頁,屬於商業用途,需先取得商用授權。
- 內部評估、技術選型測試、學術研究,屬於授權範圍內。
- 若要把它包進自家 SaaS 或對客戶交付的服務,更需要先走授權流程。
授權與供應商風險是導入 AI 工具時最容易被跳過、事後最貴的一關,判斷方式可以參考 AI 供應商選型的法律與延續性風險。
來源:Qwen Research License Agreement,Qwen,2026-09-22 查閱。
3. 評測成績要分開看「誰做的測試」
社群廣為流傳的說法是 Qwen-Image-2.1 在開源模型中排第一、超越 Google 的 Nano Banana 2.0。這句話有事實基礎,但要補上三個條件:
- 分數來自 Qwen 自家的 Qwen-Image-Bench:Qwen-Image-2.1 為 60.28、Nano Banana 2.0 為 59.82,差距 0.46 分。
- 在同一張表上,Qwen-Image-2.1 名列第七,前面有六個閉源模型,最高為 GPT Image 2.5 Sunburst 的 67.01。
- 截至 2026 年 9 月 22 日,尚未見第三方獨立圖像模型排行榜收錄這個版本。
編輯分析: 0.46 分的差距,在一個由模型開發方自行設計與執行的評測上,不足以支撐「換掉現有工具」的決策。真正該做的是拿你自己最常用的 20 組提示詞——你的商品、你的字體、你的版面——同時跑現用工具與 Qwen-Image-2.1,比較可交付率,而不是比較排行榜。
來源:Qwen-Image-2.1: 7B Open Weights You Cannot Ship,CellCog,2026-09-20;Alibaba's Qwen open-sources Qwen-Image-2.1,TechNode,2026-09-21。
4. 硬體與部署:能不能在自己的機器上跑
官方支援 diffusers(QwenImage21Pipeline)、ComfyUI 原生節點,以及 vLLM-Omni、SGLang、LightX2V 等推論優化方案,預設 40 步推論、建議 bfloat16。
實測數字目前來自社群回報,差異很大:
| 環境 | 回報結果 |
|---|---|
| RTX 4090(ComfyUI 權重) | 1MP 圖約 5 秒 |
| 某一設定下的 VRAM 需求 | 約 15.6 GB |
| 筆電 CPU | 每張約 3 分鐘 |
| Qwen 官方圖表 | 2K 圖搭配 10 張參考輸入約 1.59 秒(硬體未標示) |
這代表兩件事:一張 24GB 的消費級顯示卡有機會跑得動,這是 7B 級模型的優勢;但「跑得動」不等於「能排進日常工作流」,自架還要算進顯示卡折舊、電費、維運人力與模型更新的時間成本。完整的成本結構算法,見 AI 導入成本怎麼算。
至於付費 API:截至 2026 年 9 月 22 日,阿里雲百煉(Model Studio)價目頁尚未列出 qwen-image-2.1 的計費項目。前代 Qwen-Image 2.0 系列在國際站的價格約為每張 0.035 與 0.075 美元,可作為推估的參考區間,但不是這個版本的定價。
來源:Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱;Qwen-Image-2.1: 7B Open Weights You Cannot Ship,CellCog,2026-09-20;阿里雲百煉模型價格,阿里雲,2026-09-22 查閱。
5. 優創的建議:哪些團隊現在該測、哪些先觀望
建議現在就排評估的團隊:
- 每月需要大量去背商品圖的電商與零售團隊。原生 RGBA 是這次最有價值的能力,值得用自家商品實測去背品質與邊緣細節。
- 需要固定人物或商品出現在不同場景的品牌團隊。多圖參考與一致性保留,正好對應這個需求。
- 已有 GPU 資源、想比較自架與 API 總成本的技術團隊。
建議先觀望的團隊:
- 需要立刻產出對外商用素材的團隊。研究授權不涵蓋商用,現階段仍應使用有明確商用條款的付費服務,選型可參考 ChatGPT Images 2.0 中小企業導入指南 與 2026 AI 內容創作工具總覽。
- 沒有 GPU、也不想維運推論環境的團隊。等官方 API 上架再評估,成本與責任歸屬都更單純。
四步驟評估流程
- 先讀授權再下載:確認你的用途落在「研究或評估」範圍內,並在內部文件記錄這個判斷。
- 建立比較基準:挑 20 組你實際會用的提示詞與商品照,記錄現用工具的可交付率與後製時間。
- 同條件實測:以相同素材跑 Qwen-Image-2.1,比較去背品質、多圖一致性、中文字渲染與每張圖的實際總成本。
- 依授權狀態決定下一步:若實測明顯勝出,再評估向 Qwen 申請商用授權,或等官方 API 上架後以商用條款採用。
來源與更新提醒
- Qwen-Image-2.1 GitHub 倉庫,QwenLM,2026-09-22 查閱。
- Qwen/Qwen-Image-2.1 模型卡,Hugging Face,2026-09-22 查閱。
- Qwen Research License Agreement,Qwen,2026-09-22 查閱。
- Alibaba's Qwen open-sources Qwen-Image-2.1 for unified image generation and editing,TechNode,2026-09-21。
- Qwen-Image-2.1: 7B Open Weights You Cannot Ship,CellCog,2026-09-20。
- 阿里雲百煉模型價格,阿里雲,2026-09-22 查閱。
模型授權條款、API 上架狀態與定價可能隨時變動,社群回報的硬體數字也會因環境而異。本文為依公開資料整理的實務判斷,不構成法律意見;商用授權範圍請以 Qwen 官方條款與你取得的書面授權為準。
相關推薦與延伸閱讀
- Qwen-Image-2.1 安裝教學:ComfyUI 與 diffusers 兩條路線,從下載到第一張圖:Qwen-Image-2.1 怎麼安裝?本文提供兩條可照做的路線:不寫程式用 ComfyUI、工程團隊用 diffusers,含官方檔名、資料夾位置、低 VRA
- ChatGPT Images 2.0 是什麼?中小企業用 gpt-image-2 降低設計成本:整理 gpt-image-2 的繁體中文渲染、2K 生成、API 費用與限制,並比較 AI 生圖與外包設計的成本,協助你判斷是否值得導入。
- Gemini 3.8 Flash 值得推薦嗎?企業導入前的實用評估指南:Gemini 3.8 Flash 適合哪些企業工作?本文整理官方支援能力、適用情境與限制,協助台灣中小企業判斷是否值得導入。

