Qwen-Image-2.1 評測:透明圖片、AI 編輯、API 費用與 NSFW 限制
解析 Qwen-Image-2.1 的透明 PNG、多圖編輯、使用者實測、API 台幣參考費用、ComfyUI 安裝與顯存需求,釐清商用授權及 NSFW 限制。
Qwen-Image-2.1 最值得關注的,是把素材生成與修改放進同一套流程。除了文字生圖,它還能產生透明背景圖片、參考多張圖片,以及修改照片的指定部分。想研究貼圖、商品去背素材或角色變化圖的人,比單純追求漂亮成品更容易找到它的用途。
不過,公開權重採研究授權,「7B」也只代表視覺生成模組,不是整套模型的記憶體需求。建議先用官方展示確認效果,再考慮硬體;有商業用途時,則要先釐清授權。資料與價格確認日期:2026 年 9 月 24 日。
新版的主要改良:透明背景與統一編輯
Qwen-Image-2.1於 2026 年 9 月 20 日推出,整合文字生圖與圖片編輯。重點包括原生 RGBA 透明輸出、最多 10 張參考圖、以塗畫或遮罩引導的局部修改,以及 7B 視覺生成模組。官方也宣稱改善文字、人物光線和材質,但這不等於每個任務都勝過舊版。

| 功能 | 實際用途 | 要留意的限制 |
|---|---|---|
| 原生 RGBA | 研究貼圖與透明素材,不必每次另外去背 | 需確認真的有 Alpha 通道,而非畫出棋盤格 |
| 最多 10 張參考圖 | 組合人物、衣服或不同產品 | 參考越多,指令與運算負擔越複雜 |
| 原生 2K | 產生可放大檢查的圖像 | 官方正方形設定為 2048×2048,顯存需求較高 |
| 生成與編輯合一 | 建立素材後接著修正 | 舊工作流程和 LoRA 不保證相容 |
| 7B 生成模組 | 縮小生成部分的規模 | 還需 Qwen3-VL 8B 編碼器及 VAE |
透明圖片應另存 PNG,放到深色和淺色背景檢查邊緣。玻璃、髮絲、半透明陰影尤其值得放大看。「最多 10 張」是輸入上限,不是十個人物都能完美維持身分的保證。
真實使用者怎麼看?
Europa Press 的發布報導介紹了透明圖片能力,但新聞介紹不等於獨立畫質評測。比較有參考價值的是附上硬體設定或生成作品的使用者回報。
Hugging Face 使用者 TheTechnoX以 RTX 4060 Ti 16GB、ComfyUI 和 INT8 模型完成局部編輯,回報生成約 20 秒、編輯約 60 秒,顯存峰值約 15GB。不過,解析度和步數沒有完整交代,不能直接當作自己電腦的速度預估。
另一篇 Reddit 使用心得肯定表情、姿勢及背景修改,但指出部分成品偏黃、帶顆粒感或人工感,複雜元素組合也不夠理想。這些是早期個人經驗,不是統一條件的模型排行榜。
我們的建議:優先評估透明素材和範圍明確的局部編輯;寫實質感與多人構圖則需要更仔細挑圖。本文引用第三方測試,沒有把這些數字包裝成 AirMore 自行執行的 GPU 跑分。
線上入口、API 與台幣參考費用
要確認用到的是這個版本,可從Qwen 官方 Hugging Face 展示開始。介面支援中英文提示詞、圖片輸入與提示詞增強。共享展示的容量和條件可能變動,不能視為無限免費或有企業級穩定性保證的服務。

- 純文字生圖先不要上傳圖片,在 Prompt 欄填入清楚的描述。
- 編輯時上傳自己的圖片,說明哪些要改、哪些要保留。
- 要透明背景時明確要求 RGBA 與透明輸出,下載後保留 PNG 格式。
- 檢查 Enhance prompt 補上的描述;若新增不想要的內容,關閉後比較。
- 按 Generate image 生成,再以原尺寸檢查文字和輪廓。
第三方 reAPI的價格為 1K 每張 US$0.02、2K 每張 US$0.04,約為 NT$0.64、NT$1.27;100 張約 NT$64、NT$127。這是供應商標價,不是阿里巴巴官方 API 報價,也不代表以台幣結帳。

換算依2026 年 9 月 24 日參考匯率,1 美元約 NT$31.78;稅金與付款手續費另計。API 文件使用 qwen-image-2.1 模型 ID,提交工作後查詢非同步任務的結果。也可依vLLM-Omni 文件在自己的 GPU 上架設 API,但運算費用與維護由自己負擔。
ComfyUI 安裝與顯存需求
先更新 ComfyUI,使用Comfy-Org 模型檔及官方文字生圖工作流程或圖片編輯工作流程。2.1 的 VAE、編碼器和生成模型需搭配使用,不建議直接沿用舊版配置。

以下是 INT8 檔案的放置範例;若下載 BF16 版本,請在載入節點選擇實際檔名。
ComfyUI/models/diffusion_models/
qwen_image_2.1_int8_convrot.safetensors
ComfyUI/models/text_encoders/
qwen3vl_8b_int8_convrot.safetensors
ComfyUI/models/vae/
qwen_image_2.1_vae_bf16.safetensors - 匯入官方工作流程 JSON。
- 將三種模型檔放進對應資料夾,再重新啟動或更新清單。
- 逐一確認載入節點的檔名。圖片編輯流程還需要指定來源圖片。
- 先從 1024×1024、單張圖片測試,成功後再提高解析度和參考數量。
- 記錄種子、精度、解析度與設定,才能比較修改前後的差異。
目前不能用一個數字概括最低顯存。vLLM 的 GB300 測試在 1024×1024、40 步的某個 BF16 配置下使用約 34GB;這是資料中心硬體,不是家用顯卡購買建議。16GB 社群案例採用量化與不同執行環境,也不保證能跑 2K、10 張參考圖。
量化與 CPU 卸載有機會降低顯存壓力,但可能犧牲速度或品質;系統記憶體與 SSD 空間也要預留。額外的 9B 提示詞增強模型屬選配,第一次使用不必全部安裝。
與舊版 Qwen、FLUX.2 klein 比較
| 模型 | 適合的需求 | 主要取捨 |
|---|---|---|
| Qwen-Image-2.1 | 透明素材與生成、編輯整合 | 研究授權;複雜任務與硬體負擔仍需測試 |
| Qwen-Image-Edit-2511 | 保留熟悉的舊編輯流程作比較 | 較早的編輯模型,擴充不一定與 2.1 相容 |
| FLUX.2 [klein] 4B | 快速反覆試圖、重視 Apache-2.0 權重授權 | 9B 版本的授權不同,不能混為一談 |

建議比較三種自己的常見任務:換衣服但保留臉孔、修改產品但維持標籤、替換背景但保持光線。新版可能改善其中一項,卻不一定全部勝出。

FLUX.2 klein 4B API第一百萬像素從 US$0.014 起,另有額外像素及參考圖計費,因此不能直接等同 reAPI 的固定 1K/2K 費率。透明素材研究可先試 2.1;追求反覆生成速度或較寬鬆權重授權,則可評估 klein 4B。
NSFW 與商用授權:兩件不同的事
本機執行不代表官方保證無限制 NSFW。社群回報顯示文字生圖與編輯的行為可能不同,提示詞增強器和代管平台審查也會影響結果。reAPI 說明會審查輸入與輸出,使用它時仍需遵守平台規則。
Qwen Research License將配布材料的使用限於研究或評估;商用需另取得授權,可聯絡 model-business@notice.qwencloud.com。不能把舊 Qwen 的 Apache-2.0 條件套到 2.1,也不能只因付了第三方 API 費用就假定所有商業用途都獲准。
提示詞與值得嘗試的用途
- 透明貼圖:指定單一主體、材質、光線和透明背景,避免又要求地板或風景。
- 商品修改:同時列出要改與要保留的形狀、文字、反射和相機角度。
- 多圖參考:用第一張、第二張標示用途,逐步加入圖片。
- 文字排版:把準確文案放在引號內並指定位置。繁體字、標點和小字都需人工校對。
- 動漫與真人:檢查臉部、手部和連續編輯的一致性,不把某種畫風視為必然效果。
可試的描述:「透明 RGBA 背景上的一朵橘色紙雕花貼圖,花瓣輪廓清楚,四周留白,不要文字。」編輯例:「只把藍色背景換成淺綠色,保留瓶身、標籤文字、反射與拍攝角度。」這些是提示詞建議,不是已完成的跑分案例。
常見問題與選用建議
免費嗎?
下載權重沒有每張圖片的模型費,但顯卡、電力或租用 GPU 仍有成本,也受研究授權限制。線上方案的費用與額度各自計算。
7B 可以用 8GB 顯卡嗎?
不能只看參數量。編碼器、VAE、運算中間資料和參考圖都會占用顯存,應找相同硬體和配置的測試。
舊版 LoRA 能直接用嗎?
先確認是否明確支援 2.1 的架構。建議先跑通官方範例,再加入相容的擴充。
為什麼存下來不透明?
先確認是不是 JPEG,再檢查檔案有沒有 Alpha 通道。移除背景衝突描述,並把圖片放在不同底色上檢視。
值得升級嗎?
如果主要目的是透明素材或局部編輯研究,很值得挑幾個真實需求試用。先以官方展示評估,再看自己的 GPU 能否重現;速度、穩定性和授權確認前,保留原本用得順手的模型。
付費專案的選型要從授權開始,而不是等漂亮樣圖做完才補查。Qwen-Image-2.1 的亮點很明確,適用範圍同樣要看清楚。