Nucleus Image 評測:17B 稀疏 MoE、本地架構、NSFW 支援與 Apache 2.0 開放權重
Nucleus Image 是 2026 年備受關注的開源圖像模型之一,它將 Sparse Mixture-of-Experts(稀疏混合專家,簡稱 MoE)架構帶入了基於擴散模型(Diffusion)的文生圖生成中。它不是那種簡單的 SDXL 風格微調檢查點(Checkpoint),而是一個擁有 17B(170 億)總參數的 Sparse MoE 擴散 Transformer 模型,在每一次前向傳遞中僅啟動約 2B(20 億)個參數。
簡而言之:如果你正在尋找一款採用 Apache 2.0 授權、完全開源、可用於商業用途,且具備出色通用生成品質與高效推論設計的圖像模型,Nucleus Image 相當具有吸引力。但如果你主要需要的是成熟的動漫 LoRA 生態系、內建圖像編輯工具,或是像 NovelAI 那樣精緻的消費者操作介面,它可能就不是最理想的選擇。
在 NSFW(成人內容)方面,相較於審查嚴格的閉源平台,它顯得開放許多,特別是在本地端執行時。不過,它畢竟是一款基礎文生圖模型,並非專門的成人或動漫模型,因此在掌控度、角色一致性以及社群 NSFW 資源的豐富度上,還比不上 Anima 或基於 Pony 衍生的檢查點等成熟生態系。
Table of Contents
快速總結
| 項目 | Nucleus Image 評測 |
|---|---|
| 最適合用途 | 開源通用圖像生成、商業用途、研究、Diffusers 工作流程、高效能高品質文生圖 |
| 模型類型 | Sparse MoE 擴散 Transformer |
| 參數規模 | 總計 17B,每次前向傳遞啟動約 2B |
| 授權條款 | Apache 2.0 |
| 線上使用 | 官方 Nucleus Image 網站與 fal API |
| 本地使用 | Diffusers;適用於 Apple Silicon 的 MLX 社群版本 |
| NSFW 支援 | 本地端比閉源工具更開放,但尚未形成成熟的專屬 NSFW 生態系 |
如果你正在比較本地/開源圖像模型,建議也閱讀我們的 Qwen Image 評測、Anima 評測、NovelAI V5 評測以及 Flux 3 評測。Nucleus Image 在定位上最接近高效能的開源基礎模型類別。
什麼是 Nucleus Image?

Nucleus Image 是由 NucleusAI 開發的文生圖生成模型。官方模型卡片將其描述為一個 Sparse MoE 擴散 Transformer,具備 17B 總參數、每個 MoE 層有 64 個路由專家(Routed Experts)外加 1 個共享專家(Shared Expert)、32 層 Transformer 架構,並採用 Qwen3-VL-8B-Instruct 作為文字編碼器。
核心概念在於「效率」。Sparse MoE 能讓模型維持龐大的總容量,但在每次前向傳遞時只啟動網路的一小部分。這與每次都會調用整個模型的密集模型(Dense Model)不同。對於圖像生成來說,這可能是個重要的發展方向,因為在畫質不斷提升的同時,本地推論的成本也越來越不容忽視。
該模型備受矚目的另一大原因在於它是個基礎模型。官方說明指出,報導中的基準測試結果均來自預訓練階段,尚未經過 DPO、強化學習或人類偏好微調。這使它非常適合用於研究與下游微調,但同時也意味著原始模型可能需要更精細的提示詞或工作流程調整。
官方網站、API 與下載連結

你可以透過 Nucleus Image 官方網站來試用模型。若要在本地端使用與下載,主要頁面為 Hugging Face 上的 NucleusAI/Nucleus-Image,專案同時也提供於 官方 GitHub 儲存庫中。
需要託管式推論的開發者則可使用 fal 的 Nucleus Image API。fal 提供基於佇列的 API 以及 JavaScript/Node 範例,如果你想將 Nucleus Image 生成功能整合至網頁應用程式,又不想自行維護 GPU 伺服器,這會是相當方便的選擇。

Apple Silicon 用戶也可以關注社群移植版本,例如 mlx-community/Nucleus-Image-4bit。這雖然無法取代官方模型,但對於想在 Mac 硬體上進行實驗的讀者來說相當實用。
功能與規格
Nucleus Image 經過訓練,支援多種長寬比以及常見的圖像生成情境:肖像、產品風格圖片、建築、自然、超現實場景、奇幻藝術、排版風格版面以及日常商業影像。它不僅僅是一個動漫檢查點或純攝影模型。
| 規格項目 | 數值 |
|---|---|
| 總參數 | 17B |
| 啟動參數 | 每次前向傳遞約 2B |
| 模型架構 | Sparse MoE 擴散 Transformer |
| 層數 | 32 層 |
| 專家數量 | 每個 MoE 層具備 64 個路由專家與 1 個共享專家 |
| 文字編碼器 | Qwen3-VL-8B-Instruct |
| 圖像分詞器 (Tokenizer) | Qwen-Image VAE |
| 訓練資料 | 約 7 億張圖片與 15 億對圖文對 |
| 訓練階段 | 256 → 512 → 1024 漸進式解析度 |
| 建議採樣設定 | 官方快速入門使用 50 步與引導係數(Guidance Scale)4.0 |
模型卡片顯示了出色的基準測試分數,包含 GenEval 0.87、DPG-Bench 88.79 以及 OneIG-Bench 0.522。基準測試雖然無法保證每個提示詞的表現都超越所有競爭對手,但它們確實證明了 Nucleus Image 並非只是實驗性質的玩具模型。
圖像品質與實際應用表現
就實際層面而言,對於想要尋找一款高畫質開源基礎模型來處理多樣化提示詞的使用者來說,Nucleus Image 相當具有吸引力。其官方範例涵蓋了人物、奇幻、商業圖片、食物、建築、產品場景等主題。這種廣度非常重要,因為許多本地圖像模型往往在某個風格上表現優異,但在其他風格上就顯得薄弱。
它潛在的弱點在於產品成熟度。相較於 NovelAI V5、Midjourney、Seedream 或 Qwen Image API,Nucleus Image 尚未提供同樣精緻的消費者編輯層、風格預設集、圖生圖(Image-to-Image)工具、局部重繪(Inpainting)介面,或是龐大的提示詞分享社群。你所接觸到的是更貼近模型本身的內容。
對於技術型使用者來說,這算不上缺點。如果你熟悉 Diffusers、訓練 LoRA、建構圖像管線,或是重視授權條款,Nucleus Image 遠比另一個閉源的網頁生成器來得更有趣。但如果你只想要最快速、免設定的操作介面,線上服務使用起來會更輕鬆。
本地架設與硬體需求
官方的 Hugging Face 快速入門指南採用了最新的 Diffusers、BF16 載入、CUDA、TextKVCacheConfig、50 次推論步數以及 4.0 的引導係數。同時也列出了常見的長寬比,例如 1024×1024、1344×768、768×1344、1184×896 以及 896×1184。
Sparse MoE 減少了實際的運算量,但並不代表你的 GPU 只需要儲存 2B 的參數。該模型仍具備 17B 的總參數,加上大型文字編碼器與執行階段記憶體。為了享有流暢的 BF16 實驗體驗,48GB 等級的 GPU 是比較保險的目標。24GB 的 GPU 可能需要透過 CPU 卸載(Offload)、記憶體節省設定、降低解析度或使用社群量化版本。16GB(含)以下的硬體則建議直接使用託管 API 或較小的模型。
| 硬體設備 | 預期表現 |
|---|---|
| 8-12GB VRAM | 不建議執行官方完整模型;建議使用託管 API 或等待優化的社群版本 |
| 16GB VRAM | 僅在工作流程支援且付出重大妥協的情況下勉強可行 |
| 24GB VRAM | 可透過卸載與優化進行實驗;執行過程可能不夠流暢 |
| 48GB VRAM | 較適合進行 BF16 本地測試 |
| Apple Silicon | 請關注 MLX 社群版本;速度與畫質高度取決於記憶體與實作方式 |
| 託管 API | 進行快速產品測試的最佳途徑 |
與其他開源模型的比較
| 模型 | 優勢 | 劣勢 | 最佳選擇時機… |
|---|---|---|---|
| Nucleus Image | Apache 2.0、Sparse MoE 高效率、出色的通用畫質 | 生態系尚新、LoRA 與 UI 工具較少 | 想要將開源基礎模型用於研究或商業用途時 |
| Qwen Image 2.0 / 3.0 | 文字渲染力強、排版佳、多語提示詞、編輯生態系完善 | 最新 3.0 僅限 API;本地版本可能較為龐大 | 需要在圖像中嵌入文字或處理類似文件的排版時 |
| FLUX / Flux 3 | 強大的寫實表現與廣泛的生態系 | 授權與 NSFW/社群細節因版本而異 | 想要成熟的本地工作流程與廣泛的工具支援時 |
| Anima | 動漫/插畫風格、角色知識豐富、偏向 NSFW 的社群 | 商用影像的通用性較低 | 主要生成動漫或角色藝術時 |
| Pony / Illustrious / NoobAI | 支援 Danbooru 標籤提示詞、成熟的插畫 LoRA 文化 | 對一般產品/攝影提示詞的自然度較低 | 需要動漫、獸人、角色或標籤化控制時 |
| 穩定擴散 (SDXL) 生態系 | 龐大的 LoRA/檢查點資料庫 | 較舊的基礎畫質與提示詞理解能力 | 相容性比前沿畫質更重要時 |
最關鍵的差異在於,Nucleus Image 是一個基礎模型釋出版本,而非完整的創作平台。當社群圍繞它開發出 LoRA、ComfyUI 節點、量化版本、工作流程與微調檢查點時,它的價值就會隨之提升。
NSFW 支援表現
Nucleus Image 比許多閉源商業生成器更為開放,因為官方釋出的是基礎模型,且支援本地端執行。模型卡片並未描述像聊天模型那樣嚴格的拒絕防禦層,本地生成很大程度上取決於使用者自己的工作流程與安全過濾器。
話雖如此,託管服務可能會套用其自身的安全檢查機制。fal 與其他 API 平台可能會根據其政策過濾或封鎖敏感輸出,即便底層模型是開源的也一樣。如果 NSFW 自由度是剛性需求,本地部署的重要性就會高過模型本身的名稱。
對於成人或限制級影像,應保持合理的期待。Nucleus Image 在本地端或許較為寬鬆,但它尚未擁有像動漫專屬社群那樣成熟的 NSFW LoRA/檢查點生態系。若要追求精細的角色一致性、特定姿態或小眾成人風格,專門模型如 Anima、基於 Pony 衍生的檢查點或 Illustrious 家族模型可能依然更加便利。
社群與 LoRA 現狀
Nucleus Image 的社群仍處於發展初期。Hugging Face 上已經可以看到該模型、相關的展示/API 頁面以及早期的社群移植版本,但 LoRA、微調模型、ComfyUI 工作流程以及提示詞指南的數量,遠小於 SDXL、Pony、Illustrious、Qwen Image 或 FLUX 生態系。
這對讀者來說至關重要。一個模型在紙面上可能很強大,但日常可用性取決於生態系的深度:LoRA 訓練器、量化權重、ControlNet 風格工具、提示詞範例、社群基準測試與疑難排解文章。Nucleus Image 有著良好的起步,但尚未達到那個成熟的階段。
常見問題 (FAQ)
Nucleus Image 可以免費商用嗎?
可以。官方 Hugging Face 模型卡片標註為 Apache 2.0 授權,對商業與研究用途通常相當友善。不過,企業在投入正式生產部署前,仍應自行審查授權條款。
在哪裡可以在線試用 Nucleus Image?
最簡單的官方途徑是透過 Nucleus Image 網站。開發者也可以使用 fal 的託管 API。
我可以在 12GB GPU 上執行它嗎?
官方完整模型並不適合 12GB VRAM 的硬體。託管推論、MLX/量化社群版本或較小的圖像模型會是更實際的選擇。
它比 Qwen Image 更好嗎?
並非在所有使用情境下都比較好。Nucleus Image 的優勢在於開源授權與 Sparse MoE 的高效率,而 Qwen Image 則在文字渲染、密集排版與編輯工作流程中特別強大。
它支援 NSFW 嗎?
本地端的使用彈性比許多閉源平台更高,但託管 API 可能會過濾輸出內容。社群的 NSFW 生態系目前仍相當年輕。
它適合用來畫動漫嗎?
它能夠生成風格化的圖像,但專門的動漫模型通常能提供更好的標籤控制、角色知識與 LoRA 支援。
參考資料
- Nucleus Image 官方網站
- Hugging Face 上的 NucleusAI/Nucleus-Image
- 官方 GitHub 儲存庫
- arXiv 上的 Nucleus-Image 技術報告
- fal Nucleus Image API
- MLX 社群版本
Conclusion
Nucleus Image 是一款嚴謹的開源圖像模型,而不只是另一個檢查點。其 Sparse MoE 設計、Apache 2.0 授權、Diffusers 支援以及亮眼的官方基準測試結果,使其成為近期最值得關注的本地 AI 圖像發表之一。
最適合它的使用者包括開發者、研究人員、工作流程建構者以及重視開源權重與授權的商業團隊。主要的考量點在於硬體需求、尚待發展的生態系深度,以及 NSFW 支援較偏向本地掌控而非成熟的成人生成社群。
如果你想要精緻的付費網頁工具,NovelAI V5 或其他線上服務可能會讓人覺得更輕鬆。但如果你想要一個有潛力成為未來 LoRA、量化版本與自訂圖像管線強大基礎的開源模型,Nucleus Image 絕對值得深入研究。