Nucleus Image Review: 17B Sparse MoE, lokales Setup, NSFW-Unterstützung und Apache-2.0-Open-Weights
Nucleus Image zählt zu den spannendsten Open-Source-Bildmodellen des Jahres 2026, da es ein Sparse-Mixture-of-Experts-Design (MoE) in die Diffusionsbasierte Text-zu-Bild-Generierung integriert. Statt eines schlichten Checkpoints im…
Nucleus Image zählt zu den spannendsten Open-Source-Bildmodellen des Jahres 2026, da es ein Sparse-Mixture-of-Experts-Design (MoE) in die Diffusionsbasierte Text-zu-Bild-Generierung integriert. Statt eines schlichten Checkpoints im SDXL-Stil handelt es sich hierbei um einen Sparse MoE Diffusion Transformer mit insgesamt 17 Milliarden Parametern, von denen bei jedem Forward-Pass lediglich rund 2 Milliarden aktiv sind.
Kurz gefasst: Nucleus Image ist äußerst attraktiv, wenn Sie ein unter der Apache-2.0-Lizenz stehendes, vollständig offenes und kommerziell nutzbares Bildmodell suchen, das eine hohe universelle Qualität mit effizientem Inferenz-Design verbindet. Weniger ideal ist es hingegen, wenn Sie primär ein ausgereiftes Anime-LoRA-Ökosystem, integrierte Bildbearbeitungswerkzeuge oder eine ausgefeilte Benutzeroberfläche für Endanwender wie bei NovelAI benötigen.
Was NSFW-Inhalte betrifft, so ist die Situation hier offener als bei stark eingeschränkten geschlossenen Plattformen, insbesondere bei lokaler Ausführung. Dennoch bleibt es ein grundlegendes Text-zu-Bild-Modell und kein spezialisiertes Erotik- oder Animemodell. Kontrolle, Charakterkonsistenz und Community-Ressourcen für diesen Bereich sind daher noch lange nicht so tief entwickelt wie in etablierten Ökosystemen wie Anima oder von Pony abgeleiteten Checkpoints.
Inhaltsverzeichnis
- Schnellfazit
- Was ist Nucleus Image?
- Offizielle Website, API und Download-Links
- Funktionen und Technische Daten
- Bildqualität und Praxiseinsatz
- Lokale Einrichtung und Hardware
- Vergleich mit anderen offenen Bildmodellen
- NSFW-Unterstützung
- Community- und LoRA-Status
- Häufig gestellte Fragen (FAQ)
- Quellen
- Fazit
Schnellfazit
| Eigenschaft | Nucleus Image im Test |
|---|---|
| Am besten geeignet für | Allgemeine Open-Source-Bildgenerierung, kommerzielle Nutzung, Forschung, Diffusers-Workflows sowie effiziente und hochwertige Text-zu-Bild-Erstellung |
| Modelltyp | Sparse MoE Diffusion Transformer |
| Parameter | 17 Milliarden insgesamt, ca. 2 Milliarden aktiv pro Forward-Pass |
| Lizenz | Apache 2.0 |
| Online-Nutzung | Offizielle Nucleus-Image-Website und fal-API |
| Lokale Nutzung | Diffusers; MLX-Community-Build für Apple Silicon |
| NSFW | Lokal offener als geschlossene Tools, aber kein ausgereiftes dediziertes NSFW-Ökosystem |
Wenn Sie lokale beziehungsweise offene Bildmodelle vergleichen, lesen Sie auch unsere Testberichte zu Qwen Image, Anima, NovelAI V5 und Flux 3. Nucleus Image positioniert sich dabei am ehesten in der Kategorie der effizienten offenen Basismodelle.
Was ist Nucleus Image?

Nucleus Image ist ein Text-zu-Bild-Generierungsmodell von NucleusAI. In der offiziellen Modellkarte wird es als Sparse MoE Diffusion Transformer beschrieben, der 17 Milliarden Gesamtparameter, 64 geroutete Experten pro MoE-Schicht, einen gemeinsamen Experten (Shared Expert), 32 Transformer-Schichten sowie Qwen3-VL-8B-Instruct als Text-Encoder nutzt.
Der Kernansatz liegt in der Effizienz. Dank Sparse MoE kann das Modell eine hohe Gesamtkapazität aufweisen, während bei jedem einzelnen Forward-Pass nur ein Bruchteil des Netzwerks aktiviert wird. Dies unterscheidet es von dichten Modellen, bei denen jedes Mal das gesamte Modell zum Einsatz kommt. Für die Bildgenerierung könnte dies ein bedeutsamer Trend sein, da die Qualität stetig steigt, während die Kosten für die lokale Inferenz immer schwerer zu ignorieren sind.
Zudem ist das Modell bemerkenswert, da es sich um ein reines Basismodell handelt. Laut der offiziellen Beschreibung basieren die ausgewiesenen Benchmark-Ergebnisse ausschließlich auf dem Vortraining, gänzlich ohne DPO, Reinforcement Learning oder menschliche Präferenzabstimmung. Das macht das Modell zwar äußerst nützlich für die Forschung und nachfolgende Feinabstimmungen (Fine-Tuning), bedeutet aber auch, dass das Rohmodell gegebenenfalls ein präzises Prompting oder Workflow-Anpassungen erfordert.
Offizielle Website, API und Download-Links

Sie können das Modell direkt auf der offiziellen Nucleus-Image-Website ausprobieren. Für die lokale Nutzung und Downloads ist die Hauptanlaufstelle NucleusAI/Nucleus-Image auf Hugging Face. Zudem steht das Projekt über das offizielle GitHub-Repository zur Verfügung.
Entwickler, die eine gehostete Inferenz bevorzugen, können die Nucleus-Image-API von fal nutzen. fal stellt eine warteschlangenbasierte API samt JavaScript- und Node-Beispielen bereit, was besonders praktisch ist, wenn Sie Nucleus Image in eine Webanwendung integrieren möchten, ohne einen eigenen GPU-Server betreiben zu müssen.

Nutzer von Apple Silicon sollten zudem Community-Ports wie mlx-community/Nucleus-Image-4bit im Auge behalten. Dies ersetzt zwar nicht das offizielle Modell, ist aber nützlich für Anleger, die auf Mac-Hardware experimentieren möchten.
Funktionen und Technische Daten
Nucleus Image wurde für verschiedene Seitenverhältnisse und gängige Anwendungsfälle der Bildgenerierung trainiert: Portraits, Produktfotografie, Architektur, Natur, surreale Szenen, Fantasy-Art, typografieähnliche Layouts sowie alltägliche kommerzielle Bildmotive. Es handelt sich folglich nicht nur um einen reinen Anime-Checkpoint oder ein spezialisiertes Fotomodell.
| Technische Daten | Wert |
|---|---|
| Gesamtparameter | 17 Milliarden |
| Aktive Parameter | Ca. 2 Milliarden pro Forward-Pass |
| Architektur | Sparse MoE Diffusion Transformer |
| Schichten | 32 |
| Experten | 64 geroutete Experten plus 1 gemeinsamer Experte pro MoE-Schicht |
| Text-Encoder | Qwen3-VL-8B-Instruct |
| Bild-Tokenizer | Qwen-Image VAE |
| Trainingsdaten | Ca. 700 Millionen Bilder und 1,5 Milliarden Beschriftungspaare (Caption Pairs) |
| Trainingsphasen | Progressive Auflösung von 256 → 512 → 1024 |
| Empfohlene Sampling-Einstellungen | Offizieller Schnellstart verwendet 50 Schritte und eine Guidance-Skala von 4,0 |
Die Modellkarte weist starke Benchmark-Ergebnisse auf, darunter GenEval 0.87, DPG-Bench 88,79 und OneIG-Bench 0,522. Zwar garantieren Benchmarks nicht, dass jeder Prompt besser aussieht als bei der Konkurrenz, sie untermauern jedoch die Aussage, dass es sich bei Nucleus Image keineswegs um ein bloßes experimentelles Spielzeugmodell handelt.
Bildqualität und Praxiseinsatz
Praktisch betrachtet ist Nucleus Image besonders für jene Anwender interessant, die ein hochwertiges offenes Basismodell für vielfältige Prompts suchen. Die offiziellen Beispiele decken Menschen, Fantasy, kommerzielle Bilder, Lebensmittel, Architektur, produktaffine Szenen und vieles mehr ab. Diese Bandbreite ist wichtig, da viele lokale Bildmodelle zwar in einem bestimmten Stil exzellent, außerhalb davon jedoch schwächer aufgestellt sind.
Die potenzielle Schwachstelle liegt in der Reife des Produkts. Verglichen mit NovelAI V5, Midjourney, Seedream oder den APIs von Qwen Image bietet Nucleus Image noch keine vergleichbare, ausgereifte Benutzeroberfläche für Endanwender, keine Stil-Presets, keine Image-to-Image-Tools, kein Inpainting-Interface und auch keine große Community zum Teilen von Prompts. Man arbeitet hier deutlich näher am eigentlichen Modellkern.
Für technische Anwender ist dies jedoch kein Nachteil. Wenn Sie mit Diffusers arbeiten, LoRAs trainieren, Bild-Pipelines aufbauen oder Wert auf die Lizenzierung legen, ist Nucleus Image wesentlich spannender als der nächste geschlossene Webgenerator. Wer hingegen ausschließlich eine unkomplizierte Benutzeroberfläche ohne jeglichen Installationsaufwand sucht, ist mit einem Online-Dienst besser beraten.
Lokale Einrichtung und Hardware
Der offizielle Hugging-Face-Schnellstart setzt auf die neuesten Diffusers, BF16-Ladung, CUDA, TextKVCacheConfig, 50 Inferenzschritte sowie eine Guidance-Skala von 4,0. Zudem werden gängige Seitenverhältnisse wie 1024×1024, 1344×768, 768×1344, 1184×896 und 896×1184 aufgeführt.
Das Sparse-MoE-Prinzip reduziert zwar die aktive Rechenlast, bedeutet jedoch nicht, dass Ihre GPU lediglich 2 Milliarden Parameter speichert. Das Modell umfasst nach wie vor 17 Milliarden Gesamtparameter sowie einen großen Text-Encoder und belegt entsprechenden Arbeitsspeicher zur Laufzeit. Für komfortable Experimente im BF16-Format empfiehlt sich daher als sicherer Ausgangspunkt eine Grafikkarte der 48-GB-Klasse. Eine 24-GB-GPU erfordert gegebenenfalls CPU-Auslagerung (Offload), speichersparende Einstellungen, geringere Auflösungen oder quantisierte Community-Builds. Konfigurationen mit 16 GB VRAM oder weniger sind mit gehosteten APIs oder kleineren Modellen besser bedient.
| Hardware | Erwartung |
|---|---|
| 8–12 GB VRAM | Nicht empfohlen für das offizielle Vollmodell; stattdessen gehostete API nutzen oder auf optimierte Community-Builds warten |
| 16 GB VRAM | Nur mit erheblichen Kompromissen möglich, sofern vom Workflow unterstützt |
| 24 GB VRAM | Experimentell mit Auslagerung und Optimierungen; nicht der reibungsloseste Weg |
| 48 GB VRAM | Realistischer für lokale BF16-Tests |
| Apple Silicon | MLX-Community-Builds prüfen; Geschwindigkeit und Qualität hängen stark von Speicher und Implementierung ab |
| Gehostete API | Bester Weg für schnelle Produkttests |
Vergleich mit anderen offenen Bildmodellen
| Modell | Stärke | Schwäche | Beste Wahl, wenn… |
|---|---|---|---|
| Nucleus Image | Apache 2.0, Sparse-MoE-Effizienz, hohe allgemeine Qualität | Jutes Ökosystem, weniger LoRAs und UI-Tools | Sie ein offenes Basismodell für Forschung oder kommerzielle Zwecke suchen |
| Qwen Image 2.0 / 3.0 | Starke Textdarstellung, Layouts, mehrsprachige Prompts, Bearbeitungsökosystem | Neueste Version 3.0 nur als API; lokale Versionen können speicherintensiv sein | Sie Text im Bild oder dokumentähnliche Layouts benötigen |
| FLUX / Flux 3 | Starker Fotorealismus und breites Ökosystem | Lizenz- sowie NSFW-/Community-Details hängen von der Version ab | Sie ausgereifte lokale Workflows und breite Tool-Unterstützung wünschen |
| Anima | Anime-/Illustrationsstil, Charakterwissen, NSFW-orientierte Community | Weniger universell für kommerzielle Bildmotive einsetzbar | Sie primär Anime- oder Charakter-Art generieren |
| Pony / Illustrious / NoobAI | Danbooru-Tag-Prompting und ausgereifte Illustrations-LoRA-Kultur | Weniger natürlich für allgemeine Produkt- oder Fotoprompts | Sie Anime-, Furry-, Charakter- oder Tag-basierte Kontrolle benötigen |
| Stable Diffusion XL (Ökosystem) | Riesige LoRA- und Checkpoint-Bibliothek | Ältere Basisqualität und geringeres Textverständnis | Kompatibilität wichtiger ist als modernste Spitzenqualität |
Der wichtigste Unterschied besteht darin, dass es sich bei Nucleus Image um die Veröffentlichung eines Basismodells und nicht um eine vollständige Kreativplattform handelt. Der wahre Wert des Modells wächst, sobald die Community LoRAs, ComfyUI-Knoten, Quantisierungen, Workflows und feingetunte Checkpoints darum herum aufbaut.
NSFW-Unterstützung
Nucleus Image zeigt sich offener als viele geschlossene kommerzielle Generatoren, da es sich beim offiziellen Release um ein Basismodell handelt, das lokal ausgeführt werden kann. Die Modellkarte enthält keine strenge Weigerungsebene (Refusal Layer) wie man sie von Chatmodellen kennt; die lokale Generierung hängt somit maßgeblich von den vom Nutzer verwendeten Workflows und Sicherheitsfiltern ab.
Dennoch können gehostete Dienste eigene Sicherheitsprüfungen (Safety Checker) anwenden. Plattformen wie fal und andere API-Anbieter können sensible Ausgaben je nach ihren Richtlinien filtern oder blockieren, selbst wenn das zugrunde liegende Modell offen ist. Wer absolute Freiheit bei NSFW-Inhalten sucht, für den ist die lokale Bereitstellung wichtiger als der reine Modellname.
Bei expliziten Inhalten oder Erotikdarstellungen sollten die Erwartungen realistisch bleiben. Nucleus Image mag lokal zwar permissiv sein, verfügt jedoch noch nicht über ein ebenso ausgereiftes NSFW-LoRA- und -Checkpoint-Ökosystem wie rein auf Anime spezialisierte Communities. Für detaillierte Charakterkonsistenz, spezifische Posen oder nischige Erwachsenenstile sind spezialisierte Modelle wie Anima, von Pony abgeleitete Checkpoints oder Modelle der Illustrious-Familie oft nach wie vor einfacher zu handhaben.
Community- und LoRA-Status
Die Community rund um Nucleus Image befindet sich noch in der Anfangsphase. Auf Hugging Face sind das Modell, zugehörige Demos und API-Seiten sowie erste Community-Ports bereits zu finden, allerdings ist die Anzahl an LoRAs, Fine-Tunes, ComfyUI-Workflows und Prompt-Anleitungen noch deutlich geringer als in den Ökosystemen von SDXL, Pony, Illustrious, Qwen Image oder FLUX.
Dies ist für Anwender von Bedeutung. Ein Modell mag auf dem Papier stark sein, doch die Alltagstauglichkeit hängt entscheidend von der Tiefe des Ökosystems ab: LoRA-Trainer, quantisierte Gewichte, ControlNet-kompatible Werkzeuge, Beispiel-Prompts, Community-Benchmarks und Beiträge zur Fehlerbehebung. Nucleus Image bietet hierfür einen vielversprechenden Startpunkt, hat diese Reifestufe jedoch noch nicht vollständig erreicht.
Häufig gestellte Fragen (FAQ)
Ist Nucleus Image für die kommerzielle Nutzung kostenlos?
Ja. Die offizielle Hugging-Face-Modellkarte listet die Apache-2.0-Lizenz, die sich im Allgemeinen unkompliziert für kommerzielle Zwecke und die Forschung eignet. Unternehmen sollten die Lizenz vor einem Produktionseinsatz dennoch stets intern prüfen.
Wo kann ich Nucleus Image online ausprobieren?
Der einfachste offizielle Weg führt über die Nucleus-Image-Website. Entwickler können zudem auf die gehostete API von fal zurückgreifen.
Kann ich das Modell auf einer 12-GB-GPU ausführen?
Das offizielle Vollmodell ist für 12 GB VRAM ungeeignet. Gehostete Inferenzen, MLX- oder quantisierte Community-Builds sowie kleinere Bildmodelle stellen hier die realistischere Alternative dar.
Ist das Modell besser als Qwen Image?
Nicht in jedem Anwendungsbereich. Nucleus Image punktet bei offener Lizenzierung und Sparse-MoE-Effizienz, während Qwen Image besonders bei der Textdarstellung, dichten Layouts und Bearbeitungs-Workflows seine Stärken ausspielt.
Wird NSFW unterstützt?
Die lokale Nutzung verhält sich permissiver als bei vielen geschlossenen Plattformen, allerdings können gehostete APIs entsprechende Ausgaben filtern. Das zugehörige NSFW-Community-Ökosystem ist noch sehr jung.
Eignet sich das Modell gut für Anime?
Es kann zwar stilisierte Bilder erzeugen, aber dedizierte Animemodelle bieten in der Regel eine bessere Tag-Kontrolle, tiefgreifenderes Charakterwissen und eine umfassendere LoRA-Unterstützung.
Quellen
- Offizielle Website von Nucleus Image
- NucleusAI/Nucleus-Image auf Hugging Face
- Offizielles GitHub-Repository
- Technischer Bericht zu Nucleus-Image auf arXiv
- Nucleus Image API von fal
- MLX-Community-Build
Fazit
Nucleus Image ist ein ernstzunehmendes Open-Source-Bildmodell und weit mehr als nur ein weiterer Checkpoint. Das Sparse-MoE-Design, die Apache-2.0-Lizenz, die Diffusers-Unterstützung und starke offizielle Benchmark-Ergebnisse machen es zu einer der wichtigsten Neuerscheinungen im Bereich lokaler KI-Bildmodelle, die man im Auge behalten sollte.
Zu den idealen Anwendern gehören Entwickler, Forschende, Workflow-Entwickler und kommerzielle Teams, die großen Wert auf offene Gewichte und Lizenzen legen. Als Einschränkungen gelten vor allem die Hardware-Anforderungen, die frühe Entwicklungsstufe des Ökosystems sowie die Tatsache, dass das Thema NSFW eher eine Frage der lokalen Kontrolle als einer ausgefeilten Erwachsenen-Community ist.
Wer ein ausgefeiltes kommerzielles Web-Tool sucht, für den fühlen sich NovelAI V5 oder andere Onlinedienste vermutlich unkomplizierter an. Wer jedoch ein offenes Modell sucht, das sich zu einer starken Basis für zukünftige LoRAs, Quantisierungen und individuelle Bild-Pipelines entwickeln könnte, sollte sich Nucleus Image definitiv genauer ansehen.