Nucleus Image Review: 17B Sparse MoE, lokales Setup, NSFW-Unterstützung und Apache-2.0-Open-Weights

Nucleus Image zählt zu den spannendsten Open-Source-Bildmodellen des Jahres 2026, da es ein Sparse-Mixture-of-Experts-Design (MoE) in die Diffusionsbasierte Text-zu-Bild-Generierung integriert. Statt eines schlichten Checkpoints im…

schedule
article 10 Min. Lesezeit

Nucleus Image zählt zu den spannendsten Open-Source-Bildmodellen des Jahres 2026, da es ein Sparse-Mixture-of-Experts-Design (MoE) in die Diffusionsbasierte Text-zu-Bild-Generierung integriert. Statt eines schlichten Checkpoints im SDXL-Stil handelt es sich hierbei um einen Sparse MoE Diffusion Transformer mit insgesamt 17 Milliarden Parametern, von denen bei jedem Forward-Pass lediglich rund 2 Milliarden aktiv sind.

Kurz gefasst: Nucleus Image ist äußerst attraktiv, wenn Sie ein unter der Apache-2.0-Lizenz stehendes, vollständig offenes und kommerziell nutzbares Bildmodell suchen, das eine hohe universelle Qualität mit effizientem Inferenz-Design verbindet. Weniger ideal ist es hingegen, wenn Sie primär ein ausgereiftes Anime-LoRA-Ökosystem, integrierte Bildbearbeitungswerkzeuge oder eine ausgefeilte Benutzeroberfläche für Endanwender wie bei NovelAI benötigen.

Was NSFW-Inhalte betrifft, so ist die Situation hier offener als bei stark eingeschränkten geschlossenen Plattformen, insbesondere bei lokaler Ausführung. Dennoch bleibt es ein grundlegendes Text-zu-Bild-Modell und kein spezialisiertes Erotik- oder Animemodell. Kontrolle, Charakterkonsistenz und Community-Ressourcen für diesen Bereich sind daher noch lange nicht so tief entwickelt wie in etablierten Ökosystemen wie Anima oder von Pony abgeleiteten Checkpoints.

Schnellfazit

Eigenschaft Nucleus Image im Test
Am besten geeignet für Allgemeine Open-Source-Bildgenerierung, kommerzielle Nutzung, Forschung, Diffusers-Workflows sowie effiziente und hochwertige Text-zu-Bild-Erstellung
Modelltyp Sparse MoE Diffusion Transformer
Parameter 17 Milliarden insgesamt, ca. 2 Milliarden aktiv pro Forward-Pass
Lizenz Apache 2.0
Online-Nutzung Offizielle Nucleus-Image-Website und fal-API
Lokale Nutzung Diffusers; MLX-Community-Build für Apple Silicon
NSFW Lokal offener als geschlossene Tools, aber kein ausgereiftes dediziertes NSFW-Ökosystem

Wenn Sie lokale beziehungsweise offene Bildmodelle vergleichen, lesen Sie auch unsere Testberichte zu Qwen Image, Anima, NovelAI V5 und Flux 3. Nucleus Image positioniert sich dabei am ehesten in der Kategorie der effizienten offenen Basismodelle.

Was ist Nucleus Image?

Screenshot der offiziellen Nucleus-Image-Website
Die offizielle Website präsentiert Nucleus Image als den ersten Sparse MoE Diffusion Transformer mit insgesamt 17 Milliarden Parametern und rund 2 Milliarden aktiven Parametern.

Nucleus Image ist ein Text-zu-Bild-Generierungsmodell von NucleusAI. In der offiziellen Modellkarte wird es als Sparse MoE Diffusion Transformer beschrieben, der 17 Milliarden Gesamtparameter, 64 geroutete Experten pro MoE-Schicht, einen gemeinsamen Experten (Shared Expert), 32 Transformer-Schichten sowie Qwen3-VL-8B-Instruct als Text-Encoder nutzt.

Der Kernansatz liegt in der Effizienz. Dank Sparse MoE kann das Modell eine hohe Gesamtkapazität aufweisen, während bei jedem einzelnen Forward-Pass nur ein Bruchteil des Netzwerks aktiviert wird. Dies unterscheidet es von dichten Modellen, bei denen jedes Mal das gesamte Modell zum Einsatz kommt. Für die Bildgenerierung könnte dies ein bedeutsamer Trend sein, da die Qualität stetig steigt, während die Kosten für die lokale Inferenz immer schwerer zu ignorieren sind.

Zudem ist das Modell bemerkenswert, da es sich um ein reines Basismodell handelt. Laut der offiziellen Beschreibung basieren die ausgewiesenen Benchmark-Ergebnisse ausschließlich auf dem Vortraining, gänzlich ohne DPO, Reinforcement Learning oder menschliche Präferenzabstimmung. Das macht das Modell zwar äußerst nützlich für die Forschung und nachfolgende Feinabstimmungen (Fine-Tuning), bedeutet aber auch, dass das Rohmodell gegebenenfalls ein präzises Prompting oder Workflow-Anpassungen erfordert.

Offizielle Website, API und Download-Links

Screenshot der Hugging-Face-Modellseite von Nucleus Image
Die Hugging-Face-Seite zeigt die Apache-2.0-Lizenz, den Diffusers-Tag, die Text-zu-Bild-Pipeline sowie die offiziellen Modelldateien.

Sie können das Modell direkt auf der offiziellen Nucleus-Image-Website ausprobieren. Für die lokale Nutzung und Downloads ist die Hauptanlaufstelle NucleusAI/Nucleus-Image auf Hugging Face. Zudem steht das Projekt über das offizielle GitHub-Repository zur Verfügung.

Entwickler, die eine gehostete Inferenz bevorzugen, können die Nucleus-Image-API von fal nutzen. fal stellt eine warteschlangenbasierte API samt JavaScript- und Node-Beispielen bereit, was besonders praktisch ist, wenn Sie Nucleus Image in eine Webanwendung integrieren möchten, ohne einen eigenen GPU-Server betreiben zu müssen.

Screenshot der fal-API-Dokumentation für Nucleus Image
fal bietet eine gehostete Inferenz für Nucleus Image mit API-Beispielen, Warteschlangenverwaltung, Authentifizierung und Details zum Ausgabeschema.

Nutzer von Apple Silicon sollten zudem Community-Ports wie mlx-community/Nucleus-Image-4bit im Auge behalten. Dies ersetzt zwar nicht das offizielle Modell, ist aber nützlich für Anleger, die auf Mac-Hardware experimentieren möchten.

Funktionen und Technische Daten

Nucleus Image wurde für verschiedene Seitenverhältnisse und gängige Anwendungsfälle der Bildgenerierung trainiert: Portraits, Produktfotografie, Architektur, Natur, surreale Szenen, Fantasy-Art, typografieähnliche Layouts sowie alltägliche kommerzielle Bildmotive. Es handelt sich folglich nicht nur um einen reinen Anime-Checkpoint oder ein spezialisiertes Fotomodell.

Technische Daten Wert
Gesamtparameter 17 Milliarden
Aktive Parameter Ca. 2 Milliarden pro Forward-Pass
Architektur Sparse MoE Diffusion Transformer
Schichten 32
Experten 64 geroutete Experten plus 1 gemeinsamer Experte pro MoE-Schicht
Text-Encoder Qwen3-VL-8B-Instruct
Bild-Tokenizer Qwen-Image VAE
Trainingsdaten Ca. 700 Millionen Bilder und 1,5 Milliarden Beschriftungspaare (Caption Pairs)
Trainingsphasen Progressive Auflösung von 256 → 512 → 1024
Empfohlene Sampling-Einstellungen Offizieller Schnellstart verwendet 50 Schritte und eine Guidance-Skala von 4,0

Die Modellkarte weist starke Benchmark-Ergebnisse auf, darunter GenEval 0.87, DPG-Bench 88,79 und OneIG-Bench 0,522. Zwar garantieren Benchmarks nicht, dass jeder Prompt besser aussieht als bei der Konkurrenz, sie untermauern jedoch die Aussage, dass es sich bei Nucleus Image keineswegs um ein bloßes experimentelles Spielzeugmodell handelt.

Bildqualität und Praxiseinsatz

Praktisch betrachtet ist Nucleus Image besonders für jene Anwender interessant, die ein hochwertiges offenes Basismodell für vielfältige Prompts suchen. Die offiziellen Beispiele decken Menschen, Fantasy, kommerzielle Bilder, Lebensmittel, Architektur, produktaffine Szenen und vieles mehr ab. Diese Bandbreite ist wichtig, da viele lokale Bildmodelle zwar in einem bestimmten Stil exzellent, außerhalb davon jedoch schwächer aufgestellt sind.

Die potenzielle Schwachstelle liegt in der Reife des Produkts. Verglichen mit NovelAI V5, Midjourney, Seedream oder den APIs von Qwen Image bietet Nucleus Image noch keine vergleichbare, ausgereifte Benutzeroberfläche für Endanwender, keine Stil-Presets, keine Image-to-Image-Tools, kein Inpainting-Interface und auch keine große Community zum Teilen von Prompts. Man arbeitet hier deutlich näher am eigentlichen Modellkern.

Für technische Anwender ist dies jedoch kein Nachteil. Wenn Sie mit Diffusers arbeiten, LoRAs trainieren, Bild-Pipelines aufbauen oder Wert auf die Lizenzierung legen, ist Nucleus Image wesentlich spannender als der nächste geschlossene Webgenerator. Wer hingegen ausschließlich eine unkomplizierte Benutzeroberfläche ohne jeglichen Installationsaufwand sucht, ist mit einem Online-Dienst besser beraten.

Lokale Einrichtung und Hardware

Der offizielle Hugging-Face-Schnellstart setzt auf die neuesten Diffusers, BF16-Ladung, CUDA, TextKVCacheConfig, 50 Inferenzschritte sowie eine Guidance-Skala von 4,0. Zudem werden gängige Seitenverhältnisse wie 1024×1024, 1344×768, 768×1344, 1184×896 und 896×1184 aufgeführt.

Das Sparse-MoE-Prinzip reduziert zwar die aktive Rechenlast, bedeutet jedoch nicht, dass Ihre GPU lediglich 2 Milliarden Parameter speichert. Das Modell umfasst nach wie vor 17 Milliarden Gesamtparameter sowie einen großen Text-Encoder und belegt entsprechenden Arbeitsspeicher zur Laufzeit. Für komfortable Experimente im BF16-Format empfiehlt sich daher als sicherer Ausgangspunkt eine Grafikkarte der 48-GB-Klasse. Eine 24-GB-GPU erfordert gegebenenfalls CPU-Auslagerung (Offload), speichersparende Einstellungen, geringere Auflösungen oder quantisierte Community-Builds. Konfigurationen mit 16 GB VRAM oder weniger sind mit gehosteten APIs oder kleineren Modellen besser bedient.

Hardware Erwartung
8–12 GB VRAM Nicht empfohlen für das offizielle Vollmodell; stattdessen gehostete API nutzen oder auf optimierte Community-Builds warten
16 GB VRAM Nur mit erheblichen Kompromissen möglich, sofern vom Workflow unterstützt
24 GB VRAM Experimentell mit Auslagerung und Optimierungen; nicht der reibungsloseste Weg
48 GB VRAM Realistischer für lokale BF16-Tests
Apple Silicon MLX-Community-Builds prüfen; Geschwindigkeit und Qualität hängen stark von Speicher und Implementierung ab
Gehostete API Bester Weg für schnelle Produkttests

Vergleich mit anderen offenen Bildmodellen

Modell Stärke Schwäche Beste Wahl, wenn…
Nucleus Image Apache 2.0, Sparse-MoE-Effizienz, hohe allgemeine Qualität Jutes Ökosystem, weniger LoRAs und UI-Tools Sie ein offenes Basismodell für Forschung oder kommerzielle Zwecke suchen
Qwen Image 2.0 / 3.0 Starke Textdarstellung, Layouts, mehrsprachige Prompts, Bearbeitungsökosystem Neueste Version 3.0 nur als API; lokale Versionen können speicherintensiv sein Sie Text im Bild oder dokumentähnliche Layouts benötigen
FLUX / Flux 3 Starker Fotorealismus und breites Ökosystem Lizenz- sowie NSFW-/Community-Details hängen von der Version ab Sie ausgereifte lokale Workflows und breite Tool-Unterstützung wünschen
Anima Anime-/Illustrationsstil, Charakterwissen, NSFW-orientierte Community Weniger universell für kommerzielle Bildmotive einsetzbar Sie primär Anime- oder Charakter-Art generieren
Pony / Illustrious / NoobAI Danbooru-Tag-Prompting und ausgereifte Illustrations-LoRA-Kultur Weniger natürlich für allgemeine Produkt- oder Fotoprompts Sie Anime-, Furry-, Charakter- oder Tag-basierte Kontrolle benötigen
Stable Diffusion XL (Ökosystem) Riesige LoRA- und Checkpoint-Bibliothek Ältere Basisqualität und geringeres Textverständnis Kompatibilität wichtiger ist als modernste Spitzenqualität

Der wichtigste Unterschied besteht darin, dass es sich bei Nucleus Image um die Veröffentlichung eines Basismodells und nicht um eine vollständige Kreativplattform handelt. Der wahre Wert des Modells wächst, sobald die Community LoRAs, ComfyUI-Knoten, Quantisierungen, Workflows und feingetunte Checkpoints darum herum aufbaut.

NSFW-Unterstützung

Nucleus Image zeigt sich offener als viele geschlossene kommerzielle Generatoren, da es sich beim offiziellen Release um ein Basismodell handelt, das lokal ausgeführt werden kann. Die Modellkarte enthält keine strenge Weigerungsebene (Refusal Layer) wie man sie von Chatmodellen kennt; die lokale Generierung hängt somit maßgeblich von den vom Nutzer verwendeten Workflows und Sicherheitsfiltern ab.

Dennoch können gehostete Dienste eigene Sicherheitsprüfungen (Safety Checker) anwenden. Plattformen wie fal und andere API-Anbieter können sensible Ausgaben je nach ihren Richtlinien filtern oder blockieren, selbst wenn das zugrunde liegende Modell offen ist. Wer absolute Freiheit bei NSFW-Inhalten sucht, für den ist die lokale Bereitstellung wichtiger als der reine Modellname.

Bei expliziten Inhalten oder Erotikdarstellungen sollten die Erwartungen realistisch bleiben. Nucleus Image mag lokal zwar permissiv sein, verfügt jedoch noch nicht über ein ebenso ausgereiftes NSFW-LoRA- und -Checkpoint-Ökosystem wie rein auf Anime spezialisierte Communities. Für detaillierte Charakterkonsistenz, spezifische Posen oder nischige Erwachsenenstile sind spezialisierte Modelle wie Anima, von Pony abgeleitete Checkpoints oder Modelle der Illustrious-Familie oft nach wie vor einfacher zu handhaben.

Community- und LoRA-Status

Die Community rund um Nucleus Image befindet sich noch in der Anfangsphase. Auf Hugging Face sind das Modell, zugehörige Demos und API-Seiten sowie erste Community-Ports bereits zu finden, allerdings ist die Anzahl an LoRAs, Fine-Tunes, ComfyUI-Workflows und Prompt-Anleitungen noch deutlich geringer als in den Ökosystemen von SDXL, Pony, Illustrious, Qwen Image oder FLUX.

Dies ist für Anwender von Bedeutung. Ein Modell mag auf dem Papier stark sein, doch die Alltagstauglichkeit hängt entscheidend von der Tiefe des Ökosystems ab: LoRA-Trainer, quantisierte Gewichte, ControlNet-kompatible Werkzeuge, Beispiel-Prompts, Community-Benchmarks und Beiträge zur Fehlerbehebung. Nucleus Image bietet hierfür einen vielversprechenden Startpunkt, hat diese Reifestufe jedoch noch nicht vollständig erreicht.

Häufig gestellte Fragen (FAQ)

Ist Nucleus Image für die kommerzielle Nutzung kostenlos?

Ja. Die offizielle Hugging-Face-Modellkarte listet die Apache-2.0-Lizenz, die sich im Allgemeinen unkompliziert für kommerzielle Zwecke und die Forschung eignet. Unternehmen sollten die Lizenz vor einem Produktionseinsatz dennoch stets intern prüfen.

Wo kann ich Nucleus Image online ausprobieren?

Der einfachste offizielle Weg führt über die Nucleus-Image-Website. Entwickler können zudem auf die gehostete API von fal zurückgreifen.

Kann ich das Modell auf einer 12-GB-GPU ausführen?

Das offizielle Vollmodell ist für 12 GB VRAM ungeeignet. Gehostete Inferenzen, MLX- oder quantisierte Community-Builds sowie kleinere Bildmodelle stellen hier die realistischere Alternative dar.

Ist das Modell besser als Qwen Image?

Nicht in jedem Anwendungsbereich. Nucleus Image punktet bei offener Lizenzierung und Sparse-MoE-Effizienz, während Qwen Image besonders bei der Textdarstellung, dichten Layouts und Bearbeitungs-Workflows seine Stärken ausspielt.

Wird NSFW unterstützt?

Die lokale Nutzung verhält sich permissiver als bei vielen geschlossenen Plattformen, allerdings können gehostete APIs entsprechende Ausgaben filtern. Das zugehörige NSFW-Community-Ökosystem ist noch sehr jung.

Eignet sich das Modell gut für Anime?

Es kann zwar stilisierte Bilder erzeugen, aber dedizierte Animemodelle bieten in der Regel eine bessere Tag-Kontrolle, tiefgreifenderes Charakterwissen und eine umfassendere LoRA-Unterstützung.

Quellen

Fazit

Nucleus Image ist ein ernstzunehmendes Open-Source-Bildmodell und weit mehr als nur ein weiterer Checkpoint. Das Sparse-MoE-Design, die Apache-2.0-Lizenz, die Diffusers-Unterstützung und starke offizielle Benchmark-Ergebnisse machen es zu einer der wichtigsten Neuerscheinungen im Bereich lokaler KI-Bildmodelle, die man im Auge behalten sollte.

Zu den idealen Anwendern gehören Entwickler, Forschende, Workflow-Entwickler und kommerzielle Teams, die großen Wert auf offene Gewichte und Lizenzen legen. Als Einschränkungen gelten vor allem die Hardware-Anforderungen, die frühe Entwicklungsstufe des Ökosystems sowie die Tatsache, dass das Thema NSFW eher eine Frage der lokalen Kontrolle als einer ausgefeilten Erwachsenen-Community ist.

Wer ein ausgefeiltes kommerzielles Web-Tool sucht, für den fühlen sich NovelAI V5 oder andere Onlinedienste vermutlich unkomplizierter an. Wer jedoch ein offenes Modell sucht, das sich zu einer starken Basis für zukünftige LoRAs, Quantisierungen und individuelle Bild-Pipelines entwickeln könnte, sollte sich Nucleus Image definitiv genauer ansehen.

Bewertungs-Tags

#Apache 2.0 #Diffusers #KI-Bildgenerierung #Local AI #NSFW #Nucleus Image #NucleusAI #Sparse MoE

Anmelden

ODER

Konto erstellen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten

ODER

Passwort Vergessen

Passwort muss 8-20 Zeichen lang sein und Buchstaben und Zahlen enthalten