Cloud-GPU als KI-Workstation: Bilder, Videos, LLMs und NSFW-Grenzen (2026)
ComfyUI und SillyTavern mit gemieteter GPU einrichten: Kosten, VRAM, Videos, Sprachmodelle, Datenspeicherung und NSFW-Grenzen erklärt.
Ein gewöhnlicher Laptop kann eine KI-Workstation auf einer gemieteten GPU steuern: ComfyUI erzeugt Bilder und Videos, ein Sprachmodell-Server liefert Antworten und SillyTavern verwaltet Charaktere. Für gelegentliche Projekte spart das eine große Hardwareanschaffung. Dafür übernehmen Sie Einrichtung, Speicherverwaltung, Zugriffsschutz und das rechtzeitige Abschalten.
Was Sie mit einer Cloud-GPU tatsächlich mieten
Beginnen Sie mit einer GPU, persistentem Speicher und jeweils einer Aufgabe. Modelle und Berechnung liegen auf dem Server; der Browser dient zur Steuerung. SillyTavern kann samt Charakterkarten und Chats auf Ihrem Rechner bleiben, während KoboldCpp das entfernte Modell ausführt.
GPU-Miete enthält nicht automatisch Modelle, kommerzielle Nutzungsrechte, eine Freigabe für Erwachseneninhalte oder einen vollständigen Remote-Desktop. ComfyUI organisiert Abläufe, KoboldCpp führt das LLM aus und SillyTavern stellt die Gesprächsoberfläche bereit. Für wenige fertige Bilder ist ein betreuter Onlinedienst oft einfacher.
| Variante | Passend für | Wichtigster Nachteil |
|---|---|---|
| Fertiger KI-Dienst | Schnelle Ergebnisse | Modelle, Kontingente und Regeln des Anbieters |
| Gemietete GPU | Eigene Gewichte und Workflows | Einrichtung, Speicherung und Zugriff |
| Eigene GPU | Häufige Nutzung und lokale Kontrolle | Kaufpreis, Strom, Wärme und VRAM-Grenze |
Runpod oder Vast.ai?
Runpod bietet eine offizielle ComfyUI-Vorlage und eine Pod-Anleitung und eignet sich deshalb als Einstieg. Für interaktive Arbeit wählen Sie einen On-Demand-Pod. Ein Serverless-Endpunkt ist keine gleichartige dauerhafte Arbeitsumgebung. Blackwell-GPUs wie die RTX 5090 benötigen die passende Vorlage.
Vast.ai eignet sich für Nutzer, die einzelne Maschinenangebote beurteilen können. Prüfen Sie Host-Zuverlässigkeit, Standort, RAM, Speicher, Transferkosten und Mietbedingungen gemeinsam. Unterbrechbare Instanzen können für wiederholbare Stapelaufgaben passen, sind aber kein guter Einstieg für lange ungesicherte Sitzungen. Einen universellen Stundenpreis gibt es nicht.
Prüfen Sie die Zusammenfassung vor dem Start. Langsame Datenträger, unpassende CUDA-Versionen und wiederholte Modelldownloads können den günstigen GPU-Preis aufzehren. Beginnen Sie mit einer kurzen Prüfung und kleinem Budget.


Runpod · ComfyUI · Vast.ai · Pricing
Wie viel VRAM und Speicher brauchen Sie?
Die Werte sind Planungshilfen, keine Garantie für jedes Modell. Quantisierung, Auflösung, Bildanzahl, Stapelgröße und Kontext verändern den Bedarf. System-RAM ist nicht gleich VRAM: CPU-Offloading kann einen Speicherfehler verhindern und gleichzeitig stark bremsen.
Für eine erste gemischte Umgebung sind 24 GB VRAM ein sinnvoller Ausgangspunkt. Planen Sie zunächst etwa 100–200 GB Datenspeicher für ausgewählte Gewichte, Caches und Ergebnisse und prüfen Sie die tatsächlichen Dateigrößen. Zwei einzeln passende Modelle müssen nicht gleichzeitig hineinpassen.
| Aufgabe | Ausgangspunkt | Beachten |
|---|---|---|
| Einfache Bilder | 12–24 GB VRAM | Bearbeitung, ControlNet und große Stapel brauchen mehr |
| Wan2.2 TI2V-5B | 24 GB mit dokumentiertem Offloading | Nicht auf jedes Videomodell übertragbar |
| Quantisiertes 7B–14B-LLM | 16–24 GB mit Reserve | Kontext und KV-Cache benötigen Zusatzspeicher |
| Größere Modelle/lange Videos | 48–80 GB erwägen | Den konkreten Workflow prüfen |
Kosten: Einrichtung und Leerlauf zählen mit
Am 29. September 2026 zeigt Runpods Pods-Preisseite für die RTX A5000 24 GB 0,27 US-Dollar/h, für die RTX 4090 24 GB 0,74 US-Dollar/h und für die RTX 5090 32 GB 0,99 US-Dollar/h. Das sind Referenzpreise ohne Verfügbarkeits- oder Angebotsgarantie. Serverless wird separat bepreist.
Beim Referenzkurs vom 28. September von 1 EUR = 1,1378 USD entspricht das rund 0,24 €, 0,65 € und 0,87 €/h. Es handelt sich nicht um offizielle Europreise. Kartenkurs, Steuern und Gebühren können den Zahlbetrag verändern.
Beispiel: 20 Stunden 4090 zu 0,74 USD plus ein Standard-Netzwerkvolume mit 100 GB zu 0,07 USD/GB/Monat ergeben 21,80 USD oder etwa 19,16 €. Weitere Datenträger, Steuern und gegebenenfalls Transfer sind nicht enthalten. 720 Stunden Dauerbetrieb kosten allein für diese GPU 532,80 USD. Downloads und Denkpausen zählen zur Laufzeit.
Budget = Stunden × Tarif + aufbewahrter Speicher + anfallender Transfer + Steuern/Gebühren. Runpod nennt für Volume Disks 0,10 USD/GB/Monat im Betrieb und 0,20 USD im Stoppzustand; Standard-Netzwerkvolumes unter 1 TB liegen bei 0,07 USD. Vergleichen Sie einen GPU-Kauf anhand eigener Nutzungsstunden samt Strom und Wartung.
Runpod · Pricing · Runpod · Storage · Banque de France · 28/09/2026
Zuerst einen einfachen Bildworkflow einrichten
Prüfen Sie Bildausgabe, Download und Workflow-Speicherung, bevor Sie Video und Chat ergänzen. Dies ist eine Einrichtungsanleitung, kein gemessener Benchmark einer kostenpflichtigen Instanz.
- Konto anlegen und eine Kostenerinnerung setzen. Für SSH-Tunnel den öffentlichen Schlüssel hinterlegen sowie Region und GPU-Verfügbarkeit prüfen.
- Offizielle ComfyUI-Vorlage von Runpod wählen, bei RTX 5090/B200 die Blackwell Edition. Vor dem On-Demand-Start GPU, RAM, Datenträger und Ports kontrollieren.
- Persistenten Speicher vor dem Modelldownload verbinden. Mount-Pfad prüfen und Modelle, Workflows und Ergebnisse dort ablegen; der Name /workspace allein garantiert keine Persistenz.
- Initialisierung und Logs prüfen. HTTP-Zugriff auf Authentifizierung kontrollieren: Eine schwer erratbare URL ist kein Zugriffsschutz. Für private Arbeit SSH-Tunnel verwenden und unnötige öffentliche HTTP-Ports entfernen.
- Workflow → Browse Templates öffnen oder einen offiziellen modellspezifischen Workflow importieren. Checkpoint, Textencoder und VAE auf dem Server installieren; ein Browserdownload landet möglicherweise nur auf dem Laptop.
- Ein Bild mit Standardmaßen erzeugen. Ergebnis und Workflow-JSON herunterladen, Speicherorte prüfen und erst danach den Pod stoppen.
Erster Bildtest
Eine Keramikteekanne auf einem Holztisch am Fenster, weiches Morgenlicht, neutraler Hintergrund, realistisches Produktfoto.
Runpod · ComfyUI · ComfyUI · Text to Image · Runpod · SSH
Das Network Volume bei der Pod-Erstellung auswählen; es wird nicht nachträglich an einen bestehenden Pod angehängt. Dieser Tunnel setzt voraus, dass der SSH-Server ComfyUI unter 127.0.0.1:8188 erreicht. Platzhalter ersetzen, Terminal geöffnet lassen und auf diesem Rechner http://127.0.0.1:8188 öffnen. ComfyUI muss bereits laufen; keine zweite Kopie am selben Port starten.
ssh -N -L 127.0.0.1:8188:127.0.0.1:8188 -p SSH_PORT -i KEY_PATH USER@POD_IP Video mit einem passenden Wan2.2-Workflow ergänzen
ComfyUI stellt Wan2.2-Workflows und Links zu den Komponenten bereit. Das TI2V-5B-Repository dokumentiert einen 720p-Weg mit mindestens 24 GB, Modell-Offloading und Textencoder auf der CPU. Daraus folgt nicht, dass ein anderer 14B-Videoworkflow denselben Bedarf hat.
TI2V-5B-Beispiel importieren, alle Komponenten in die angegebenen Ordner legen und beim ersten Test unterstützte Abmessungen und Bildzahlen beibehalten. Vor langen Warteschlangen einen kurzen Clip erstellen. Bei Bild-zu-Video nur ein zulässiges Ausgangsbild hochladen und die Bewegung beschreiben.
Seed, Modelldateinamen, Workflow und Ergebnis gemeinsam sichern. GPUs mit gleichen Einstellungen vergleichen und Download sowie Erstladen getrennt betrachten. Partner/API-Nodes können kostenpflichtige externe Dienste aufrufen, statt Ihre gemietete GPU zu verwenden.
ComfyUI dokumentiert außerdem eine optimierte 5B-Konfiguration mit nativem Offloading ab 8 GB. Sie unterscheidet sich vom 24-GB-Beispiel des Modellprojekts; weniger Speicherbedarf garantiert nicht dieselbe Geschwindigkeit.
Bewegung im Video
Die Kamera bewegt sich langsam auf die Teekanne zu. Dampf steigt sanft auf, Tisch und Hintergrund bleiben still. Gleichmäßiges Tageslicht.

SillyTavern mit dem entfernten LLM verbinden
Wenn SillyTavern auf Ihrem Rechner bleibt, überstehen Charaktere und Chats einen Wechsel der GPU-Instanz leichter. Die Modellanfragen werden trotzdem auf fremder Infrastruktur verarbeitet.
Auf einem CUDA-kompatiblen Linux-System den offiziellen Linux-Build von KoboldCpp und ein GGUF mit nachvollziehbarer Herkunft herunterladen. Lizenz und Architekturunterstützung prüfen. Das Beispiel setzt den Programmnamen koboldcpp-linux-x64 und /workspace/models/model.gguf voraus. Mit 4096 Kontexttokens und automatischer Layer-Anpassung starten; GPU-Nutzung in den Logs kontrollieren.
chmod +x ./koboldcpp-linux-x64 ./koboldcpp-linux-x64 --model /workspace/models/model.gguf --usecuda --gpulayers -1 --contextsize 4096 --host 127.0.0.1 --port 5001 Der Dienst lauscht nur auf seinem eigenen Loopback. Auf Ihrem Rechner den folgenden Tunnel mit den vollständigen SSH/TCP-Daten des Anbieters anpassen. SSH_PORT, KEY_PATH, USER und POD_IP sind Platzhalter. SSH und KoboldCpp müssen für dieses Ziel denselben Netzwerk-Namensraum verwenden.
ssh -N -L 127.0.0.1:5001:127.0.0.1:5001 -p SSH_PORT -i KEY_PATH USER@POD_IP - SSH-Terminal geöffnet lassen. Auf Ihrem Rechner http://127.0.0.1:5001 aufrufen und eine kurze Nachricht testen, bevor SillyTavern konfiguriert wird.
- Unter Windows Node.js LTS und Git installieren. Den release-Zweig von SillyTavern in einem beschreibbaren Ordner ablegen und Start.bat ohne Administratorrechte starten.
- Unter API Connections Text Completion → KoboldCpp wählen, http://127.0.0.1:5001/ eintragen und Connect anklicken. Bei diesem Weg kein /v1 ergänzen.
- Einfachen Charakter testen, das passende Prompt-Format wählen und das Kontextlimit innerhalb der Backend-Einstellung halten. Karten und Chats lokal sichern.


KoboldCpp · Releases · KoboldCpp · SillyTavern · Windows · SillyTavern · API · Runpod · SSH
NSFW: technische Freiheit ist keine Erlaubnis
Eigene Gewichte und Komponenten bieten Spielraum, aber keinen universellen NSFW-Schalter. Ein Modell kann Erwachseneninhalte ablehnen, schlecht umsetzen oder Lizenzbeschränkungen enthalten. Charakterkarten ändern weder Host- noch API-Regeln.
Runpods Bedingungen beschränken obszöne und anzügliche Inhalte; auch Vast.ai untersagt das Speichern oder Übertragen obszöner Inhalte über seine Dienste. Keiner der beiden Anbieter ist deshalb als uneingeschränktes Adult-Hosting zu empfehlen. Klären Sie den konkreten zulässigen Anwendungsfall vor einer Zahlung.
Prüfen Sie Host-Regeln, Modelllizenz, externe APIs und Veröffentlichungsplattform getrennt. Ein vollständig lokaler Rechner entfernt die Cloud-Host-Ebene, nicht die anderen Verpflichtungen.
| Frage | Bewertung |
|---|---|
| Garantieren ComfyUI oder SillyTavern NSFW? | Nein. Das Verhalten hängt von Modell und Backend ab. |
| Offene Gewichte = freie Nutzung? | Nein. Die konkrete Lizenz bleibt maßgeblich. |
| Ist die Cloud vollständig privat? | Nein. Zugriff absichern und unnötige sensible Uploads vermeiden. |
Runpod · Terms · Vast.ai · Terms
Sichern, abschalten und Fehler eingrenzen
JSON, Node-Versionen, Modellnamen und Lizenzen, Seeds, Prompts, Charaktere und wichtige Ausgaben sichern. Keine API-Schlüssel in geteilten Workflows lassen. Vor dem Löschen der Instanz ein Backup herunterladen.
Bei Runpod kann die Container Disk beim Stoppen Daten verlieren; die Volume Disk bleibt beim Stoppen erhalten, wird aber mit dem Pod gelöscht. Ein Network Volume hat einen eigenen Lebenszyklus und eigene Kosten. Compute stoppen und gespeicherte Volumes separat prüfen. Beim Neustart ist dieselbe GPU-Verfügbarkeit nicht garantiert.
| Problem | Erster Check |
|---|---|
| Speicherfehler | Andere Modelle entladen, Stapel, Kontext oder Frames reduzieren |
| Fehlende Nodes/Gewichte | Workflow-Version und genaue Pfade prüfen |
| SillyTavern verbindet nicht | Backend, SSH-Tunnel, dann URL prüfen |
| Langsame Ausgabe | GPU-Auslastung, CPU-Offloading, Erstladen und Datenträger |
| Weiterlaufende Kosten | Browser schließen stoppt die Instanz nicht |
Häufige Fragen und Fazit
Brauche ich zu Hause einen starken PC?
Für diesen Aufbau nicht. Eine stabile Verbindung, Platz für Backups und ein Rechner für die Oberfläche sind nötig. Große Videodateien machen die Übertragungsrate wichtig.
Reicht eine GPU für alle Aufgaben?
Nacheinander ja, sofern jedes Modell hineinpasst. Gleichzeitiger Betrieb benötigt mehr VRAM; vorherige Modelle beim Wechsel entladen.
Sind zwei 24-GB-GPUs wie eine mit 48 GB?
Nicht automatisch. Die Software muss das Modell aufteilen können, und Kommunikation kostet Leistung. Eine ausreichend große einzelne GPU vereinfacht den Einstieg.
Geht das am Smartphone?
Eine geschützte Weboberfläche lässt sich bedienen. Der localhost-Tunnel gehört aber zum ausführenden Rechner. Für das Handy einen eigenen sicheren Zugang vorsehen, keinen ungeschützten Dienst veröffentlichen.
Darf ich Ergebnisse verkaufen?
Das hängt von Lizenz, Eingaberechten, Hosting-Bedingungen und Verwendungszweck ab. Die GPU-Miete kauft keine allgemeinen kommerziellen Modellrechte.
Ist Mieten günstiger als ein Abo?
Bei gelegentlicher gebündelter Nutzung möglicherweise. Einrichtung, Leerlauf und Speicher mitzählen; wer keine Software warten möchte, fährt mit einem betreuten Dienst oft besser.
Beginnen Sie mit einem reproduzierbaren Bildworkflow auf 24 GB, prüfen Sie die Datenerhaltung und berechnen Sie Kosten pro brauchbarem Ergebnis. Erst dann Video ergänzen, damit Fehler leichter zuzuordnen sind.
Für Charakter-Chats bleiben SillyTavern und Backups auf Ihrem Rechner; der entfernte Backend-Zugang wird abgesichert. Größere Hardware nach Bedarf wählen und NSFW-Erlaubnis unabhängig von der Rechenleistung prüfen.