Créer une station IA avec un GPU cloud : images, vidéo, LLM et limites NSFW (2026)

Configurez ComfyUI et SillyTavern avec un GPU loué : coûts, VRAM, génération vidéo, modèles de langage, stockage et limites NSFW.

schedule
article 12 min de lecture
Créer une station IA avec un GPU cloud : images, vidéo, LLM et limites NSFW (2026)

Un ordinateur portable ordinaire peut piloter une station IA sur un GPU loué : ComfyUI pour les images et les vidéos, un serveur de modèle de langage et SillyTavern pour les personnages. Cette solution évite un achat matériel important pour un usage occasionnel. En contrepartie, vous gérez l’installation, le stockage, la sécurité et l’arrêt de la machine.

Ce que vous louez réellement

Commencez avec un GPU, du stockage persistant et une seule charge à la fois. Les poids et le calcul restent sur le serveur ; votre navigateur sert de commande. SillyTavern peut rester sur votre ordinateur avec les personnages et les conversations, tandis que KoboldCpp exécute le modèle distant.

La location ne fournit pas automatiquement les modèles, les droits commerciaux, une autorisation de contenu adulte ou un bureau distant complet. ComfyUI organise les traitements, KoboldCpp exécute le LLM et SillyTavern gère l’interface. Un service en ligne reste souvent plus simple pour quelques images prêtes à l’emploi.

Solution Usage adapté Contrainte principale
Service IA géré Obtenir rapidement un résultat Modèles, quotas et règles du fournisseur
GPU loué Poids et workflows personnalisés Installation, stockage et accès
GPU personnel Usage fréquent et contrôle local Achat, électricité, chaleur et VRAM

Runpod ou Vast.ai : choisir selon votre autonomie

Runpod fournit un modèle de déploiement ComfyUI officiel et un guide pour ses Pods : c’est un point de départ pratique. Pour travailler de façon interactive, choisissez un Pod On-Demand. Un endpoint Serverless n’est pas l’équivalent d’une station persistante. Une RTX 5090 demande le modèle Blackwell correspondant.

Vast.ai convient aux lecteurs capables d’évaluer chaque offre : fiabilité de l’hôte, localisation, RAM, disque, transfert et conditions de location. Une instance interruptible peut servir aux lots récupérables, mais convient mal à une première installation ou à un rendu long non sauvegardé. Il n’existe pas de tarif horaire universel.

Vérifiez le récapitulatif avant le démarrage. Un disque lent, une incompatibilité CUDA ou des téléchargements répétés peuvent annuler l’économie affichée. Prévoyez une première session courte avec un petit budget.

Guide officiel Runpod pour déployer ComfyUI.
Guide officiel Runpod pour déployer ComfyUI. Runpod
Site officiel de location de GPU Vast.ai.
Site officiel de location de GPU Vast.ai. Vast.ai

Runpod · ComfyUI · Vast.ai · Pricing

Quelle VRAM et combien de stockage prévoir ?

Ces fourchettes servent à préparer la configuration, sans garantir tous les modèles. Quantification, résolution, nombre d’images vidéo, lots et contexte modifient la mémoire nécessaire. La RAM système ne remplace pas la VRAM à vitesse égale : le déchargement vers le CPU peut fortement ralentir le traitement.

Pour un premier usage mixte, 24 Go de VRAM constituent une base raisonnable. Prévoyez environ 100 à 200 Go de disque pour quelques poids, caches et résultats, puis vérifiez les tailles réelles. Deux modèles qui tiennent séparément peuvent dépasser la mémoire lorsqu’ils restent chargés ensemble.

Usage Base de départ À vérifier
Images simples 12–24 Go VRAM Édition, ControlNet et gros lots demandent davantage
Wan2.2 TI2V-5B 24 Go avec les réglages d’offload documentés Pas une règle pour tous les modèles vidéo
LLM 7B–14B quantifié 16–24 Go avec une marge Réserver le cache KV et le contexte
Modèles plus grands/vidéos longues Envisager 48–80 Go Vérifier le workflow exact

Wan2.2 · SillyTavern · API

Coûts : l’installation et l’attente sont aussi facturées

Le 29 septembre 2026, la page Pods de Runpod affiche la RTX A5000 24 Go à 0,27 USD/h, la RTX 4090 24 Go à 0,74 USD/h et la RTX 5090 32 Go à 0,99 USD/h. Ce sont des prix de référence, sans garantie de disponibilité ni de devis final. Les tarifs Serverless sont distincts.

Avec le taux de référence du 28 septembre, 1 EUR = 1,1378 USD, cela représente environ 0,24 €, 0,65 € et 0,87 €/h. Ce ne sont pas des tarifs officiels en euros : conversion bancaire, taxes et frais peuvent changer le montant payé.

Exemple : 20 heures de 4090 à 0,74 USD et un volume réseau standard de 100 Go à 0,07 USD/Go/mois donnent 21,80 USD, soit environ 19,16 €, avant autres disques, taxes et transferts éventuels. Une GPU allumée 720 heures revient à 532,80 USD de calcul seul. Téléchargements et temps d’inactivité comptent aussi.

Budget = heures × tarif + stockage conservé + transfert applicable + taxes/frais. Runpod distingue le volume disk actif à 0,10 USD/Go/mois, arrêté à 0,20 USD, et le network volume standard inférieur à 1 To à 0,07 USD. Pour comparer à un achat, partez de vos heures réelles et ajoutez énergie et entretien.

Runpod · Pricing · Runpod · Storage · Banque de France · 28/09/2026

Commencer par générer une image

Vérifiez génération, téléchargement et sauvegarde du workflow avant d’ajouter vidéo et dialogue. Il s’agit d’un guide de configuration, pas d’un benchmark chronométré sur une instance payante.

  1. Créez le compte et un rappel de dépenses. Ajoutez votre clé publique SSH si vous utilisez un tunnel, puis vérifiez région et disponibilité.
  2. Choisissez le modèle ComfyUI officiel de Runpod, ou Blackwell Edition pour RTX 5090/B200. Contrôlez GPU, RAM, disques et ports avant le déploiement On-Demand.
  3. Attachez le stockage persistant avant les téléchargements. Vérifiez le point de montage et placez-y modèles, workflows et résultats : le nom /workspace ne garantit rien à lui seul.
  4. Attendez l’initialisation et consultez les journaux. Vérifiez l’authentification HTTP ; une URL difficile à deviner ne protège pas un service. Pour un usage privé, préférez un tunnel SSH et retirez les ports HTTP publics inutiles.
  5. Ouvrez Workflow → Browse Templates ou importez un exemple officiel propre au modèle. Installez checkpoint, encodeurs et VAE sur le serveur ; un téléchargement dans le navigateur peut seulement arriver sur votre PC.
  6. Lancez une image aux dimensions par défaut. Enregistrez le résultat et le JSON, contrôlez les emplacements puis arrêtez le Pod.

Premier essai

Une théière en céramique sur une table en bois près d’une fenêtre, douce lumière matinale, arrière-plan neutre, photographie de produit réaliste.

Runpod · ComfyUI · ComfyUI · Text to Image · Runpod · SSH

Sélectionnez le network volume lors de la création du Pod : il ne s’ajoute pas ensuite à un Pod existant. Ce tunnel suppose que le serveur SSH accède à ComfyUI sur 127.0.0.1:8188. Remplacez les paramètres, gardez le terminal ouvert et ouvrez http://127.0.0.1:8188 sur cet ordinateur. ComfyUI doit déjà fonctionner ; ne lancez pas une seconde copie sur le même port.

ssh -N -L 127.0.0.1:8188:127.0.0.1:8188 -p SSH_PORT -i KEY_PATH USER@POD_IP

Ajouter la vidéo avec un workflow compatible

ComfyUI propose des workflows Wan2.2 et les liens de leurs composants. Le dépôt TI2V-5B documente une voie 720p avec au moins 24 Go, offload du modèle et encodeur de texte sur CPU. Cela ne garantit pas qu’un autre workflow vidéo 14B tienne dans la même mémoire.

Importez l’exemple TI2V-5B et placez tous les fichiers dans les dossiers indiqués. Conservez les dimensions et le nombre d’images pris en charge pour le premier essai. Lancez un court clip avant une longue file. En image-vers-vidéo, utilisez une image que vous pouvez téléverser et décrivez le mouvement.

Conservez seed, noms des poids, workflow et sortie. Comparez les GPU à réglages identiques en séparant téléchargement, chargement et génération. Les nœuds Partner/API peuvent appeler un service externe facturé séparément ; ils n’utilisent pas forcément votre GPU.

ComfyUI décrit aussi une configuration 5B avec offload natif à partir de 8 Go. Elle diffère de l’exemple amont à 24 Go ; utiliser moins de mémoire ne garantit pas une vitesse identique.

Consigne de mouvement

La caméra se rapproche lentement de la théière. La vapeur monte doucement ; la table et le fond restent immobiles. Lumière naturelle constante.

Workflow officiel Wan2.2 et composants dans ComfyUI.
Workflow officiel Wan2.2 et composants dans ComfyUI. ComfyUI

ComfyUI · Wan2.2 · Wan2.2

Connecter SillyTavern à un modèle distant

Garder SillyTavern sur votre ordinateur facilite la conservation des personnages et conversations lors d’un changement de serveur. L’inférence reste toutefois effectuée sur une infrastructure tierce.

Sur un Linux compatible CUDA, téléchargez la version Linux officielle de KoboldCpp et un GGUF de provenance vérifiable. Vérifiez licence et architecture prise en charge. L’exemple suppose le nom koboldcpp-linux-x64 et le modèle /workspace/models/model.gguf. Démarrez avec 4096 tokens de contexte et l’ajustement automatique des couches ; confirmez l’usage du GPU dans les journaux.

chmod +x ./koboldcpp-linux-x64 ./koboldcpp-linux-x64 --model /workspace/models/model.gguf --usecuda --gpulayers -1 --contextsize 4096 --host 127.0.0.1 --port 5001

Le serveur écoute sur sa propre boucle locale. Sur votre ordinateur, adaptez le tunnel avec les données SSH/TCP complètes du fournisseur. Remplacez SSH_PORT, KEY_PATH, USER et POD_IP. La destination suppose que SSH et KoboldCpp partagent le même espace réseau.

ssh -N -L 127.0.0.1:5001:127.0.0.1:5001 -p SSH_PORT -i KEY_PATH USER@POD_IP
  1. Gardez le terminal SSH ouvert. Testez http://127.0.0.1:5001 sur votre ordinateur et envoyez un court message avant de configurer SillyTavern.
  2. Sous Windows, installez Node.js LTS et Git, récupérez la branche release de SillyTavern dans un dossier accessible en écriture et lancez Start.bat sans droits administrateur.
  3. Dans API Connections, choisissez Text Completion → KoboldCpp, saisissez http://127.0.0.1:5001/ et cliquez sur Connect. Cette méthode n’ajoute pas /v1.
  4. Créez un personnage simple, choisissez le format d’instructions adapté au modèle et ne dépassez pas le contexte du backend. Sauvegardez cartes et conversations.
Dépôt officiel de KoboldCpp, le moteur utilisé pour les modèles GGUF.
Dépôt officiel de KoboldCpp, le moteur utilisé pour les modèles GGUF. KoboldCpp
Guide SillyTavern pour connecter un modèle auto-hébergé.
Guide SillyTavern pour connecter un modèle auto-hébergé. SillyTavern

KoboldCpp · Releases · KoboldCpp · SillyTavern · Windows · SillyTavern · API · Runpod · SSH

NSFW : contrôle technique ne signifie pas autorisation

Choisir les poids et les composants donne de la souplesse, sans créer un mode NSFW universel. Le modèle peut refuser du contenu adulte, mal le traiter ou imposer des restrictions de licence. Une carte de personnage ne modifie pas les règles de l’hébergeur ou d’une API.

Runpod restreint les contenus obscènes et lascifs dans ses conditions ; Vast.ai interdit aussi de stocker ou transmettre des contenus obscènes via ses services. Aucun ne doit être présenté comme un hébergement adulte sans restrictions. Faites confirmer votre cas précis avant de payer.

Vérifiez quatre niveaux : hébergeur, licence du modèle, API externe et plateforme de publication. Un ordinateur entièrement local supprime le niveau de l’hébergeur GPU, pas les autres obligations.

Question Évaluation
ComfyUI ou SillyTavern garantissent-ils le NSFW ? Non : le comportement dépend du modèle et du backend.
Poids ouverts = usage illimité ? Non : lire la licence exacte reste nécessaire.
Le cloud est-il totalement privé ? Non : protégez l’accès et limitez les données sensibles envoyées.

Runpod · Terms · Vast.ai · Terms

Sauvegarder, arrêter et diagnostiquer

Conservez JSON, versions des nœuds, noms et licences des modèles, seeds, prompts, personnages et sorties utiles. Ne partagez pas de clés API dans un workflow. Téléchargez une sauvegarde avant de supprimer la machine.

Chez Runpod, le container disk peut perdre ses données à l’arrêt ; le volume disk survit à l’arrêt mais disparaît avec le Pod ; le network volume possède son propre cycle et sa facture. Arrêtez le calcul et contrôlez séparément les volumes conservés. La disponibilité du même GPU au redémarrage n’est pas garantie.

Problème Premier contrôle
Mémoire insuffisante Décharger les autres modèles, réduire lot, contexte ou images vidéo
Nœuds ou poids absents Version du workflow et chemins exacts
Connexion SillyTavern impossible Backend, tunnel SSH puis URL
Lenteur Usage GPU, offload CPU, chargement initial et disque
Facturation persistante Fermer le navigateur n’arrête pas l’instance

Runpod · Storage

Questions fréquentes et bilan

Faut-il un PC puissant ?

Pas pour ce montage distant. Il faut une connexion stable, de la place pour les sauvegardes et un ordinateur capable de faire tourner l’interface. Les gros fichiers vidéo rendent le débit important.

Un GPU suffit-il pour tout ?

Vous pouvez alterner si chaque modèle tient. Les exécuter ensemble demande plus de VRAM ; déchargez le précédent avant de changer d’usage.

Deux GPU de 24 Go valent-ils un GPU de 48 Go ?

Pas automatiquement. Le logiciel doit répartir le modèle, avec un coût de communication. Un seul GPU suffisant simplifie la première installation.

Peut-on utiliser un téléphone ?

Une interface web protégée est accessible, mais le localhost du tunnel appartient au PC qui l’exécute. Prévoyez un accès sécurisé dédié, sans publier un service sans authentification.

Peut-on vendre les résultats ?

Cela dépend de la licence, des contenus utilisés, des conditions d’hébergement et de l’usage final. Louer du calcul n’achète pas les droits commerciaux de chaque modèle.

Est-ce moins cher qu’un abonnement ?

Cela peut l’être pour des sessions occasionnelles concentrées. Comptez installation, inactivité et stockage ; un service géré peut être préférable si vous ne voulez pas maintenir le logiciel.

Commencez par un workflow d’image reproductible sur 24 Go, vérifiez la persistance et le coût par résultat utile, puis ajoutez la vidéo. Cette base facilite le diagnostic quand un nouveau modèle pose problème.

Pour les personnages, gardez SillyTavern et les sauvegardes chez vous et utilisez un backend distant protégé. Augmentez la capacité au besoin et traitez l’autorisation NSFW séparément des performances.

À lire aussi : le guide SillyTavern pour débuter

Étiquettes d'Évaluation

#ComfyUI #GGUF #GPU cloud #NSFW #SillyTavern

Se connecter

OU

Créer un compte

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres

OU

Mot de Passe Oublié

Le mot de passe doit contenir entre 8 et 20 caractères et inclure des lettres et des chiffres