Como montar uma estação de IA com GPU na nuvem: imagens, vídeos, LLM e NSFW (2026)

Configure ComfyUI e SillyTavern com GPU alugada. Entenda custos, VRAM, vídeos, modelos de linguagem, armazenamento e restrições de NSFW.

schedule
article 11 min de leitura
Como montar uma estação de IA com GPU na nuvem: imagens, vídeos, LLM e NSFW (2026)

Um notebook comum pode controlar uma estação de IA com GPU alugada: ComfyUI para imagens e vídeos, um servidor de modelo de linguagem e SillyTavern para personagens. Para uso ocasional, você evita comprar uma placa cara. Em troca, precisa cuidar da instalação, do armazenamento, da conexão e do desligamento para não acumular cobranças.

O que você está alugando?

Comece com uma GPU, armazenamento persistente e uma tarefa por vez. O cálculo e os pesos ficam no servidor; o navegador controla o trabalho. O SillyTavern pode continuar no seu computador, guardando personagens e conversas, enquanto o KoboldCpp executa o LLM remoto.

Alugar GPU não inclui automaticamente modelos, autorização comercial, permissão para conteúdo adulto ou um desktop remoto completo. ComfyUI organiza os fluxos, KoboldCpp executa o modelo e SillyTavern fornece a interface. Para poucas imagens prontas, um serviço gerenciado pode ser mais prático.

Opção Melhor uso Principal compromisso
Serviço de IA online Resultado rápido Modelos, limites e regras do provedor
GPU alugada Pesos e fluxos personalizados Instalação, dados e acesso
GPU própria Uso frequente e controle local Compra, energia, calor e VRAM

Runpod ou Vast.ai?

O Runpod é um ponto de partida acessível por oferecer template oficial e documentação de ComfyUI em Pods. Para uso interativo, escolha um Pod On-Demand. Um endpoint Serverless não funciona como a mesma estação persistente. GPUs Blackwell, como RTX 5090, exigem o template adequado.

A Vast.ai é uma alternativa para quem consegue avaliar ofertas de máquinas. Confira confiabilidade do host, região, RAM, disco, transferência e condições de aluguel. Instâncias interrompíveis podem servir a lotes recuperáveis, mas não são a primeira escolha para configuração ou uma renderização longa sem salvar. Não há uma tarifa única para todas as ofertas.

Leia o resumo antes de iniciar. Disco lento, CUDA incompatível ou baixar os pesos repetidamente podem consumir a economia da hora barata. Faça a primeira validação com orçamento pequeno e sessão curta.

Tutorial oficial do Runpod para instalar o ComfyUI.
Tutorial oficial do Runpod para instalar o ComfyUI. Runpod
Site oficial de aluguel de GPU da Vast.ai.
Site oficial de aluguel de GPU da Vast.ai. Vast.ai

Runpod · ComfyUI · Vast.ai · Pricing

Quanto de VRAM e armazenamento reservar?

Os números são referências de planejamento, não garantia para qualquer modelo. Quantização, resolução, quadros, lote e contexto alteram a memória exigida. RAM e VRAM são diferentes; offload para CPU pode evitar falhas, mas reduzir bastante a velocidade.

Para uso misto, 24 GB é um início razoável. Reserve inicialmente cerca de 100–200 GB de disco para poucos modelos, caches e resultados, conferindo o tamanho real. Um modelo de vídeo e um LLM que cabem individualmente podem não caber juntos.

Tarefa Ponto de partida Atenção
Imagens básicas 12–24 GB VRAM Edição, ControlNet e lotes maiores exigem mais
Wan2.2 TI2V-5B 24 GB com offload documentado Não generalize para outros modelos de vídeo
LLM 7B–14B quantizado 16–24 GB com margem Contexto e cache KV também ocupam memória
Modelos maiores/vídeos longos Avaliar 48–80 GB Verifique o fluxo exato

Wan2.2 · SillyTavern · API

Preço: configuração e espera também entram na conta

Em 29 de setembro de 2026, a página de Pods do Runpod exibe RTX A5000 24 GB por US$0,27/h, RTX 4090 24 GB por US$0,74/h e RTX 5090 32 GB por US$0,99/h. São referências, não garantia de estoque ou orçamento final. Não confunda com preços de Serverless.

Pela referência de 28 de setembro, US$1 equivale a aproximadamente R$5,20: cerca de R$1,40, R$3,85 e R$5,15 por hora. São conversões indicativas, não preços oficiais em reais. Câmbio do cartão, tributos e tarifas podem alterar o total.

Exemplo: 20 horas de 4090 a US$0,74 mais um volume de rede padrão de 100 GB a US$0,07/GB/mês totalizam US$21,80, cerca de R$113,40, antes de outros discos, impostos ou transferências aplicáveis. Deixar a mesma GPU ligada 720 horas custa US$532,80 apenas de computação. Downloads e tempo ocioso também contam.

Orçamento = horas × tarifa + armazenamento mantido + transferência aplicável + tributos/tarifas. O Runpod lista volume disk em execução a US$0,10/GB/mês, parado a US$0,20 e network volume padrão abaixo de 1 TB a US$0,07. Compare com comprar uma placa usando suas horas reais, energia e manutenção.

Runpod · Pricing · Runpod · Storage · Banque de France · 28/09/2026

Configure primeiro um fluxo simples de imagem

Antes de vídeo e chat, confirme geração, download e salvamento do workflow. Este é um guia de configuração, não um teste de desempenho medido em GPU paga.

  1. Crie a conta e um lembrete de gastos. Cadastre a chave pública SSH se usar túnel e confira região e disponibilidade.
  2. Selecione o template ComfyUI oficial do Runpod; para RTX 5090/B200 use Blackwell Edition. Confira GPU, RAM, discos e portas antes do On-Demand.
  3. Anexe armazenamento persistente antes de baixar pesos. Confira o ponto de montagem e salve modelos, fluxos e saídas nele; o nome /workspace sozinho não garante persistência.
  4. Espere a inicialização e leia os logs. Confira autenticação do acesso HTTP: URL difícil de adivinhar não é proteção. Para trabalho privado, prefira túnel SSH e remova portas HTTP públicas desnecessárias.
  5. Abra Workflow → Browse Templates ou importe um exemplo oficial específico do modelo. Instale checkpoint, codificadores e VAE no servidor; um download no navegador pode ir apenas para o notebook.
  6. Gere uma imagem nas dimensões padrão. Baixe o resultado e o JSON do fluxo, verifique onde foram salvos e só então pare o Pod.

Teste inicial

Um bule de cerâmica sobre uma mesa de madeira junto à janela, luz suave da manhã, fundo neutro, fotografia de produto realista.

Runpod · ComfyUI · ComfyUI · Text to Image · Runpod · SSH

Escolha o network volume durante a criação do Pod; ele não é anexado depois a um Pod existente. Este túnel do ComfyUI pressupõe que o servidor SSH alcance 127.0.0.1:8188. Substitua os marcadores, mantenha o terminal aberto e acesse http://127.0.0.1:8188 nesse computador. ComfyUI já deve estar rodando; não inicie uma segunda cópia na mesma porta.

ssh -N -L 127.0.0.1:8188:127.0.0.1:8188 -p SSH_PORT -i KEY_PATH USER@POD_IP

Adicione vídeo com um workflow compatível

O ComfyUI disponibiliza exemplos do Wan2.2 e links dos componentes. O repositório TI2V-5B documenta uma rota 720p com pelo menos 24 GB, offload do modelo e codificador de texto na CPU. Isso não garante que outro fluxo de vídeo 14B caiba na mesma placa.

Importe TI2V-5B, coloque todos os arquivos nas pastas indicadas e mantenha dimensões e quadros suportados no primeiro teste. Gere um clipe curto antes de uma fila longa. Em imagem para vídeo, use uma imagem que possa enviar e descreva movimento e câmera.

Guarde seed, nomes dos pesos, fluxo e resultado. Compare GPUs com ajustes idênticos e separe download/carga inicial de geração. Nós Partner/API podem chamar um serviço externo cobrado à parte, em vez de usar sua GPU.

O ComfyUI também documenta uma rota otimizada com offload nativo para o modelo 5B em 8 GB. É outra configuração, diferente do exemplo de 24 GB do repositório; usar menos memória não garante a mesma velocidade.

Movimento para o vídeo

A câmera se aproxima lentamente do bule. O vapor sobe suavemente, enquanto a mesa e o fundo ficam parados. Luz natural constante.

Fluxo oficial do Wan2.2 e seus componentes no ComfyUI.
Fluxo oficial do Wan2.2 e seus componentes no ComfyUI. ComfyUI

ComfyUI · Wan2.2 · Wan2.2

Execute o LLM e conecte o SillyTavern

Deixar o SillyTavern no seu computador facilita guardar personagens e histórico quando você troca de instância. A inferência remota, porém, continua usando infraestrutura de terceiros.

Em Linux compatível com CUDA, baixe o executável Linux oficial do KoboldCpp e um GGUF de origem verificável. Confira licença e suporte à arquitetura. O exemplo assume o nome koboldcpp-linux-x64 e o modelo em /workspace/models/model.gguf. Comece com contexto de 4096 tokens e ajuste automático de camadas; veja nos logs se a GPU está sendo usada.

chmod +x ./koboldcpp-linux-x64 ./koboldcpp-linux-x64 --model /workspace/models/model.gguf --usecuda --gpulayers -1 --contextsize 4096 --host 127.0.0.1 --port 5001

O servidor escuta apenas no próprio loopback. No seu computador, use os dados completos de SSH/TCP do provedor no túnel abaixo. Substitua SSH_PORT, KEY_PATH, USER e POD_IP. O destino pressupõe que SSH e KoboldCpp compartilhem o mesmo namespace de rede.

ssh -N -L 127.0.0.1:5001:127.0.0.1:5001 -p SSH_PORT -i KEY_PATH USER@POD_IP
  1. Mantenha o terminal SSH aberto e teste http://127.0.0.1:5001 no computador. Envie uma mensagem curta antes de configurar a interface.
  2. No Windows, instale Node.js LTS e Git. Obtenha a branch release do SillyTavern numa pasta gravável e execute Start.bat sem privilégios de administrador.
  3. Em API Connections, selecione Text Completion → KoboldCpp, informe http://127.0.0.1:5001/ e clique Connect. Nesse modo, não acrescente /v1.
  4. Crie um personagem simples, use o formato de prompt correto e mantenha o contexto da interface dentro do limite do backend. Faça backup de cartões e conversas.
Repositório oficial do KoboldCpp, usado para executar GGUF.
Repositório oficial do KoboldCpp, usado para executar GGUF. KoboldCpp
Documentação do SillyTavern para conectar um modelo próprio.
Documentação do SillyTavern para conectar um modelo próprio. SillyTavern

KoboldCpp · Releases · KoboldCpp · SillyTavern · Windows · SillyTavern · API · Runpod · SSH

NSFW: flexibilidade não é autorização

Escolher pesos e componentes dá controle, mas não existe uma chave universal de NSFW. O modelo pode recusar conteúdo adulto, ter qualidade ruim nessa tarefa ou impor condições de licença. Cartões de personagem não substituem regras do host ou de uma API.

Os termos do Runpod restringem conteúdo obsceno e lascivo; a Vast.ai também proíbe armazenar ou transmitir conteúdo obsceno pelo serviço. Nenhum dos dois deve ser recomendado como hospedagem adulta sem restrições. Confirme seu caso específico com o provedor antes de pagar.

Avalie quatro camadas: hospedagem, licença do modelo, API externa e plataforma onde publicará. Rodar tudo em casa elimina a camada do host de GPU, mas não as demais obrigações.

Dúvida Avaliação
ComfyUI ou SillyTavern garantem NSFW? Não. São interfaces; o comportamento depende do modelo.
Pesos abertos significam uso irrestrito? Não. Leia a licença específica.
A nuvem é totalmente privada? Não. Proteja o acesso e evite dados sensíveis desnecessários.

Runpod · Terms · Vast.ai · Terms

Backup, desligamento e solução de problemas

Mantenha JSON, versões dos nós, nomes e licenças dos modelos, seeds, prompts, personagens e resultados importantes. Não compartilhe chaves API dentro de workflows. Baixe o backup antes de excluir a máquina.

No Runpod, container disk pode perder dados ao parar; volume disk sobrevive à parada, mas é excluído com o Pod; network volume tem ciclo e cobrança próprios. Pare o cálculo e confira separadamente os volumes retidos. Reiniciar não garante que a mesma GPU continue disponível.

Problema Primeira checagem
Falta de memória Descarregue modelos e reduza lote, contexto ou quadros
Nós ou pesos ausentes Versão do fluxo e caminhos exatos
SillyTavern sem conexão Backend, túnel SSH e URL, nessa ordem
Lentidão Uso de GPU, offload, carga inicial e disco
Cobrança continua Fechar o navegador não para a instância

Runpod · Storage

Perguntas frequentes e recomendação

Preciso de computador potente?

Não para esse arranjo remoto. Você precisa de conexão estável, espaço para backup e uma máquina que execute a interface. Vídeos grandes exigem boa transferência.

Uma GPU serve para tudo?

Você pode alternar as tarefas se cada modelo couber. Executar tudo junto exige mais VRAM; libere o modelo anterior ao trocar de atividade.

Duas placas de 24 GB equivalem a 48 GB?

Não automaticamente. O software precisa dividir o modelo, com custo de comunicação. Uma placa suficiente é mais simples para começar.

Funciona no celular?

Uma interface web protegida pode ser usada, mas o localhost do túnel pertence ao computador que o executa. Configure acesso seguro específico, sem abrir um serviço sem autenticação.

Posso vender o que gerar?

Depende da licença, dos materiais, dos termos de hospedagem e da finalidade. Alugar GPU não compra autorização comercial de todos os modelos.

É mais barato que assinatura?

Pode ser para sessões ocasionais concentradas. Inclua instalação, ociosidade e armazenamento; serviço gerenciado pode compensar para quem não quer manutenção.

Comece com um fluxo de imagem reproduzível em 24 GB, confira persistência e calcule o custo por resultado útil. Acrescente vídeo depois, com uma base estável para identificar falhas.

Para personagens, guarde SillyTavern e backups no seu PC e use um backend remoto protegido. Aumente a GPU conforme a necessidade e trate autorização NSFW como decisão separada.

Leia também o guia de SillyTavern para iniciantes

Tags de Avaliação

#ComfyUI #GGUF #GPU na nuvem #NSFW #SillyTavern

Entrar

OU

Criar conta

A senha deve ter entre 8 e 20 caracteres e conter letras e números

OU

Esqueceu a Senha

A senha deve ter entre 8 e 20 caracteres e conter letras e números