Como montar uma estação de IA com GPU na nuvem: imagens, vídeos, LLM e NSFW (2026)
Configure ComfyUI e SillyTavern com GPU alugada. Entenda custos, VRAM, vídeos, modelos de linguagem, armazenamento e restrições de NSFW.
Um notebook comum pode controlar uma estação de IA com GPU alugada: ComfyUI para imagens e vídeos, um servidor de modelo de linguagem e SillyTavern para personagens. Para uso ocasional, você evita comprar uma placa cara. Em troca, precisa cuidar da instalação, do armazenamento, da conexão e do desligamento para não acumular cobranças.
O que você está alugando?
Comece com uma GPU, armazenamento persistente e uma tarefa por vez. O cálculo e os pesos ficam no servidor; o navegador controla o trabalho. O SillyTavern pode continuar no seu computador, guardando personagens e conversas, enquanto o KoboldCpp executa o LLM remoto.
Alugar GPU não inclui automaticamente modelos, autorização comercial, permissão para conteúdo adulto ou um desktop remoto completo. ComfyUI organiza os fluxos, KoboldCpp executa o modelo e SillyTavern fornece a interface. Para poucas imagens prontas, um serviço gerenciado pode ser mais prático.
| Opção | Melhor uso | Principal compromisso |
|---|---|---|
| Serviço de IA online | Resultado rápido | Modelos, limites e regras do provedor |
| GPU alugada | Pesos e fluxos personalizados | Instalação, dados e acesso |
| GPU própria | Uso frequente e controle local | Compra, energia, calor e VRAM |
Runpod ou Vast.ai?
O Runpod é um ponto de partida acessível por oferecer template oficial e documentação de ComfyUI em Pods. Para uso interativo, escolha um Pod On-Demand. Um endpoint Serverless não funciona como a mesma estação persistente. GPUs Blackwell, como RTX 5090, exigem o template adequado.
A Vast.ai é uma alternativa para quem consegue avaliar ofertas de máquinas. Confira confiabilidade do host, região, RAM, disco, transferência e condições de aluguel. Instâncias interrompíveis podem servir a lotes recuperáveis, mas não são a primeira escolha para configuração ou uma renderização longa sem salvar. Não há uma tarifa única para todas as ofertas.
Leia o resumo antes de iniciar. Disco lento, CUDA incompatível ou baixar os pesos repetidamente podem consumir a economia da hora barata. Faça a primeira validação com orçamento pequeno e sessão curta.


Runpod · ComfyUI · Vast.ai · Pricing
Quanto de VRAM e armazenamento reservar?
Os números são referências de planejamento, não garantia para qualquer modelo. Quantização, resolução, quadros, lote e contexto alteram a memória exigida. RAM e VRAM são diferentes; offload para CPU pode evitar falhas, mas reduzir bastante a velocidade.
Para uso misto, 24 GB é um início razoável. Reserve inicialmente cerca de 100–200 GB de disco para poucos modelos, caches e resultados, conferindo o tamanho real. Um modelo de vídeo e um LLM que cabem individualmente podem não caber juntos.
| Tarefa | Ponto de partida | Atenção |
|---|---|---|
| Imagens básicas | 12–24 GB VRAM | Edição, ControlNet e lotes maiores exigem mais |
| Wan2.2 TI2V-5B | 24 GB com offload documentado | Não generalize para outros modelos de vídeo |
| LLM 7B–14B quantizado | 16–24 GB com margem | Contexto e cache KV também ocupam memória |
| Modelos maiores/vídeos longos | Avaliar 48–80 GB | Verifique o fluxo exato |
Preço: configuração e espera também entram na conta
Em 29 de setembro de 2026, a página de Pods do Runpod exibe RTX A5000 24 GB por US$0,27/h, RTX 4090 24 GB por US$0,74/h e RTX 5090 32 GB por US$0,99/h. São referências, não garantia de estoque ou orçamento final. Não confunda com preços de Serverless.
Pela referência de 28 de setembro, US$1 equivale a aproximadamente R$5,20: cerca de R$1,40, R$3,85 e R$5,15 por hora. São conversões indicativas, não preços oficiais em reais. Câmbio do cartão, tributos e tarifas podem alterar o total.
Exemplo: 20 horas de 4090 a US$0,74 mais um volume de rede padrão de 100 GB a US$0,07/GB/mês totalizam US$21,80, cerca de R$113,40, antes de outros discos, impostos ou transferências aplicáveis. Deixar a mesma GPU ligada 720 horas custa US$532,80 apenas de computação. Downloads e tempo ocioso também contam.
Orçamento = horas × tarifa + armazenamento mantido + transferência aplicável + tributos/tarifas. O Runpod lista volume disk em execução a US$0,10/GB/mês, parado a US$0,20 e network volume padrão abaixo de 1 TB a US$0,07. Compare com comprar uma placa usando suas horas reais, energia e manutenção.
Runpod · Pricing · Runpod · Storage · Banque de France · 28/09/2026
Configure primeiro um fluxo simples de imagem
Antes de vídeo e chat, confirme geração, download e salvamento do workflow. Este é um guia de configuração, não um teste de desempenho medido em GPU paga.
- Crie a conta e um lembrete de gastos. Cadastre a chave pública SSH se usar túnel e confira região e disponibilidade.
- Selecione o template ComfyUI oficial do Runpod; para RTX 5090/B200 use Blackwell Edition. Confira GPU, RAM, discos e portas antes do On-Demand.
- Anexe armazenamento persistente antes de baixar pesos. Confira o ponto de montagem e salve modelos, fluxos e saídas nele; o nome /workspace sozinho não garante persistência.
- Espere a inicialização e leia os logs. Confira autenticação do acesso HTTP: URL difícil de adivinhar não é proteção. Para trabalho privado, prefira túnel SSH e remova portas HTTP públicas desnecessárias.
- Abra Workflow → Browse Templates ou importe um exemplo oficial específico do modelo. Instale checkpoint, codificadores e VAE no servidor; um download no navegador pode ir apenas para o notebook.
- Gere uma imagem nas dimensões padrão. Baixe o resultado e o JSON do fluxo, verifique onde foram salvos e só então pare o Pod.
Teste inicial
Um bule de cerâmica sobre uma mesa de madeira junto à janela, luz suave da manhã, fundo neutro, fotografia de produto realista.
Runpod · ComfyUI · ComfyUI · Text to Image · Runpod · SSH
Escolha o network volume durante a criação do Pod; ele não é anexado depois a um Pod existente. Este túnel do ComfyUI pressupõe que o servidor SSH alcance 127.0.0.1:8188. Substitua os marcadores, mantenha o terminal aberto e acesse http://127.0.0.1:8188 nesse computador. ComfyUI já deve estar rodando; não inicie uma segunda cópia na mesma porta.
ssh -N -L 127.0.0.1:8188:127.0.0.1:8188 -p SSH_PORT -i KEY_PATH USER@POD_IP Adicione vídeo com um workflow compatível
O ComfyUI disponibiliza exemplos do Wan2.2 e links dos componentes. O repositório TI2V-5B documenta uma rota 720p com pelo menos 24 GB, offload do modelo e codificador de texto na CPU. Isso não garante que outro fluxo de vídeo 14B caiba na mesma placa.
Importe TI2V-5B, coloque todos os arquivos nas pastas indicadas e mantenha dimensões e quadros suportados no primeiro teste. Gere um clipe curto antes de uma fila longa. Em imagem para vídeo, use uma imagem que possa enviar e descreva movimento e câmera.
Guarde seed, nomes dos pesos, fluxo e resultado. Compare GPUs com ajustes idênticos e separe download/carga inicial de geração. Nós Partner/API podem chamar um serviço externo cobrado à parte, em vez de usar sua GPU.
O ComfyUI também documenta uma rota otimizada com offload nativo para o modelo 5B em 8 GB. É outra configuração, diferente do exemplo de 24 GB do repositório; usar menos memória não garante a mesma velocidade.
Movimento para o vídeo
A câmera se aproxima lentamente do bule. O vapor sobe suavemente, enquanto a mesa e o fundo ficam parados. Luz natural constante.

Execute o LLM e conecte o SillyTavern
Deixar o SillyTavern no seu computador facilita guardar personagens e histórico quando você troca de instância. A inferência remota, porém, continua usando infraestrutura de terceiros.
Em Linux compatível com CUDA, baixe o executável Linux oficial do KoboldCpp e um GGUF de origem verificável. Confira licença e suporte à arquitetura. O exemplo assume o nome koboldcpp-linux-x64 e o modelo em /workspace/models/model.gguf. Comece com contexto de 4096 tokens e ajuste automático de camadas; veja nos logs se a GPU está sendo usada.
chmod +x ./koboldcpp-linux-x64 ./koboldcpp-linux-x64 --model /workspace/models/model.gguf --usecuda --gpulayers -1 --contextsize 4096 --host 127.0.0.1 --port 5001 O servidor escuta apenas no próprio loopback. No seu computador, use os dados completos de SSH/TCP do provedor no túnel abaixo. Substitua SSH_PORT, KEY_PATH, USER e POD_IP. O destino pressupõe que SSH e KoboldCpp compartilhem o mesmo namespace de rede.
ssh -N -L 127.0.0.1:5001:127.0.0.1:5001 -p SSH_PORT -i KEY_PATH USER@POD_IP - Mantenha o terminal SSH aberto e teste http://127.0.0.1:5001 no computador. Envie uma mensagem curta antes de configurar a interface.
- No Windows, instale Node.js LTS e Git. Obtenha a branch release do SillyTavern numa pasta gravável e execute Start.bat sem privilégios de administrador.
- Em API Connections, selecione Text Completion → KoboldCpp, informe http://127.0.0.1:5001/ e clique Connect. Nesse modo, não acrescente /v1.
- Crie um personagem simples, use o formato de prompt correto e mantenha o contexto da interface dentro do limite do backend. Faça backup de cartões e conversas.


KoboldCpp · Releases · KoboldCpp · SillyTavern · Windows · SillyTavern · API · Runpod · SSH
NSFW: flexibilidade não é autorização
Escolher pesos e componentes dá controle, mas não existe uma chave universal de NSFW. O modelo pode recusar conteúdo adulto, ter qualidade ruim nessa tarefa ou impor condições de licença. Cartões de personagem não substituem regras do host ou de uma API.
Os termos do Runpod restringem conteúdo obsceno e lascivo; a Vast.ai também proíbe armazenar ou transmitir conteúdo obsceno pelo serviço. Nenhum dos dois deve ser recomendado como hospedagem adulta sem restrições. Confirme seu caso específico com o provedor antes de pagar.
Avalie quatro camadas: hospedagem, licença do modelo, API externa e plataforma onde publicará. Rodar tudo em casa elimina a camada do host de GPU, mas não as demais obrigações.
| Dúvida | Avaliação |
|---|---|
| ComfyUI ou SillyTavern garantem NSFW? | Não. São interfaces; o comportamento depende do modelo. |
| Pesos abertos significam uso irrestrito? | Não. Leia a licença específica. |
| A nuvem é totalmente privada? | Não. Proteja o acesso e evite dados sensíveis desnecessários. |
Runpod · Terms · Vast.ai · Terms
Backup, desligamento e solução de problemas
Mantenha JSON, versões dos nós, nomes e licenças dos modelos, seeds, prompts, personagens e resultados importantes. Não compartilhe chaves API dentro de workflows. Baixe o backup antes de excluir a máquina.
No Runpod, container disk pode perder dados ao parar; volume disk sobrevive à parada, mas é excluído com o Pod; network volume tem ciclo e cobrança próprios. Pare o cálculo e confira separadamente os volumes retidos. Reiniciar não garante que a mesma GPU continue disponível.
| Problema | Primeira checagem |
|---|---|
| Falta de memória | Descarregue modelos e reduza lote, contexto ou quadros |
| Nós ou pesos ausentes | Versão do fluxo e caminhos exatos |
| SillyTavern sem conexão | Backend, túnel SSH e URL, nessa ordem |
| Lentidão | Uso de GPU, offload, carga inicial e disco |
| Cobrança continua | Fechar o navegador não para a instância |
Perguntas frequentes e recomendação
Preciso de computador potente?
Não para esse arranjo remoto. Você precisa de conexão estável, espaço para backup e uma máquina que execute a interface. Vídeos grandes exigem boa transferência.
Uma GPU serve para tudo?
Você pode alternar as tarefas se cada modelo couber. Executar tudo junto exige mais VRAM; libere o modelo anterior ao trocar de atividade.
Duas placas de 24 GB equivalem a 48 GB?
Não automaticamente. O software precisa dividir o modelo, com custo de comunicação. Uma placa suficiente é mais simples para começar.
Funciona no celular?
Uma interface web protegida pode ser usada, mas o localhost do túnel pertence ao computador que o executa. Configure acesso seguro específico, sem abrir um serviço sem autenticação.
Posso vender o que gerar?
Depende da licença, dos materiais, dos termos de hospedagem e da finalidade. Alugar GPU não compra autorização comercial de todos os modelos.
É mais barato que assinatura?
Pode ser para sessões ocasionais concentradas. Inclua instalação, ociosidade e armazenamento; serviço gerenciado pode compensar para quem não quer manutenção.
Comece com um fluxo de imagem reproduzível em 24 GB, confira persistência e calcule o custo por resultado útil. Acrescente vídeo depois, com uma base estável para identificar falhas.
Para personagens, guarde SillyTavern e backups no seu PC e use um backend remoto protegido. Aumente a GPU conforme a necessidade e trate autorização NSFW como decisão separada.