Gerador de video por IA: vale a pena hospedar?
Analise o desempenho real do Wan 2.2 e HunyuanVideo em julho de 2026. Saiba o custo por clipe de 5 segundos, requisitos de VRAM e quando compensa usar API em vez de GPU local.
O que um gerador de vídeo por IA auto-hospedado realmente pode fazer
Um gerador de vídeo por IA auto-hospedado funciona hoje, mas é mais lento e limitado do que as demonstrações sugerem. Em julho de 2026, os modelos abertos que valem a pena executar são o Wan 2.2 da Alibaba e o HunyuanVideo da Tencent, além do LTX-Video da Lightricks quando a velocidade é mais importante que o realismo. Todos rodam sob o ComfyUI em uma máquina Linux com uma GPU NVIDIA. O resultado é um clipe de aproximadamente cinco segundos em 720p. Não é uma cena. Não é um minuto de filmagem finalizada.
Aqui está a resposta curta antes dos detalhes. Uma placa de 24 GB renderiza um clipe de 720p de cinco segundos em poucos minutos. Uma placa de 12 GB faz o mesmo trabalho em vinte minutos ou mais, porque os pesos não cabem na memória de vídeo e o software continua movendo camadas entre a VRAM e a RAM do sistema. Um servidor sem GPU não consegue realizar isso de forma útil. A aritmética que tornava a geração de imagens por CPU lenta torna a geração de vídeo por CPU inútil.
Se você já leu a hierarquia de hardware para um gerador de imagens auto-hospedado, o vídeo segue o mesmo argumento, com todos os números movidos uma classe acima. A VRAM (memória de vídeo, a RAM soldada ao lado do chip gráfico) continua sendo a única especificação que decide se isso será divertido ou penoso.
Por que um vídeo custa muito mais do que uma imagem
Um modelo de difusão gera uma imagem removendo ruído em etapas, e cada etapa lê todos os pesos do modelo. Um modelo de vídeo faz o mesmo com um bloco inteiro de quadros de uma só vez, e adiciona atenção temporal para que o quadro 80 saiba como era o quadro 12. Cinco segundos a 24 quadros por segundo resultam em 120 quadros em um único lote.
Essa atenção temporal é o motivo pelo qual o custo não escala de forma linear com a duração do clipe. Dobrar a contagem de quadros mais do que dobra a memória necessária para o sampler, portanto, o modo de falha não é uma renderização mais lenta. É a falha total da renderização.
Existe um segundo pico de memória que as pessoas não esperam. Após o sampler terminar, o VAE (variational autoencoder, a parte que transforma o latente comprimido em pixels reais) decodifica todo o vídeo latente de uma só vez. Essa decodificação pode exigir mais memória do que a amostragem. O sintoma é um processo que mostra uma barra de progresso concluída e, em seguida, exibe isto:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBA solução é a decodificação em blocos (tiled decoding) ou um clipe mais curto. Saber qual etapa esgotou a memória evita que você perca uma hora ajustando o parâmetro errado.
Quanta VRAM você precisa para geração de vídeo por IA
Dois números publicados estruturam toda a decisão, e eles parecem contraditórios. A Alibaba afirma que o modelo Wan 2.2 TI2V-5B produz clipes em 720p a 24 quadros por segundo, com cinco segundos de duração, em menos de nove minutos em uma única GPU de consumo como uma 4090, e recomenda pelo menos 24 GB de VRAM. A documentação do ComfyUI afirma que o mesmo modelo 5B "deve caber bem em 8 GB de VRAM com o offloading nativo do ComfyUI".
Ambos são verdadeiros porque medem coisas diferentes. 8 GB é onde ele cabe. 24 GB é onde ele opera com conforto. O offloading funciona mantendo a maior parte do modelo na RAM do sistema e transmitindo camadas para a GPU a cada etapa, então a placa gasta seu tempo esperando pelo barramento PCIe em vez de realizar cálculos. Você paga esse custo a cada etapa do sampler, não apenas uma vez.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Apenas a última linha é um número do fabricante. A placa de 24 GB chega a 9 minutos por clipe, que é o número publicado pela Alibaba para este modelo. As outras linhas são o que o offloading causa, e elas são ordens de grandeza em vez de resultados de benchmark. O formato é o ponto principal: 40 minutos em uma placa de 8 GB é tecnicamente uma configuração funcional e, na prática, um trabalho em lote que você deixa rodando durante a noite.
Os modelos Wan 2.2 maiores são um mundo diferente. As variantes A14B de texto para vídeo e imagem para vídeo exigem pelo menos 80 GB de VRAM para inferência em GPU única. Isso é hardware de data center, não uma placa que você coloca em uma máquina de mesa, e é o ponto onde o self-hosted começa a significar alugar o acelerador de outra pessoa por hora.
Quanto custa um clipe em uma GPU alugada
Alugar é a forma como a maioria das pessoas deve testar isso, pois uma placa que você compra é o hardware errado se o modelo que você acabar querendo precisar de 80 GB. Preços médios sob demanda no mercado de aluguel de GPU, em julho de 2026:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]A linha 4090 executa o modelo 5B e custa cerca de 0.05 dólares por clipe a 0.36 dólares por hora. As linhas de 80 GB executam os modelos 14B, e é por isso que seu custo por clipe sobe para 0.6 dólares, embora o hardware em si seja muito mais rápido. Modelo maior, mais processamento por segundo de vídeo.
Cinco centavos por clipe parece pouco, e essa é a parte enganosa. Seus primeiros cinco segundos utilizáveis nunca são uma única renderização. Fazer o prompt de um modelo de vídeo é uma busca, e vinte a quarenta renderizações antes de obter um resultado aproveitável é normal para uma cena com movimento específico. Uma sessão de trabalho, portanto, custa dólares em vez de centavos, e uma tarde de iteração em hardware alugado custa cerca de um almoço.
Dois detalhes do aluguel custam dinheiro real se você não prestar atenção. Você é cobrado enquanto a máquina baixa os pesos, e os arquivos Wan 2.2 com seu codificador de texto e VAE chegam a dezenas de gigabytes, então escolha um provedor com um volume persistente e baixe apenas uma vez. Você também é cobrado enquanto a máquina fica ociosa com sua sessão SSH aberta. Interrompa a instância em vez de apenas fechar o terminal.
Instalar o ComfyUI no servidor com GPU
Comece com o Ubuntu 24.04 com o driver NVIDIA já instalado. Verifique o driver primeiro, pois qualquer falha posterior parece idêntica sem esta verificação.
nvidia-smiIsso deve exibir uma tabela com sua placa e uma versão do CUDA. Se exibir NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, o módulo do kernel não está carregado, o que geralmente ocorre após uma atualização de kernel sem reinicialização. Corrija isso aqui. Caso contrário, o ComfyUI voltará para o caminho da CPU e você perderá uma hora culpando o modelo.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtConfirme se o PyTorch reconhece a placa antes de baixar qualquer arquivo de peso.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True mais o nome da sua placa significa que a pilha está íntegra. False significa que o wheel instalado é a versão apenas para CPU, o que acontece quando o pip encontra um torch em cache de uma instalação anterior. Reinstale com a URL de índice acima.
Download dos arquivos do modelo Wan 2.2
O ComfyUI é distribuído sem pesos, e um modelo de vídeo não é um arquivo único. Ele é composto por um modelo de difusão, um codificador de texto e um VAE, e cada um deve ser colocado em seu próprio diretório. Se você colocar um arquivo na pasta errada, o nó de carregamento simplesmente não o listará, sem exibir nenhum erro para explicar o motivo.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensorsO modelo 5B lida tanto com texto para vídeo quanto com imagem para vídeo, por isso é o ponto de partida mais sensato. Sempre prefira .safetensors em vez de .ckpt. Um arquivo .ckpt é um objeto Python serializado (pickled), portanto, carregá-lo executa código escrito por quem o criou. Reserve espaço em disco generosamente: uma instalação funcional com uma família de modelos e seus resultados requer 100 GB, e arquivos de vídeo são muito maiores do que as imagens PNG que um fluxo de trabalho de imagem gera. Faça backup dos seus arquivos JSON de fluxo de trabalho com algo como backups incrementais criptografados para armazenamento de objetos, pois os pesos podem ser baixados novamente, mas seus fluxos de trabalho ajustados não.
Execute e acesse com segurança
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188O ComfyUI não possui tela de login nem contas de usuário. Qualquer pessoa que consiga acessar a porta 8188 pode enfileirar tarefas, ler todos os clipes que você gerou e instalar nós personalizados, o que representa execução arbitrária de código no seu servidor. Vincule-o ao localhost e acesse-o por meio de um túnel SSH a partir da sua própria máquina.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverEm seguida, abra http://127.0.0.1:8188 no seu navegador. Carregue o fluxo de trabalho de modelo Wan 2.2 a partir do menu de modelos do ComfyUI em vez de conectar os nós manualmente. Os modelos oficiais contêm as configurações de amostragem para as quais o modelo foi ajustado, e um fluxo de trabalho de vídeo possui muito mais pontos onde um valor pode ser configurado incorretamente de forma silenciosa do que um fluxo de trabalho de imagem.
Quando a resposta honesta é usar uma API
Hospedar sua própria geração de vídeo é a decisão correta quando o volume é alto e constante, quando seus quadros não podem sair da sua infraestrutura, ou quando você precisa de um modelo específico ou um adaptador personalizado que nenhum serviço hospedado oferece. Também é a escolha certa quando o pipeline precisa continuar funcionando da mesma forma daqui a um ano, pois um modelo hospedado pode mudar sem aviso e sem uma versão para fixar.
Use uma API hospedada quando precisar de poucos clipes por mês, quando precisar de uma saída mais longa ou maior do que os modelos abertos produzem, ou quando tiver um prazo para esta semana. Faça o cálculo do ponto de equilíbrio de forma honesta. Uma placa de 24 GB alugada ininterruptamente pela mediana de julho de 2026 custa aproximadamente 260 dólares por mês, e comprar a mesma placa custa mais do que isso adiantado antes mesmo de você gerar um único quadro. Uma máquina auto-hospedada ociosa sempre perde para o preço por clipe de uma API. Esta é a mesma troca que decide como você serve modelos de texto, abordada em Ollama versus vLLM para servir LLMs auto-hospedados, e ela se baseia na questão mais fundamental em se um VPS com GPU realmente vale o investimento.
O que verificar quando uma renderização falha
Uma renderização que encerra exatamente no final, após a barra de amostragem ser concluída, ficou sem memória durante a decodificação do VAE. Reduza a contagem de quadros ou alterne para um nó de decodificação em blocos (tiled decode). Alterar a contagem de passos não ajudará, pois a decodificação ocorre apenas uma vez, após todos os passos terem sido executados.
Uma saída que apresenta cor preta sólida ou que está gravemente distorcida geralmente significa que o VAE não é compatível com o modelo. Um VAE do Wan 2.1 carregado com um modelo de difusão Wan 2.2 produz exatamente esse resultado, e nenhum erro aparece em qualquer parte do log.
Uma renderização que é executada, mas leva horas em uma máquina que possui uma GPU, significa que o ComfyUI está no caminho de processamento da CPU. Verifique o log de inicialização na linha referente ao dispositivo e, em seguida, execute novamente a verificação torch.cuda.is_available() acima.
O processo desaparecer com Killed em dmesg e sem nenhum traceback do Python indica que o kernel encerrou o processo por falta de memória (OOM killer); portanto, o problema é na memória RAM do sistema, não na VRAM. O descarregamento (offloading) exige que todo o modelo resida na memória RAM do sistema, o que significa que uma máquina com 16 GB de RAM é insuficiente para descarregar um modelo de 5B. Adicione memória RAM ou adicione swap.
FAQ
Posso gerar vídeo por IA em uma VPS sem GPU?
Não, não de uma forma que você usaria duas vezes. Um clipe de 720p com cinco segundos que leva nove minutos em uma GPU de 24 GB leva muitas horas em uma CPU, porque o modelo não possui hardware de matriz para execução e a largura de banda da RAM do sistema é uma ordem de magnitude inferior à largura de banda da memória da GPU. Um servidor com CPU pode hospedar a interface do ComfyUI, armazenar seus modelos e manter seus fluxos de trabalho, mas a renderização em si precisa de uma GPU.
Quanta VRAM preciso para o Wan 2.2?
Para o modelo TI2V-5B, 8 GB é o mínimo com o offloading nativo do ComfyUI, e 24 GB é o que a Alibaba recomenda para obter a velocidade publicada. Para os modelos de texto-para-vídeo e imagem-para-vídeo A14B, a ficha técnica do modelo solicita pelo menos 80 GB de VRAM para inferência em GPU única, portanto, eles exigem placas de data center.
Qual a duração máxima de um clipe auto-hospedado?
Cerca de cinco segundos em 720p é a unidade prática em julho de 2026. Saídas mais longas são produzidas gerando segmentos e unindo-os, usando o último quadro de um segmento como o primeiro quadro do próximo. A qualidade varia ao longo das junções, portanto, trate um vídeo longo como um trabalho de edição em vez de uma única geração.
Alugar uma GPU por hora é mais barato do que comprar uma placa?
O aluguel compensa para qualquer volume inferior a algumas horas de renderização por dia. Com a média de julho de 2026 de cerca de 0,36 dólares por hora para uma placa de 24 GB, você pode alugar por muito tempo antes de atingir o preço de compra dessa placa, e você evita comprar hardware que acaba sendo da classe errada para o modelo que você realmente deseja. A compra compensa apenas quando a máquina está ocupada na maior parte do dia, todos os dias.