SSD Nodes Learn Hosting plans →
Guias Matt ConnorPor Matt Connor · Atualizado 2026-08-13

Gerador de vídeo com IA autoalojado: o que esperar

Veja o que Wan 2.2, HunyuanVideo e LTX-Video entregam em julho de 2026, a VRAM necessária, o custo de um clip de 5 segundos e quando usar uma API.

O que um gerador de vídeo com IA autoalojado consegue realmente fazer

Um gerador de vídeo com IA autoalojado já funciona atualmente, mas é mais lento e produz clips mais curtos do que os vídeos de demonstração sugerem. Em julho de 2026, os modelos abertos que vale a pena executar são o Wan 2.2, da Alibaba, e o HunyuanVideo, da Tencent, além do LTX-Video, da Lightricks, quando a velocidade é mais importante do que o realismo. Todos funcionam com o ComfyUI numa máquina Linux com uma GPU NVIDIA. O resultado é um clip de aproximadamente cinco segundos a 720p. Não é uma cena. Não é um minuto de vídeo finalizado.

Eis a resposta curta antes dos detalhes. Uma placa com 24 GB renderiza um clip de cinco segundos a 720p em poucos minutos. Uma placa com 12 GB faz o mesmo trabalho em vinte minutos ou mais, porque os pesos não cabem na memória de vídeo e o software fica a mover camadas entre a memória de vídeo e a RAM do sistema. Um servidor sem GPU não consegue fazer isto de forma útil. O mesmo cálculo que torna lenta a geração de imagens na CPU torna inútil a geração de vídeo na CPU.

Se já leu a progressão de hardware para um gerador de imagens autoalojado, o vídeo segue o mesmo princípio, mas com todos os números deslocados uma classe acima. A VRAM (memória de vídeo, a RAM soldada junto ao chip gráfico) continua a ser a única especificação que determina se isto é simples ou penoso.

Por que um vídeo custa muito mais do que uma imagem

Um modelo de difusão gera uma imagem ao remover o ruído em várias etapas, e cada etapa lê todos os pesos do modelo. Um modelo de vídeo faz o mesmo com um bloco inteiro de frames de uma só vez e acrescenta atenção temporal, para que o frame 80 saiba como era o frame 12. Cinco segundos a 24 frames por segundo correspondem a 120 frames num único lote.

Essa atenção temporal explica por que o custo não cresce de forma linear com a duração do clip. Duplicar o número de frames aumenta em mais do que o dobro a memória necessária para o sampler. Por isso, o problema não é uma renderização mais lenta. É a renderização terminar com erro.

Existe um segundo pico de utilização de memória que muitas pessoas não esperam. Depois de o sampler terminar, o VAE (variational autoencoder, o componente que transforma o latent comprimido em pixels reais) descodifica todo o vídeo latente de uma só vez. Essa descodificação pode precisar de mais memória do que a amostragem. O sintoma é uma tarefa que mostra uma barra de progresso concluída e depois apresenta isto:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

A solução é usar descodificação em tiles ou um clip mais curto. Saber em que etapa ocorreu a falta de memória evita passar uma hora a ajustar o parâmetro errado.

Quanta VRAM é necessária para gerar vídeos com IA

Dois valores publicados enquadram toda a decisão, mas parecem contradizer-se. A Alibaba afirma que o modelo Wan 2.2 TI2V-5B produz clips a 720p, com 24 fotogramas por segundo e cinco segundos de duração, em menos de nove minutos numa única GPU de consumidor, como uma 4090, e recomenda pelo menos 24 GB de VRAM. A documentação do ComfyUI afirma que o mesmo modelo 5B "deve funcionar bem com 8 GB de VRAM usando o offloading nativo do ComfyUI".

Ambos estão corretos porque medem coisas diferentes. 8 GB é o mínimo em que o modelo cabe. 24 GB é onde funciona sem limitações significativas. O offloading mantém a maior parte do modelo na RAM do sistema e transfere as camadas para a GPU em cada passo. Assim, a placa passa o tempo à espera do barramento PCIe em vez de fazer cálculos. Esse custo ocorre em cada passo do sampler, não apenas uma vez.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Apenas a última linha é um valor do fornecedor. A placa de 24 GB demora 9 minutos por clip, que é o valor publicado pela Alibaba para este modelo. As outras linhas mostram o efeito do offloading, mas representam ordens de grandeza e não resultados de benchmark. O formato da comparação é o mais importante: 40 minutos numa placa de 8 GB é uma configuração tecnicamente funcional, mas, na prática, corresponde a um processamento em lote que se deixa a executar durante a noite.

Os modelos Wan 2.2 maiores pertencem a uma categoria diferente. As variantes A14B de texto para vídeo e de imagem para vídeo requerem pelo menos 80 GB de VRAM para inferência numa única GPU. Isso corresponde a hardware de centros de dados, não a uma placa instalada num computador de secretária. É também o ponto em que self-hosting começa a significar alugar o acelerador de outra pessoa à hora. O mesmo cálculo aplica-se numa escala muito maior ao processamento de texto, em que alojar localmente um modelo com 2,8 biliões de parâmetros como o Kimi K3 deixa de ser uma questão sobre uma única placa e passa a ser uma questão sobre quantas placas de 80 GB consegue pagar e ligar em conjunto.

Quanto custa um clip numa GPU alugada

Alugar uma GPU é a melhor forma de testar isto para a maioria das pessoas, porque uma placa que compre pode ser o hardware errado se o modelo que acabar por escolher precisar de 80 GB. Preços medianos sob demanda no mercado de aluguer de GPUs, em julho de 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

A linha da 4090 executa o modelo 5B e custa cerca de 0.05 dólares por clip, a 0.36 dólares por hora. As linhas com 80 GB executam os modelos 14B. Por isso, o custo por clip sobe para 0.6 dólares, embora o próprio hardware seja muito mais rápido. Um modelo maior exige mais computação por segundo de vídeo.

Cinco cêntimos por clip parecem insignificantes. Esse é o aspeto enganador. Os primeiros cinco segundos utilizáveis nunca resultam de um único render. Gerar vídeo com um modelo é um processo de pesquisa, e é normal fazer vinte a quarenta renders antes de obter um resultado aproveitável numa cena com movimentos específicos. Por isso, uma sessão de trabalho custa dólares, não cêntimos. Uma tarde de iteração em hardware alugado custa aproximadamente o mesmo que um almoço.

Dois detalhes do aluguer podem aumentar bastante os custos se não prestar atenção. A cobrança continua enquanto a máquina descarrega os pesos. Os ficheiros do Wan 2.2, juntamente com o respetivo codificador de texto e VAE, ocupam dezenas de gigabytes. Escolha um fornecedor com um volume persistente e faça o download apenas uma vez. A cobrança também continua enquanto a máquina fica inativa com a sessão SSH aberta. Pare a instância em vez de apenas fechar o terminal.

Instalar o ComfyUI no servidor com GPU

Comece com Ubuntu 24.04 e o controlador NVIDIA já instalado. Verifique primeiro o controlador, porque todas as falhas seguintes parecem iguais sem esta verificação.

nvidia-smi

O comando deve apresentar uma tabela com a sua placa e uma versão do CUDA. Se apresentar NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, o módulo do kernel não está carregado. Isto normalmente acontece depois de uma atualização do kernel sem reiniciar o sistema. Corrija o problema nesta etapa. Caso contrário, o ComfyUI usará o caminho da CPU e perderá tempo a investigar o modelo.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Confirme que o PyTorch deteta a placa antes de transferir um único ficheiro de pesos.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True juntamente com o nome da sua placa significa que a stack está funcional. False significa que o wheel instalado é a compilação apenas para CPU. Isto acontece quando o pip encontra uma versão em cache do torch de uma instalação anterior. Reinstale usando o URL do índice acima.

Descarregue os ficheiros do modelo Wan 2.2

O ComfyUI não inclui pesos, e um modelo de vídeo não é um único ficheiro. É composto por um modelo de difusão, um codificador de texto e um VAE. Cada componente deve ficar no seu próprio diretório. Se colocar um ficheiro na pasta errada, o nó carregador simplesmente não o apresenta, sem indicar o motivo do problema.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

O modelo 5B suporta conversão de texto em vídeo e de imagem em vídeo, por isso é um ponto de partida sensato. Prefira sempre .safetensors em vez de .ckpt. Um ficheiro .ckpt é um objeto Python serializado com pickle. Ao carregá-lo, executa código escrito por quem o criou. Reserve espaço suficiente em disco: uma instalação funcional com uma família de modelos e os respetivos ficheiros de saída requer 100 GB. Os ficheiros de vídeo são muito maiores do que as imagens PNG produzidas por um fluxo de trabalho de imagem. Faça cópias de segurança dos ficheiros JSON dos fluxos de trabalho, por exemplo com cópias de segurança incrementais encriptadas para armazenamento de objetos, porque os pesos podem ser descarregados novamente, mas os fluxos de trabalho ajustados não.

Execute e aceda com segurança

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

O ComfyUI não tem ecrã de início de sessão nem contas de utilizador. Qualquer pessoa que consiga aceder à porta 8188 pode colocar tarefas na fila, ler todos os clips que gerou e instalar custom nodes, o que permite executar código arbitrário no servidor. Faça o bind do serviço a localhost e aceda através de um túnel SSH a partir da sua própria máquina.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Em seguida, abra http://127.0.0.1:8188 no browser. Carregue o workflow de modelo Wan 2.2 a partir do menu de templates do ComfyUI, em vez de ligar os nodes manualmente. Os templates oficiais incluem as definições do sampler para as quais o modelo foi ajustado, e um workflow de vídeo tem muito mais pontos onde um valor pode ficar incorreto sem ser evidente do que um workflow de imagem.

Quando a resposta correta é usar uma API

O alojamento próprio de geração de vídeo é a opção certa quando o volume é elevado e constante, quando os seus frames não podem sair da sua própria infraestrutura ou quando precisa de um modelo específico ou de um adaptador personalizado que nenhum serviço alojado oferece. Também é a opção certa quando o pipeline tem de continuar a funcionar da mesma forma daqui a um ano, porque um modelo alojado pode mudar sem aviso e sem uma versão que possa fixar.

Use uma API alojada quando precisa de alguns clips por mês, quando precisa de uma saída mais longa ou maior do que a produzida pelos modelos abertos ou quando tem um prazo para esta semana. Calcule o ponto de equilíbrio com valores realistas. Uma placa de 24 GB alugada continuamente ao preço mediano de julho de 2026 custa aproximadamente 260 dólares por mês, e comprar a mesma placa custa mais do que isso à partida, antes de gerar um único frame. Um servidor alojado internamente que fica inativo perde sempre para o preço de uma API por clip. Esta é a mesma decisão que determina como disponibiliza modelos de texto, explicada em Ollama versus vLLM para disponibilizar LLMs alojados internamente, e baseia-se na questão mais básica de saber se uma VPS com GPU vale sequer o custo.

O que verificar quando uma renderização falha

Uma renderização que termina abruptamente no fim, depois de a barra do sampler ser concluída, ficou sem memória durante a descodificação no VAE. Reduza o número de frames ou mude para um node de descodificação por blocos. Alterar o número de steps não resolve, porque a descodificação ocorre uma vez, depois de todos os steps terem sido executados.

Uma saída totalmente preta ou muito corrompida normalmente indica que o VAE não corresponde ao modelo. Carregar um VAE Wan 2.1 com um modelo de difusão Wan 2.2 produz exatamente esse resultado, sem qualquer erro no log.

Uma renderização que funciona, mas demora horas numa máquina que tem uma GPU, indica que o ComfyUI está a usar o caminho da CPU. Verifique a linha do dispositivo no log de arranque e execute novamente a verificação torch.cuda.is_available() acima.

Se o processo desaparecer com Killed em dmesg e sem traceback do Python, trata-se do mecanismo do kernel que termina processos por falta de memória. Neste caso, o problema está na RAM do sistema, não na VRAM. O offloading precisa que o modelo completo esteja residente na RAM do sistema. Por isso, uma máquina com 16 GB que faça offloading de um modelo 5B fica sem memória. Adicione RAM ou espaço de swap.

FAQ

Posso gerar vídeo com IA numa VPS sem GPU?

Não, pelo menos não de uma forma que queira repetir. Um clipe de cinco segundos em 720p que demora nove minutos numa GPU de 24 GB pode demorar muitas horas num CPU, porque o modelo não dispõe de hardware matricial para executar os cálculos e a largura de banda da RAM do sistema é uma ordem de grandeza inferior à largura de banda da memória da GPU. Um servidor com CPU pode alojar a interface do ComfyUI, armazenar os modelos e manter os workflows, mas a renderização precisa de uma GPU.

De quanta VRAM preciso para o Wan 2.2?

Para o modelo TI2V-5B, 8 GB é o mínimo com o offloading nativo do ComfyUI, e 24 GB é o valor que a Alibaba recomenda para atingir a velocidade publicada. Para os modelos A14B de texto para vídeo e imagem para vídeo, o model card exige pelo menos 80 GB de VRAM para inferência numa única GPU. Por isso, estes modelos precisam de placas para data centers.

Qual pode ser a duração de um clipe autoalojado?

Cerca de cinco segundos em 720p é a unidade prática em julho de 2026. Um resultado mais longo é produzido através da geração de segmentos e da sua junção, usando o último frame de um segmento como o primeiro frame do seguinte. A qualidade sofre alterações nas junções. Por isso, trate um vídeo longo como um trabalho de edição, e não como uma única geração.

Alugar uma GPU à hora fica mais barato do que comprar uma placa?

Alugar é vantajoso quando a renderização ocupa menos de algumas horas por dia. Com a mediana de julho de 2026, de cerca de 0.36 dólares por hora por uma placa de 24 GB, pode alugar durante muito tempo antes de igualar o preço de compra dessa placa. Também evita comprar hardware que se revele inadequado para a classe do modelo que realmente pretende usar. Comprar só é vantajoso quando o servidor está ocupado durante a maior parte do dia, todos os dias.