자체 호스팅 AI 동영상 생성기의 현실
2026년 7월 오픈 동영상 모델의 실제 결과와 필요한 VRAM을 비교합니다. 720p 5초 클립의 임대 GPU 비용, 24 GB와 12 GB의 속도 차이, API를 선택할 시점까지 설명합니다.
자체 호스팅 AI 동영상 생성기로 실제로 할 수 있는 작업
자체 호스팅 AI 동영상 생성기는 현재 사용할 수 있지만, 데모 영상이 보여 주는 것보다 느리고 생성 범위도 작습니다. 2026년 7월 기준으로 실행할 가치가 있는 오픈 모델은 Alibaba의 Wan 2.2와 Tencent의 HunyuanVideo입니다. 속도가 사실감보다 중요하다면 Lightricks의 LTX-Video도 사용할 수 있습니다. 이 모델은 모두 NVIDIA GPU가 장착된 Linux 시스템에서 ComfyUI로 실행됩니다. 생성 결과는 720p 해상도의 약 5초짜리 클립입니다. 하나의 장면 전체가 아닙니다. 완성된 영상 1분도 아닙니다.
자세한 설명에 앞서 요점부터 말하면 다음과 같습니다. 24 GB 그래픽 카드는 720p 해상도의 5초 클립을 몇 분 안에 렌더링합니다. 12 GB 그래픽 카드는 같은 작업에 20분 이상 걸립니다. 가중치가 비디오 메모리에 들어가지 않기 때문에 소프트웨어가 레이어를 시스템 RAM으로 계속 이동시키기 때문입니다. GPU가 없는 서버로는 실용적인 수준의 동영상 생성을 수행할 수 없습니다. CPU 이미지 생성을 느리게 만드는 연산량 때문에 CPU 동영상 생성은 사실상 의미가 없습니다.
이미 자체 호스팅 이미지 생성기를 위한 하드웨어 단계를 읽었다면, 동영상 생성도 같은 논리이며 모든 수치가 한 단계씩 올라간다고 보면 됩니다. VRAM(비디오 메모리, 그래픽 칩 옆에 납땜된 RAM)은 여전히 이 작업이 쾌적한지 고통스러운지를 결정하는 유일한 사양입니다.
이미지 1개보다 동영상 1개의 비용이 훨씬 높은 이유
diffusion model은 여러 단계로 denoising하여 이미지를 생성하며, 각 단계에서 model의 모든 weight를 읽습니다. video model은 전체 frame 블록에 같은 작업을 한 번에 수행합니다. 또한 시간축에 걸쳐 attention을 적용하므로 frame 80은 frame 12의 내용을 알 수 있습니다. 초당 24 frames로 5초를 처리하면 하나의 batch에 120 frames가 포함됩니다.
이 temporal attention 때문에 clip 길이에 따른 비용은 단순히 비례하여 증가하지 않습니다. frame 수를 2배로 늘리면 sampler에 필요한 memory는 2배보다 많이 증가합니다. 따라서 발생하는 문제는 rendering이 느려지는 것이 아닙니다. render 작업 자체가 중단됩니다.
예상하지 못하는 두 번째 memory 급증도 있습니다. sampler가 완료되면 VAE (variational autoencoder, 압축된 latent를 실제 pixel로 변환하는 구성 요소)가 전체 latent video를 한 번에 decode합니다. 이 decode에는 sampling보다 더 많은 memory가 필요할 수 있습니다. 진행률 표시줄이 완료된 뒤 다음 메시지가 출력되는 것이 증상입니다.
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB해결 방법은 tiled decoding을 사용하거나 clip을 더 짧게 설정하는 것입니다. 어느 단계에서 memory가 부족해졌는지 확인하면 한 시간 동안 잘못된 설정을 조정하는 일을 피할 수 있습니다.
AI 동영상 생성에 필요한 VRAM 용량
두 가지 공개 수치가 전체 판단 기준을 제시하지만, 서로 모순되는 것처럼 보입니다. Alibaba는 Wan 2.2 TI2V-5B 모델이 4090과 같은 단일 소비자용 GPU에서 720p 클립을 초당 24프레임, 5초 길이로 9분 이내에 생성한다고 설명하며, 최소 24 GB의 VRAM을 권장합니다. ComfyUI 문서에는 동일한 5B 모델이 "ComfyUI native offloading을 사용하면 8GB vram에서 잘 실행되어야 한다"고 나와 있습니다.
두 내용은 측정하는 대상이 다르기 때문에 모두 맞습니다. 8 GB는 모델이 들어가는 용량입니다. 24 GB는 여유 있게 실행할 수 있는 용량입니다. Offloading은 모델 대부분을 system RAM에 유지하고 각 단계마다 레이어를 GPU로 전송하는 방식으로 작동합니다. 따라서 GPU는 연산보다 PCIe 버스의 데이터 전송을 기다리는 데 더 많은 시간을 씁니다. 이 비용은 한 번만 발생하는 것이 아니라 sampler의 모든 단계에서 발생합니다.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]마지막 행만 vendor가 제공한 수치입니다. 24 GB 카드는 클립 1개를 9분에 생성하며, 이는 Alibaba가 이 모델에 대해 공개한 수치입니다. 나머지 행은 offloading이 성능에 미치는 영향을 나타내며, benchmark 결과가 아니라 규모를 보여 주는 추정치입니다. 핵심은 추세입니다. 8 GB 카드에서 40분이 걸리는 구성은 기술적으로 작동하지만, 실제로는 밤새 실행해 두는 batch 작업에 가깝습니다.
더 큰 Wan 2.2 모델은 전혀 다른 범주에 속합니다. A14B text-to-video 및 image-to-video 변형은 단일 GPU 추론에 최소 80 GB의 VRAM을 요구합니다. 이는 데이터센터용 하드웨어이며 데스크 머신에 장착하는 카드가 아닙니다. 이 지점부터 self-hosted는 시간 단위로 다른 사람의 accelerator를 임대하는 것을 의미하기 시작합니다.
대여한 GPU에서 클립 하나를 생성하는 비용
대부분의 사용자는 먼저 대여 방식으로 이 작업을 테스트해야 합니다. 원하는 모델에 80 GB가 필요하다면 직접 구매한 카드는 적합한 하드웨어가 아니기 때문입니다. 2026년 7월 기준 GPU 대여 시장의 온디맨드 가격 중앙값은 다음과 같습니다.
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 행에서는 5B 모델을 실행하며, 시간당 0.36달러로 클립당 약 0.05달러가 듭니다. 80 GB 행에서는 14B 모델을 실행합니다. 따라서 하드웨어 자체는 훨씬 빠르지만 클립당 비용은 0.6달러까지 증가합니다. 모델이 클수록 비디오 1초를 생성하는 데 더 많은 연산이 필요합니다.
클립 하나에 5센트라면 아무것도 아닌 것처럼 보입니다. 그러나 이것이 오해를 일으키는 부분입니다. 실제로 사용할 수 있는 첫 5초 분량을 얻기 위해 렌더링을 한 번만 수행하는 경우는 없습니다. 비디오 모델을 프롬프트로 조정하는 작업은 검색 과정입니다. 특정 동작이 포함된 장면이라면 결과물을 선택하기 전까지 20~40회 렌더링하는 것이 일반적입니다. 따라서 한 번의 작업 세션에는 센트가 아니라 수달러가 들며, 대여한 하드웨어로 오후 내내 반복 작업을 수행하면 점심 식사 비용 정도가 듭니다.
대여와 관련해 놓치면 실제 비용이 발생하는 세부 사항이 2가지 있습니다. 인스턴스가 가중치를 다운로드하는 동안에도 요금이 청구됩니다. Wan 2.2 파일과 text encoder 및 VAE의 크기는 수십 GB에 이르므로 persistent volume을 제공하는 공급자를 선택하고 한 번만 다운로드해야 합니다. 또한 SSH 세션을 연 채 인스턴스를 유휴 상태로 두는 동안에도 요금이 청구됩니다. 터미널만 닫지 말고 인스턴스를 중지해야 합니다.
GPU box에 ComfyUI 설치
NVIDIA 드라이버가 이미 설치된 Ubuntu 24.04에서 시작합니다. 먼저 드라이버를 확인합니다. 이 확인을 하지 않으면 이후의 모든 오류가 동일하게 보입니다.
nvidia-smi출력에 GPU 카드와 CUDA 버전이 포함된 표가 표시되어야 합니다. NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver가 출력되면 커널 모듈이 로드되지 않은 상태입니다. 일반적으로 커널을 업그레이드한 후 재부팅하지 않았을 때 발생합니다. 여기서 문제를 해결합니다. 그렇지 않으면 ComfyUI가 CPU 경로로 전환되어 모델을 탓하며 한 시간을 허비하게 됩니다.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt가중치 파일을 하나라도 다운로드하기 전에 PyTorch가 GPU 카드를 인식하는지 확인합니다.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True와 GPU 카드 이름이 함께 표시되면 스택이 정상입니다. False이 표시되면 설치된 wheel이 CPU 전용 빌드라는 뜻입니다. pip가 이전 설치에서 캐시된 torch를 찾을 때 발생합니다. 위의 index URL을 사용하여 다시 설치합니다.
Wan 2.2 모델 파일 다운로드
ComfyUI에는 가중치가 포함되어 있지 않으며, 비디오 모델은 하나의 파일로 구성되지 않습니다. 확산 모델, 텍스트 인코더, VAE로 구성되며 각각 별도의 디렉터리에 넣어야 합니다. 파일을 잘못된 폴더에 넣으면 로더 노드에 해당 파일이 표시되지 않습니다. 그 이유를 설명하는 오류도 발생하지 않습니다.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B 모델은 text-to-video와 image-to-video를 모두 지원하므로 시작점으로 적합합니다. 항상 .ckpt보다 .safetensors를 우선 사용합니다. .ckpt 파일은 pickle로 직렬화된 Python 객체이므로, 파일을 로드하면 파일을 만든 사람이 작성한 코드가 실행됩니다. 디스크 공간은 충분히 확보해야 합니다. 모델 제품군 하나와 출력 파일을 포함한 정상적인 설치에는 100 GB가 필요하며, 비디오 파일은 이미지 워크플로에서 생성되는 PNG 이미지보다 훨씬 큽니다. 가중치는 다시 다운로드할 수 있지만 조정한 워크플로는 다시 만들기 어렵습니다. 따라서 object storage에 대한 암호화된 증분 백업과 같은 방식으로 워크플로 JSON 파일을 백업합니다.
실행하고 안전하게 접속하기
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI에는 로그인 화면과 사용자 계정이 없습니다. port 8188에 접속할 수 있는 모든 사용자는 작업을 대기열에 추가하고, 생성한 모든 clip을 읽고, custom nodes를 설치할 수 있습니다. 이는 서버에서 임의의 코드를 실행하는 것과 같습니다. ComfyUI를 localhost에 바인딩하고 자체 머신에서 SSH 터널을 통해 접속합니다.
ssh -N -L 8188:127.0.0.1:8188 you@your-server그런 다음 브라우저에서 http://127.0.0.1:8188를 엽니다. 노드를 직접 연결하지 말고 ComfyUI templates 메뉴에서 Wan 2.2 template workflow를 불러옵니다. 공식 templates에는 해당 모델에 맞게 조정된 sampler 설정이 포함되어 있습니다. 또한 video workflow는 image workflow보다 값을 잘못 설정할 수 있는 지점이 훨씬 많습니다.
API를 사용하는 것이 정직한 답인 경우
셀프 호스팅 동영상 생성은 처리량이 많고 일정할 때, 프레임이 자체 인프라 밖으로 나가면 안 될 때, 또는 호스팅 서비스에서 제공하지 않는 특정 모델이나 사용자 지정 어댑터가 필요할 때 적합합니다. 1년 후에도 파이프라인이 동일하게 작동해야 할 때도 적합합니다. 호스팅 모델은 고정할 버전 없이 변경될 수 있기 때문입니다.
한 달에 클립 몇 개만 필요할 때, 오픈 모델이 생성하는 것보다 더 길거나 큰 출력을 원할 때, 또는 이번 주에 마감일이 있을 때는 호스팅 API를 사용합니다. 손익분기점을 현실적으로 계산합니다. 2026년 7월 기준 중간값으로 24 GB 카드를 24시간 대여하면 한 달에 대략 260달러입니다. 같은 카드를 구매하면 프레임을 하나 생성하기 전부터 이보다 많은 비용을 선불로 지불해야 합니다. 유휴 상태인 셀프 호스팅 서버는 항상 클립당 API 요금보다 불리합니다. 이는 텍스트 모델을 제공하는 방식을 결정하는 것과 동일한 선택이며, 셀프 호스팅 LLM 제공을 위한 Ollama와 vLLM 비교에서 다룹니다. 또한 GPU가 장착된 VPS가 비용을 지불할 가치가 있는지 여부에서 다루는 더 기본적인 질문을 전제로 합니다.
렌더링이 실패할 때 확인할 사항
샘플러 막대가 완료된 후 렌더링이 마지막 단계에서 중단되면 VAE 디코딩 중 메모리가 부족한 것입니다. 프레임 수를 줄이거나 타일 방식 디코딩 노드로 전환합니다. 모든 단계가 이미 실행된 후 디코딩이 한 번 수행되므로 스텝 수를 변경해도 도움이 되지 않습니다.
출력이 완전히 검은색이거나 심하게 깨져 있으면 대개 VAE가 모델과 일치하지 않는다는 의미입니다. Wan 2.1 VAE를 Wan 2.2 diffusion 모델에 로드하면 정확히 이런 현상이 발생하며, 로그 어디에도 오류가 나타나지 않습니다.
GPU가 있는 것으로 알고 있는 시스템에서 렌더링은 실행되지만 몇 시간이 걸리면 ComfyUI가 CPU 경로로 실행되고 있는 것입니다. 시작 로그에서 장치 행을 확인한 다음, 위의 torch.cuda.is_available() 검사를 다시 실행합니다.
dmesg에서 Killed과 함께 프로세스가 사라지고 Python traceback이 표시되지 않으면 kernel의 out-of-memory killer가 프로세스를 종료한 것입니다. 따라서 문제는 VRAM이 아니라 시스템 RAM입니다. Offloading을 사용하려면 전체 모델이 시스템 RAM에 상주해야 하므로, 5B 모델을 offloading하는 16 GB 시스템은 메모리가 부족합니다. RAM을 추가하거나 swap을 추가합니다.
FAQ
GPU가 없는 VPS에서 AI 동영상을 생성할 수 있습니까?
아니요. 두 번 이상 사용할 방식으로는 어렵습니다. 24 GB GPU에서 9분이 걸리는 720p 5초 클립은 CPU에서 여러 시간이 걸립니다. 모델을 실행할 행렬 연산 하드웨어가 없고 시스템 RAM 대역폭이 GPU 메모리 대역폭보다 한 자릿수 이상 낮기 때문입니다. CPU 서버는 ComfyUI 인터페이스를 호스팅하고 모델을 저장하며 워크플로를 보관할 수 있습니다. 그러나 실제 렌더링에는 GPU가 필요합니다.
Wan 2.2에 필요한 VRAM 용량은 얼마입니까?
TI2V-5B 모델에는 ComfyUI 기본 오프로딩을 사용할 때 최소 8 GB가 필요합니다. 게시된 속도를 얻으려면 Alibaba는 24 GB를 권장합니다. A14B text-to-video 및 image-to-video 모델의 경우 모델 카드에서 단일 GPU 추론에 최소 80 GB VRAM을 요구합니다. 따라서 이러한 모델에는 데이터센터 카드가 필요합니다.
자체 호스팅 클립은 얼마나 길게 만들 수 있습니까?
2026년 7월 기준으로 720p 약 5초가 실용적인 단위입니다. 더 긴 출력은 여러 세그먼트를 생성한 다음 연결하여 만듭니다. 이때 한 세그먼트의 마지막 프레임을 다음 세그먼트의 첫 프레임으로 사용합니다. 연결 지점마다 품질이 변할 수 있습니다. 따라서 긴 동영상은 한 번의 생성 작업이 아니라 편집 작업으로 처리해야 합니다.
GPU를 구매하는 것보다 시간 단위로 대여하는 것이 저렴합니까?
하루 렌더링 시간이 몇 시간 미만이면 대여가 유리합니다. 2026년 7월 기준 24 GB 카드의 시간당 중간 가격은 약 0.36 dollars입니다. 이 가격으로는 해당 카드의 구매 가격에 도달하기 전까지 오랫동안 대여할 수 있습니다. 실제로 사용하려는 모델에 맞지 않는 등급의 하드웨어를 구매하는 위험도 피할 수 있습니다. 장비가 매일 대부분의 시간 동안 계속 사용될 때만 구매가 유리합니다.