자체 호스팅 AI 비디오 생성기 실제 성능과 하드웨어 요구사항
2026년 7월 기준 Wan 2.2와 HunyuanVideo 등 오픈 모델의 실제 성능을 분석합니다. 24GB VRAM 환경에서의 렌더링 속도와 12GB 이하 GPU에서 발생하는 메모리 병목 현상, 그리고 클라우드 GPU 대여 비용과 API 활용이 필요한 시점을 구체적으로 정리했습니다.
자체 호스팅 AI 비디오 생성기의 실제 성능
자체 호스팅 AI 비디오 생성기는 현재 작동은 하지만, 데모 영상에서 보여주는 것보다 속도가 느리고 규모도 작습니다. 2026년 7월 기준으로 실행할 가치가 있는 오픈 모델은 Alibaba의 Wan 2.2와 Tencent의 HunyuanVideo가 있으며, 사실성보다 속도가 중요할 때는 Lightricks의 LTX-Video를 사용합니다. 이 모든 모델은 NVIDIA GPU가 탑재된 Linux 머신에서 ComfyUI를 통해 실행됩니다. 결과물은 720p 해상도의 약 5초 분량 클립입니다. 전체 장면이나 1분짜리 완성된 영상이 아닙니다.
상세한 내용에 앞서 결론부터 말씀드립니다. 24 GB VRAM 카드는 5초짜리 720p 클립을 한 자릿수 분 단위로 렌더링합니다. 12 GB 카드는 모델 가중치가 비디오 메모리에 모두 올라가지 않아 소프트웨어가 레이어를 시스템 RAM으로 계속 옮겨야 하므로, 같은 작업에 20분 이상이 소요됩니다. GPU가 없는 서버에서는 실용적인 수준의 생성이 불가능합니다. CPU 기반 이미지 생성이 느린 것과 같은 산술적 이유로, CPU 기반 비디오 생성은 무의미합니다.
자체 호스팅 이미지 생성기를 위한 하드웨어 단계를 이미 읽으셨다면, 비디오 생성은 그 논리에서 모든 수치가 한 단계씩 상향 조정된 것과 같습니다. VRAM(그래픽 칩 옆에 납땜된 비디오 메모리)은 여전히 이 작업이 즐거울지 고통스러울지를 결정하는 유일한 사양입니다.
비디오 한 편이 이미지 한 장보다 훨씬 비싼 이유
확산 모델(diffusion model)은 단계를 거쳐 노이즈를 제거하며 이미지를 생성하는데, 각 단계마다 모델의 모든 가중치를 읽어 들입니다. 비디오 모델도 프레임 전체 블록에 대해 동일한 작업을 수행하며, 여기에 시간 축에 따른 어텐션(attention)을 추가하여 80번째 프레임이 12번째 프레임의 모습을 참조할 수 있게 합니다. 초당 24프레임으로 5초를 생성하면 한 번의 배치에 120개의 프레임이 포함됩니다.
이러한 시간적 어텐션 때문에 비용은 클립 길이에 비례하여 완만하게 증가하지 않습니다. 프레임 수를 2배로 늘리면 샘플러가 필요로 하는 메모리는 2배 이상 증가하므로, 문제가 발생할 경우 단순히 렌더링이 느려지는 것이 아니라 렌더링 자체가 중단됩니다.
사람들이 예상하지 못하는 두 번째 메모리 급증 구간이 있습니다. 샘플러 작업이 끝나면 VAE(variational autoencoder, 압축된 잠재 공간을 실제 픽셀로 변환하는 구성 요소)가 전체 잠재 비디오를 한꺼번에 디코딩합니다. 이 디코딩 과정에서 샘플링 단계보다 더 많은 메모리가 필요할 수 있습니다. 이때 나타나는 증상은 진행률 표시줄은 완료된 것으로 나오지만 다음과 같은 오류가 출력되는 것입니다.
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB이 문제를 해결하려면 타일 디코딩(tiled decoding)을 사용하거나 클립 길이를 줄여야 합니다. 어느 단계에서 메모리가 부족한지 파악하면 엉뚱한 설정을 조정하며 시간을 낭비하는 일을 방지할 수 있습니다.
AI 비디오 생성에 필요한 VRAM 용량
두 가지 발표된 수치가 전체적인 판단 기준을 형성하며, 이들은 서로 모순되는 것처럼 보입니다. Alibaba는 Wan 2.2 TI2V-5B 모델이 4090과 같은 단일 소비자용 GPU에서 720p 클립을 초당 24프레임, 5초 분량으로 9분 이내에 생성한다고 명시하며, 최소 24 GB의 VRAM을 권장합니다. 반면 ComfyUI 문서에서는 동일한 5B 모델이 "ComfyUI 네이티브 오프로딩을 사용하면 8 GB VRAM에서도 충분히 구동된다"고 설명합니다.
두 수치 모두 측정 기준이 다르기 때문에 사실입니다. 8 GB는 구동이 가능한 최소 사양이고, 24 GB는 쾌적한 환경을 위한 사양입니다. 오프로딩은 모델의 대부분을 시스템 RAM에 유지하고 매 단계마다 레이어를 GPU로 스트리밍하는 방식으로 작동하므로, 그래픽 카드는 연산 대신 PCIe 버스에서 데이터를 기다리는 데 시간을 소비하게 됩니다. 이 비용은 한 번이 아니라 모든 샘플러 단계마다 발생합니다.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]마지막 행만 제조사가 발표한 수치입니다. 24 GB 카드는 클립당 9분이 소요되며, 이는 이 모델에 대해 Alibaba가 발표한 수치와 일치합니다. 다른 행들은 오프로딩이 성능에 미치는 영향을 보여주며, 이는 벤치마크 결과라기보다 규모의 차이를 나타냅니다. 핵심은 그 형태입니다. 8 GB 카드에서 40분이 소요되는 것은 기술적으로는 작동하는 설정이지만, 실제로는 밤새 실행해 두어야 하는 배치 작업에 가깝습니다.
더 큰 규모의 Wan 2.2 모델은 차원이 다릅니다. A14B 텍스트-비디오 및 이미지-비디오 변형 모델은 단일 GPU 추론을 위해 최소 80 GB의 VRAM을 요구합니다. 이는 데스크톱에 장착하는 카드가 아닌 데이터 센터용 하드웨어이며, 이때부터는 셀프 호스팅의 의미가 시간당 비용을 지불하고 타인의 가속기를 대여하는 것으로 바뀝니다. 동일한 계산 방식이 텍스트 분야로 넘어가면 훨씬 더 복잡해지는데, Kimi K3와 같은 2.8조 파라미터 모델을 셀프 호스팅하는 것은 이제 단일 카드 문제가 아니라 80 GB 카드를 몇 개나 연결할 수 있는지에 대한 예산 문제로 변합니다.
임대 GPU에서 클립당 발생하는 비용
대부분의 사용자는 GPU를 구매하기보다 임대하여 테스트하는 것이 좋습니다. 최종적으로 사용하려는 모델이 80 GB의 메모리를 요구할 경우, 구매한 카드는 하드웨어 사양이 맞지 않을 수 있기 때문입니다. 2026년 7월 기준, GPU 임대 시장의 온디맨드 가격 중앙값은 다음과 같습니다.
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 행은 5B 모델을 구동하며, 시간당 0.36 달러의 비용으로 클립당 약 0.05 달러가 소요됩니다. 80 GB 행은 14B 모델을 구동하며, 하드웨어 자체는 훨씬 빠르지만 클립당 비용은 0.6 달러로 상승합니다. 모델이 클수록 영상 1초당 더 많은 연산이 필요하기 때문입니다.
클립당 5센트라는 비용은 적게 느껴질 수 있지만, 이는 오해의 소지가 있습니다. 처음부터 바로 사용할 수 있는 5초 분량의 결과물을 한 번의 렌더링으로 얻기는 어렵습니다. 비디오 모델에 프롬프트를 입력하는 과정은 탐색에 가깝습니다. 특정 움직임이 포함된 샷을 얻으려면 보통 20회에서 40회 정도의 렌더링을 거쳐야 합니다. 따라서 실제 작업 세션에는 센트 단위가 아닌 달러 단위의 비용이 발생하며, 임대 하드웨어에서 오후 내내 반복 작업을 수행하면 점심 식사 비용 정도가 소요됩니다.
임대 시 다음 두 가지 세부 사항을 놓치면 실제 비용이 낭비됩니다. 첫째, 모델 가중치를 다운로드하는 동안에도 요금이 부과됩니다. Wan 2.2 파일은 텍스트 인코더와 VAE를 포함하여 수십 GB에 달하므로, 영구 볼륨(persistent volume)을 지원하는 제공자를 선택하여 한 번만 다운로드하십시오. 둘째, SSH 세션을 열어둔 채로 유휴 상태일 때도 요금이 부과됩니다. 터미널만 닫지 말고 반드시 인스턴스를 중지하십시오.
GPU 서버에 ComfyUI 설치하기
NVIDIA 드라이버가 설치된 Ubuntu 24.04 환경에서 시작합니다. 이후 발생하는 모든 오류는 드라이버 문제와 증상이 동일하므로, 가장 먼저 드라이버를 확인해야 합니다.
nvidia-smi이 명령을 실행하면 그래픽 카드 정보와 CUDA 버전이 포함된 표가 출력되어야 합니다. 만약 NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver가 출력된다면 커널 모듈이 로드되지 않은 상태이며, 이는 보통 커널 업데이트 후 재부팅을 하지 않았을 때 발생합니다. 이 단계에서 문제를 해결하십시오. 그렇지 않으면 ComfyUI가 CPU 모드로 동작하게 되어, 모델 문제로 오해하며 시간을 낭비하게 됩니다.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt모델 가중치 파일을 다운로드하기 전에 PyTorch가 그래픽 카드를 인식하는지 확인하십시오.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"True과 함께 그래픽 카드 이름이 출력되면 스택이 정상입니다. False이 출력된다면 CPU 전용 빌드가 설치된 상태이며, 이는 pip가 이전 설치에서 캐시된 torch를 찾았을 때 발생합니다. 위에서 명시한 index URL을 사용하여 재설치하십시오.
Wan 2.2 모델 파일 다운로드
ComfyUI는 가중치 파일을 포함하지 않으며, 비디오 모델은 단일 파일로 구성되지 않습니다. 이 모델은 확산 모델(diffusion model), 텍스트 인코더, VAE로 나뉘며 각 구성 요소는 지정된 디렉터리에 배치해야 합니다. 파일을 잘못된 폴더에 넣으면 로더 노드에서 해당 파일이 표시되지 않으며, 왜 표시되지 않는지에 대한 오류 메시지도 출력되지 않습니다.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B 모델은 텍스트-비디오 및 이미지-비디오 변환을 모두 처리하므로 시작점으로 적합합니다. 항상 .ckpt보다는 .safetensors를 우선적으로 사용하십시오. .ckpt 파일은 파이썬 객체를 직렬화한 것이므로, 이를 로드하면 파일을 생성한 사람이 작성한 코드가 실행됩니다. 디스크 공간은 넉넉하게 확보하십시오. 모델 제품군 하나와 출력물을 포함한 정상적인 설치 환경은 100 GB의 공간을 요구하며, 비디오 파일은 이미지 워크플로우에서 생성되는 PNG 파일보다 훨씬 큽니다. 가중치 파일은 다시 다운로드할 수 있지만 정교하게 조정된 워크플로우는 복구할 수 없으므로, 객체 스토리지로의 암호화된 증분 백업과 같은 방법을 사용하여 워크플로우 JSON 파일을 백업하십시오.
실행 및 안전한 접속
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI에는 로그인 화면이나 사용자 계정 기능이 없습니다. 포트 8188에 접근할 수 있는 모든 사용자는 작업을 대기열에 추가하고, 생성된 모든 클립을 읽으며, 커스텀 노드를 설치할 수 있습니다. 이는 서버에서 임의의 코드를 실행할 수 있음을 의미합니다. 따라서 localhost에 바인딩하고 본인의 로컬 머신에서 SSH 터널을 통해 접속하십시오.
ssh -N -L 8188:127.0.0.1:8188 you@your-server그런 다음 브라우저에서 http://127.0.0.1:8188를 엽니다. 노드를 직접 연결하는 대신 ComfyUI 템플릿 메뉴에서 Wan 2.2 템플릿 워크플로우를 불러오십시오. 공식 템플릿에는 모델이 튜닝된 샘플러 설정이 포함되어 있습니다. 비디오 워크플로우는 이미지 워크플로우보다 설정값을 잘못 입력하기 쉬운 부분이 훨씬 많습니다.
API를 사용하는 것이 합리적인 경우
비디오 생성 서비스를 직접 호스팅하는 것이 적절한 경우는 생성량이 많고 일정할 때, 프레임 데이터가 인프라 외부로 유출되어서는 안 될 때, 또는 호스팅 서비스에서 제공하지 않는 특정 모델이나 커스텀 어댑터가 필요할 때입니다. 또한 호스팅 모델은 버전 고정 없이 예고 없이 변경될 수 있으므로, 1년 뒤에도 파이프라인이 동일하게 작동해야 한다면 직접 호스팅하는 것이 옳습니다.
한 달에 몇 개의 클립만 필요하거나, 오픈 모델이 생성하는 것보다 더 길거나 큰 결과물이 필요하거나, 이번 주까지 마감 기한이 있다면 호스팅된 API를 사용하십시오. 손익분기점을 정직하게 계산해야 합니다. 2026년 7월 기준 24 GB 그래픽 카드를 24시간 내내 대여하는 비용은 대략 한 달에 260 달러이며, 동일한 카드를 구매하는 비용은 프레임을 단 한 장도 생성하기 전에 이미 그 이상의 비용이 발생합니다. 사용하지 않는 호스팅 장비는 클립당 과금되는 API 가격보다 항상 비효율적입니다. 이는 자체 호스팅 LLM 서빙을 위한 Ollama와 vLLM 비교에서 다룬 텍스트 모델 서빙 방식 결정과 동일한 트레이드오프이며, GPU가 포함된 VPS가 비용 가치가 있는지 여부에서 다룬 더 기본적인 질문과도 맞닿아 있습니다.
렌더링 실패 시 확인 사항
샘플러 바가 완료된 직후 렌더링이 중단된다면 VAE 디코드 과정에서 메모리가 부족한 것입니다. 프레임 수를 줄이거나 tiled decode 노드로 전환하십시오. 모든 단계가 이미 실행된 후 디코드가 한 번 수행되므로, 스텝 수를 변경하는 것은 도움이 되지 않습니다.
결과물이 완전히 검은색이거나 심하게 깨져서 나온다면 대개 VAE가 모델과 일치하지 않는 경우입니다. Wan 2.1 VAE를 Wan 2.2 디퓨전 모델에 로드하면 정확히 이러한 현상이 발생하며, 로그에는 어떠한 오류도 나타나지 않습니다.
GPU가 장착된 시스템임에도 렌더링에 수 시간이 소요된다면 ComfyUI가 CPU 경로에서 실행 중인 것입니다. 시작 로그에서 장치 관련 행을 확인한 뒤, 위의 torch.cuda.is_available() 점검을 다시 수행하십시오.
dmesg에서 Killed과 함께 프로세스가 사라지고 Python 트레이스백이 남지 않는다면 커널의 out-of-memory killer가 작동한 것이며, 이는 VRAM이 아닌 시스템 RAM 부족을 의미합니다. 오프로딩(offloading)을 수행하려면 모델 전체가 시스템 RAM에 상주해야 하므로, 16 GB RAM을 가진 시스템에서 5B 모델을 오프로딩하기에는 용량이 부족합니다. RAM을 추가하거나 스왑(swap) 공간을 확보하십시오.
FAQ
GPU가 없는 VPS에서 AI 영상을 생성할 수 있습니까?
아니요, 실용적인 방법은 아닙니다. 24 GB GPU에서 9분 걸리는 5초 분량의 720p 영상은 CPU에서 수 시간이 소요됩니다. 모델을 구동할 행렬 연산 하드웨어가 없고, 시스템 RAM 대역폭이 GPU 메모리 대역폭보다 훨씬 낮기 때문입니다. CPU 서버는 ComfyUI 인터페이스를 호스팅하고 모델과 워크플로우를 저장하는 용도로는 사용할 수 있지만, 렌더링 자체에는 GPU가 필수입니다.
Wan 2.2를 구동하려면 VRAM이 얼마나 필요합니까?
TI2V-5B 모델의 경우 ComfyUI 네이티브 오프로딩을 사용하면 8 GB가 최소 사양이며, 발표된 속도를 내려면 Alibaba가 권장하는 24 GB가 필요합니다. A14B 텍스트-투-비디오 및 이미지-투-비디오 모델의 경우 모델 카드에서 단일 GPU 추론 시 최소 80 GB의 VRAM을 요구하므로 데이터 센터용 카드가 필요합니다.
자체 호스팅으로 생성할 수 있는 영상의 길이는 어느 정도입니까?
2026년 7월 기준으로 720p 해상도에서 약 5초가 실용적인 단위입니다. 더 긴 영상을 만들려면 세그먼트를 나누어 생성한 뒤, 앞 세그먼트의 마지막 프레임을 다음 세그먼트의 첫 프레임으로 사용하여 이어 붙여야 합니다. 연결 부위에서 품질 저하가 발생하므로, 긴 영상은 한 번에 생성하기보다 편집 작업으로 접근해야 합니다.
GPU를 시간 단위로 대여하는 것이 카드를 구매하는 것보다 저렴합니까?
하루 렌더링 시간이 몇 시간 미만이라면 대여가 유리합니다. 2026년 7월 기준 24 GB 카드 대여료가 시간당 약 0.36 달러이므로, 카드 구매 비용을 상쇄하려면 상당히 오랜 기간 대여해야 합니다. 또한 실제 사용하려는 모델에 맞지 않는 하드웨어를 구매하는 위험도 피할 수 있습니다. 구매가 유리한 경우는 장비를 매일 거의 하루 종일 가동할 때뿐입니다.