SSD Nodes Learn 8GB RAM — yılda $66
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-01

Self-hosted AI Video Generator Gerçekten Ne Yapar?

Temmuz 2026'da Wan 2.2, HunyuanVideo ve LTX-Video'nun ürettiği çıktıyı, gereken VRAM sınıfını, kiralık GPU'da 5 saniyelik klip maliyetini ve API seçimini öğrenin.

Self-hosted AI video generator gerçekte ne yapabilir?

Self-hosted bir AI video generator bugün kullanılabilir durumdadır. Ancak tanıtım videolarında gösterilenden daha yavaş çalışır ve daha kısa videolar üretir. Temmuz 2026 itibarıyla çalıştırılmaya değer açık modeller Alibaba tarafından geliştirilen Wan 2.2 ve Tencent tarafından geliştirilen HunyuanVideo modelleridir. Hız gerçekçilikten daha önemli olduğunda Lightricks tarafından geliştirilen LTX-Video da kullanılabilir. Bu modellerin tümü, NVIDIA GPU içeren bir Linux makinesinde ComfyUI altında çalışır. Elde edilen çıktı, 720p çözünürlükte yaklaşık beş saniyelik bir kliptir. Bu bir sahne değildir. Tamamlanmış bir dakikalık görüntü değildir.

Ayrıntılara geçmeden önce kısa yanıt aşağıdadır. 24 GB belleğe sahip bir kart, 720p çözünürlükte beş saniyelik bir klibi tek haneli dakika sayısında oluşturur. 12 GB belleğe sahip bir kart aynı işi yirmi dakika veya daha uzun sürede tamamlar. Bunun nedeni, model ağırlıklarının video belleğine sığmaması ve yazılımın katmanları sistem RAM'i ile video belleği arasında sürekli taşımasıdır. GPU içermeyen bir sunucu bunu kullanılabilir bir hızda gerçekleştiremez. CPU ile görüntü oluşturmayı yavaşlatan hesaplama yükü, CPU ile video oluşturmayı da pratik olmaktan çıkarır.

self-hosted image generator için donanım katmanlarını daha önce okuduysanız video için aynı değerlendirme geçerlidir; yalnızca her değer bir sınıf yukarı taşınır. VRAM (video belleği, grafik yongasının yanına lehimlenmiş RAM) bunun kullanılabilir mi yoksa zahmetli mi olacağını belirleyen tek özelliktir.

Bir videonun maliyeti neden bir görselden çok daha fazladır

Bir diffusion model, bir görseli adımlar halinde gürültüsünü gidererek oluşturur ve her adımda modeldeki tüm weight değerlerini okur. Bir video model de aynı işlemi bütün frame bloğuna aynı anda uygular. Ayrıca zaman boyunca attention kullanır. Böylece 80. frame, 12. frame'in nasıl göründüğünü dikkate alabilir. Saniyede 24 frame hızında 5 saniyelik video, tek bir batch içinde 120 frame içerir.

Maliyetin klip uzunluğuyla makul biçimde artmamasının nedeni bu temporal attention mekanizmasıdır. Frame sayısının iki katına çıkarılması, sampler'ın ihtiyaç duyduğu belleği ikiden fazla artırır. Bu nedenle sorun yalnızca render işleminin yavaşlaması değildir. Render işlemi sonlanır.

Beklenmeyen ikinci bir bellek artışı daha vardır. Sampler tamamlandıktan sonra VAE (variational autoencoder; sıkıştırılmış latent veriyi gerçek piksellere dönüştüren bileşen), latent video'nun tamamını tek seferde decode eder. Bu decode işlemi, sampling işleminden daha fazla bellek gerektirebilir. Belirti, ilerleme çubuğu tamamlandıktan sonra job'ın aşağıdaki çıktıyı vermesidir:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Çözüm tiled decoding kullanmak veya daha kısa bir klip oluşturmaktır. Belleğin hangi aşamada tükendiğinin bilinmesi, yanlış ayarı bir saat boyunca değiştirerek zaman kaybedilmesini önler.

Yapay video üretimi için ne kadar VRAM gerekir

İki yayımlanmış veri, kararın tamamını çerçeveliyor ve birbirleriyle çelişiyor gibi görünüyor. Alibaba, Wan 2.2 TI2V-5B modelinin 4090 gibi tek bir tüketici GPU'su üzerinde 720p klipleri saniyede 24 kare ve beş saniye uzunlukta, dokuz dakikadan kısa sürede ürettiğini belirtiyor ve en az 24 GB VRAM öneriyor. ComfyUI belgelerinde ise aynı 5B modelinin "ComfyUI native offloading ile 8GB vram üzerinde sorunsuz çalışması gerektiği" belirtiliyor.

Her iki ifade de doğrudur, çünkü farklı şeyleri ölçer. 8 GB, modelin sığdığı noktadır. 24 GB ise rahat çalıştığı noktadır. Offloading işlemi, modelin büyük bölümünü sistem RAM'inde tutar ve her adımda katmanları GPU'ya aktarır. Bu nedenle ekran kartı hesaplama yapmak yerine zamanını PCIe veri yolunu bekleyerek geçirir. Bu maliyet bir kez değil, her sampler adımında ödenir.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Yalnızca son satır bir üretici verisidir. 24 GB kartta klip başına süre 9 dakikaya ulaşır. Bu, Alibaba'nın bu model için yayımladığı sayıdır. Diğer satırlar, offloading işleminin bu süreyi nasıl etkilediğini gösterir; bunlar benchmark sonuçları değil, büyüklük sırasını gösteren tahminlerdir. Önemli olan genel eğilimdir: 8 GB kartta 40 dakika, teknik olarak çalışan bir kurulum anlamına gelir; pratikte ise gece boyunca çalışmaya bırakılan bir toplu iş anlamına gelir.

Daha büyük Wan 2.2 modelleri farklı bir kategoridedir. A14B text-to-video ve image-to-video varyantları, tek GPU üzerinde çıkarım için en az 80 GB VRAM gerektirir. Bu, masaüstü bir sisteme takılacak kart değil, veri merkezi donanımıdır. Bu noktada self-hosted kullanım, saatlik ücretle başka birinin hızlandırıcısını kiralamak anlamına gelmeye başlar.

Kiralanan GPU'da bir klibin maliyeti

Çoğu kişinin bunu test etmek için kiralama yöntemini kullanması gerekir. Satın alınan kart, kullanılmak istenen modelin 80 GB gerektirmesi durumunda yanlış donanım olur. Temmuz 2026 itibarıyla GPU kiralama piyasasında isteğe bağlı kullanım için ortanca fiyatlar:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

4090 satırında 5B model çalıştırılır. Klip başına maliyet, saatlik 0.36 dolar üzerinden yaklaşık 0.05 dolardır. 80 GB bellekli satırlarda 14B modeller çalıştırılır. Donanımın kendisi çok daha hızlı olsa da klip başına maliyetin 0.6 dolara çıkmasının nedeni budur. Model büyüdükçe videonun saniyesi başına gereken işlem miktarı artar.

Klip başına beş sent önemsiz görünebilir. Yanıltıcı olan da budur. Kullanılabilir ilk beş saniyeyi elde etmek hiçbir zaman tek bir oluşturma işlemiyle gerçekleşmez. Video modeline prompt vermek bir arama sürecidir. Belirli bir hareket içeren bir çekim için işe yarayan bir sonuç elde edilene kadar yirmi ila kırk oluşturma işlemi normaldir. Bu nedenle bir çalışma oturumunun maliyeti sentlerle değil, dolarla ifade edilir. Kiralanan donanımda bir öğleden sonra süren denemelerin maliyeti yaklaşık bir öğle yemeği kadardır.

İki kiralama ayrıntısı gözden kaçırıldığında gerçek maliyet oluşturur. Sistem weights dosyalarını indirirken de ücretlendirilirsiniz. Wan 2.2 dosyaları, text encoder ve VAE ile birlikte onlarca gigabayt yer kaplar. Bu nedenle persistent volume sunan bir sağlayıcı seçilmeli ve indirme işlemi bir kez yapılmalıdır. SSH oturumunuz açıkken sistem boşta beklediğinde de ücretlendirilirsiniz. Yalnızca terminali kapatmak yerine instance durdurulmalıdır.

GPU kutusuna ComfyUI kurulumu

NVIDIA sürücüsü zaten kurulmuş olan Ubuntu 24.04 ile başlayın. Önce sürücüyü denetleyin. Bu denetim yapılmazsa sonraki tüm hatalar aynı görünür.

nvidia-smi

Bu komut, kartınızı ve bir CUDA sürümünü içeren bir tablo yazdırmalıdır. NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver yazdırılırsa kernel modülü yüklenmemiştir. Bu durum genellikle kernel yükseltmesinden sonra yeniden başlatma yapılmaması nedeniyle oluşur. Sorunu burada düzeltin. Aksi takdirde ComfyUI CPU yoluna geçer ve bir saatinizi modeli suçlayarak geçirirsiniz.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Tek bir ağırlık dosyası indirmeden önce PyTorch'un kartı gördüğünü doğrulayın.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True ile birlikte kart adınızın görünmesi, yığının sağlıklı olduğu anlamına gelir. False, kurulu wheel'in yalnızca CPU sürümü olduğunu gösterir. Bu durum, pip'in önceki bir kurulumdan kalan önbelleğe alınmış torch paketini bulmasıyla oluşur. Yukarıdaki index URL ile yeniden kurun.

Wan 2.2 model dosyalarını indirme

ComfyUI herhangi bir ağırlık dosyasıyla birlikte gelmez ve video modeli tek bir dosyadan oluşmaz. Bir difüzyon modeli, bir metin kodlayıcı ve bir VAE bulunur; bunların her biri kendi dizinine yerleştirilir. Bir dosyayı yanlış klasöre yerleştirirseniz yükleyici düğümü dosyayı listelemez ve bunun nedenini açıklayan bir hata da göstermez.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

5B modeli hem metinden videoya hem de görüntüden videoya işlemlerini destekler. Bu nedenle başlangıç için uygun seçenektir. Her zaman .safetensors yerine .ckpt kullanılması tercih edilmelidir. .ckpt dosyası, serileştirilmiş bir Python nesnesidir. Bu nedenle böyle bir dosyanın yüklenmesi, dosyayı oluşturan kişi tarafından yazılan kodu çalıştırır. Disk alanını cömertçe planlayın: tek bir model ailesi ve çıktılarıyla çalışan bir kurulum 100 GB alan gerektirir. Video dosyaları, görüntü iş akışının oluşturduğu PNG görüntülerinden çok daha büyüktür. Ağırlık dosyaları yeniden indirilebilir, ancak yapılandırdığınız iş akışları yeniden oluşturulamaz. Bu nedenle iş akışı JSON dosyalarını nesne depolamaya şifreli artımlı yedeklemeler gibi bir yöntemle yedekleyin.

Çalıştırın ve güvenli şekilde erişin

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI'de oturum açma ekranı ve kullanıcı hesapları yoktur. 8188 portuna erişebilen herkes iş kuyruğuna iş ekleyebilir, oluşturduğunuz tüm klipleri okuyabilir ve özel düğümler yükleyebilir. Bu, sunucunuzda rastgele kod yürütülmesine olanak sağlar. ComfyUI'yi localhost adresine bağlayın ve kendi makinenizden bir SSH tüneli üzerinden erişin.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Ardından tarayıcınızda http://127.0.0.1:8188 adresini açın. Düğümleri elle bağlamak yerine ComfyUI templates menüsünden Wan 2.2 şablon iş akışını yükleyin. Resmi şablonlarda, modelin ayarlandığı sampler ayarları bulunur. Video iş akışında, bir değerin fark edilmeden yanlış ayarlanabileceği yerlerin sayısı görüntü iş akışına göre çok daha fazladır.

API kullanmanın doğru yanıt olduğu durumlar

Video üretimini kendi altyapınızda barındırmak; iş yükü yüksek ve düzenliyse, karelerinizin kendi altyapınızdan çıkmaması gerekiyorsa veya barındırılan hiçbir hizmetin sunmadığı belirli bir modele ya da özel bir adaptöre ihtiyacınız varsa doğru seçimdir. Ardışık düzenin bir yıl sonra da aynı şekilde çalışması gerekiyorsa da bu yaklaşım doğrudur. Çünkü barındırılan bir model, sabitlenecek bir sürüm sunmadan değişebilir.

Ayda birkaç klibe ihtiyacınız varsa, açık modellerin ürettiğinden daha uzun veya daha büyük çıktılar gerekiyorsa ya da bu hafta içinde bir son tarihiniz varsa barındırılan bir API kullanın. Başabaş noktasını gerçeğe uygun şekilde hesaplayın. July 2026 medyan fiyatıyla günün her saati kiralanan 24 GB bir kartın aylık maliyeti yaklaşık 260 dolardır. Aynı kartı satın almak ise tek bir kare üretmeden önce bunun üzerinde bir peşin maliyet gerektirir. Boşta kalan, kendi bünyenizde barındırdığınız bir sunucu her seferinde klip başına API fiyatlandırmasının gerisinde kalır. Metin modellerini nasıl sunacağınıza karar veren aynı denge, kendi bünyenizde LLM sunumu için Ollama ve vLLM karşılaştırması bölümünde ele alınmıştır. Bu konu, GPU içeren bir VPS'in harcanan paraya değip değmediği bölümündeki daha temel soruya dayanır.

İşleme başarısız olduğunda kontrol edilmesi gerekenler

Örnekleme çubuğu tamamlandıktan sonra, işlemenin en sonunda durması VAE kod çözme aşamasında belleğin tükendiğini gösterir. Kare sayısı azaltılmalı veya döşemeli kod çözme düğümüne geçilmelidir. Adım sayısının değiştirilmesi sorunu çözmez. Çünkü kod çözme, tüm adımlar tamamlandıktan sonra bir kez gerçekleştirilir.

Çıktının tamamen siyah olması veya ciddi biçimde bozulması genellikle VAE'nin modelle eşleşmediği anlamına gelir. Wan 2.1 VAE'nin Wan 2.2 diffusion modeliyle yüklenmesi tam olarak bu sonucu üretir. Günlükte hiçbir hata görünmez.

İşlemenin çalışması ancak GPU olduğu bilinen bir makinede saatler sürmesi, ComfyUI'nin CPU yolunu kullandığı anlamına gelir. Başlangıç günlüğünde cihaz satırı kontrol edilmeli, ardından yukarıdaki torch.cuda.is_available() kontrolü yeniden çalıştırılmalıdır.

Sürecin dmesg içinde Killed ile birlikte ve herhangi bir Python traceback olmadan ortadan kaybolması, kernel'ın bellek yetersizliği sonlandırıcısının devreye girdiğini gösterir. Bu durumda sorun VRAM değil, sistem RAM'idir. Offloading için modelin tamamının sistem RAM'inde tutulabilmesi gerekir. Bu nedenle 16 GB RAM'e sahip bir makine, 5B modelini offload etmek için yetersiz kalır. RAM veya swap eklenmelidir.

FAQ

GPU olmayan bir VPS üzerinde yapay zeka videosu oluşturulabilir mi?

Hayır, en fazla bir kez kullanmak isteyeceğiniz şekilde oluşturulabilir. 24 GB GPU üzerinde dokuz dakika süren beş saniyelik 720p klibin CPU üzerinde oluşturulması birçok saat alır. Bunun nedeni, modelin çalıştırılabileceği matris donanımına sahip olmaması ve sistem RAM bant genişliğinin GPU bellek bant genişliğinden bir büyüklük derecesi daha düşük olmasıdır. CPU sunucusu ComfyUI arayüzünü barındırabilir, modellerinizi depolayabilir ve iş akışlarınızı tutabilir. Ancak işleme için GPU gerekir.

Wan 2.2 için ne kadar VRAM gerekir?

TI2V-5B modeli için ComfyUI yerel offloading özelliğiyle 8 GB alt sınırdır. Yayınlanan hıza ulaşmak için Alibaba 24 GB önerir. A14B text-to-video ve image-to-video modelleri için model kartı, tek GPU çıkarımı için en az 80 GB VRAM ister. Bu nedenle bu modellerde veri merkezi kartları gerekir.

Self-hosted bir klip ne kadar uzun olabilir?

Temmuz 2026 itibarıyla 720p için pratik birim yaklaşık beş saniyedir. Daha uzun çıktı, segmentler oluşturulup birleştirilerek üretilir. Bir segmentin son karesi sonraki segmentin ilk karesi olarak kullanılır. Birleştirme noktalarında kalite değişir. Bu nedenle uzun videoyu tek bir oluşturma işlemi yerine bir kurgu işi olarak ele alınmalıdır.

GPU'yu saatlik kiralamak kart satın almaktan daha mı ucuzdur?

Günde birkaç saatten daha az işleme yapılacaksa kiralama daha avantajlıdır. Temmuz 2026'da 24 GB kart için saatlik yaklaşık 0.36 dolar olan medyan fiyatla, kartın satın alma fiyatına ulaşmadan önce uzun süre kiralama yapılabilir. Ayrıca model için yanlış sınıftaki donanımı satın alma riski ortadan kalkar. Satın alma yalnızca sistem her gün günün büyük bölümünde yoğun kullanılıyorsa avantajlıdır.

#ai-video#comfyui#gpu#self-hosting#wan#vram