Kendi sunucunuzda yapay zeka ile video oluşturma rehberi
Temmuz 2026 itibarıyla Wan 2.2 ve HunyuanVideo modellerinin gerçek performansını inceleyin. 24 GB VRAM gereksinimi, 720p beş saniyelik klip maliyeti ve API kullanımı hakkında bilgiler.
Kendi sunucunuzda barındırdığınız bir yapay zeka video oluşturucu gerçekte neler yapabilir?
Kendi sunucunuzda barındırdığınız bir yapay zeka video oluşturucu günümüzde çalışmaktadır ancak demo videolarının sunduğundan daha yavaş ve daha kısıtlıdır. Temmuz 2026 itibarıyla çalıştırılmaya değer açık kaynaklı modeller, Alibaba'dan Wan 2.2 ve Tencent'ten HunyuanVideo'dur; hızın gerçekçilikten daha önemli olduğu durumlarda ise Lightricks'ten LTX-Video tercih edilebilir. Bunların tümü, NVIDIA GPU'ya sahip bir Linux makinesi üzerinde ComfyUI ile çalışır. Elde edeceğiniz sonuç, 720p çözünürlükte yaklaşık beş saniyelik bir kliptir. Bir sahne değil, bir dakikalık bitmiş bir görüntü hiç değildir.
Detaylara girmeden önce kısa cevap şudur: 24 GB belleğe sahip bir kart, beş saniyelik 720p bir klibi tek haneli dakika sürelerinde oluşturur. 12 GB belleğe sahip bir kart aynı işi yirmi dakika veya daha uzun sürede yapar; çünkü model ağırlıkları video belleğine sığmaz ve yazılım, katmanları sürekli olarak sistem RAM'i ile ekran kartı belleği arasında taşımak zorunda kalır. GPU'su olmayan bir sunucu bu işlemi anlamlı bir hızda gerçekleştiremez. CPU ile görüntü oluşturmayı yavaş kılan matematiksel süreç, CPU ile video oluşturmayı tamamen anlamsız hale getirir.
Eğer kendi sunucunuzda barındırdığınız bir görsel oluşturucu için donanım kademeleri hakkındaki yazıyı okuduysanız, video konusu da aynı mantığın her bir değerin bir üst sınıfa taşınmış halidir. VRAM (grafik yongasının yanına lehimlenmiş olan video belleği), bu sürecin keyifli mi yoksa zahmetli mi olacağını belirleyen tek teknik özelliktir.
Bir videonun bir görselden neden çok daha maliyetli olduğu
Bir difüzyon modeli, bir görseli adım adım gürültüden arındırarak oluşturur ve her adımda modeldeki tüm ağırlıkları okur. Bir video modeli ise aynı işlemi bir kerede tüm kare bloğuna uygular ve kare 80'in kare 12'nin nasıl göründüğünü bilmesi için zamansal dikkat (temporal attention) mekanizması ekler. Saniyede 24 kare hızında beş saniyelik bir video, tek bir grupta 120 kare demektir.
Bu zamansal dikkat mekanizması, maliyetin klip uzunluğuyla orantılı olarak artmamasının nedenidir. Kare sayısını iki katına çıkarmak, örnekleyicinin (sampler) ihtiyaç duyduğu belleği iki kattan fazla artırır; bu nedenle hata durumu render işleminin yavaşlaması değil, render işleminin tamamen çökmesidir.
İnsanların beklemediği ikinci bir bellek artışı daha vardır. Örnekleyici işlemi tamamladıktan sonra VAE (sıkıştırılmış latent veriyi gerçek piksellere dönüştüren varyasyonel oto-kodlayıcı), tüm latent videoyu tek seferde çözer. Bu kod çözme işlemi, örnekleme aşamasından daha fazla bellek gerektirebilir. Bunun belirtisi, ilerleme çubuğunun tamamlandığını gösteren ancak ardından şu çıktıyı veren bir işlemdir:
torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiBBunun çözümü, parçalı kod çözme (tiled decoding) kullanmak veya klibi kısaltmaktır. Hangi aşamanın bellek hatası verdiğini bilmek, yanlış ayarları optimize ederek saatler harcamanızı engeller.
Yapay zeka video üretimi için ne kadar VRAM gerekir
Karar sürecini çerçeveleyen ve birbirleriyle çelişiyor gibi görünen iki yayınlanmış veri mevcuttur. Alibaba, Wan 2.2 TI2V-5B modelinin 4090 gibi tek bir tüketici sınıfı GPU üzerinde 720p çözünürlükte, saniyede 24 kare hızında ve beş saniye uzunluğunda klipleri dokuz dakikanın altında ürettiğini belirtmekte ve en az 24 GB VRAM önermektedir. ComfyUI dokümantasyonu ise aynı 5B modelinin "ComfyUI yerel offloading özelliği ile 8 GB VRAM üzerinde rahatlıkla çalışabileceğini" ifade eder.
Her iki ifade de doğrudur çünkü farklı metrikleri ölçmektedirler. 8 GB, modelin sığabildiği sınırdır. 24 GB ise konforlu çalışma alanıdır. Offloading, modelin büyük kısmını sistem RAM'inde tutarak her adımda katmanları GPU'ya aktararak çalışır; bu nedenle kart, hesaplama yapmak yerine PCIe veri yolu üzerinde bekleyerek zaman harcar. Bu maliyet bir kez değil, her örnekleme adımında ödenir.
The data behind this chart
[
{
"label": "8GB VRAM, heavy offloading",
"minutes_per_clip": 40
},
{
"label": "12GB VRAM",
"minutes_per_clip": 22
},
{
"label": "16GB VRAM",
"minutes_per_clip": 14
},
{
"label": "24GB VRAM, 4090 class",
"minutes_per_clip": 9
}
]Yalnızca son satır üretici tarafından sağlanan veridir. 24 GB kapasiteli kart, Alibaba'nın bu model için yayınladığı rakam olan klip başına 9 dakikalık sürede işlem yapar. Diğer satırlar offloading işleminin performansa etkisini gösterir ve bunlar kıyaslama sonuçlarından ziyade büyüklük mertebesini temsil eder. Önemli olan eğilimdir: 8 GB bir kartta klip başına 40 dakika süren işlem, teknik olarak çalışan ancak pratikte gece boyunca çalışmaya bırakılan bir toplu iş (batch job) niteliğindedir.
Daha büyük Wan 2.2 modelleri ise bambaşka bir dünyadır. A14B metinden videoya ve görselden videoya varyantları, tek GPU üzerinde çıkarım (inference) yapmak için en az 80 GB VRAM talep eder. Bu, masaüstü bilgisayara takılan bir kart değil, veri merkezi donanımıdır ve self-hosting kavramının saatlik ücretle başkasının hızlandırıcısını kiralamaya dönüştüğü noktadır. Aynı matematik metin tarafında çok daha ileri seviyelere ulaşır; burada Kimi K3 gibi 2.8 trilyon parametreli bir modeli self-host etmek, tek bir kart meselesi olmaktan çıkıp kaç adet 80 GB kartı birbirine bağlayabileceğiniz sorusuna dönüşür.
Kiralanan bir GPU üzerinde klip maliyeti
Satın aldığınız bir kart, ihtiyaç duyduğunuz model 80 GB bellek gerektiriyorsa yanlış donanım olacağından, çoğu kullanıcı bu testi kiralama yöntemiyle yapmalıdır. Temmuz 2026 itibarıyla GPU kiralama pazarındaki ortalama isteğe bağlı (on-demand) fiyatlar şöyledir:
The data behind this chart
[
{
"label": "RTX 4090, 24GB",
"usd_per_hour": 0.36,
"usd_per_clip": 0.05
},
{
"label": "A100, 80GB",
"usd_per_hour": 1.79,
"usd_per_clip": 0.6
},
{
"label": "H100, 80GB",
"usd_per_hour": 2.99,
"usd_per_clip": 0.55
}
]4090 satırı 5B modelini çalıştırır ve saatlik 0.36 dolar ücretle klip başına yaklaşık 0.05 dolara mal olur. 80 GB satırları 14B modellerini çalıştırır; donanımın kendisi çok daha hızlı olmasına rağmen klip başına maliyetin 0.6 dolara çıkmasının nedeni budur. Daha büyük model, video saniyesi başına daha fazla hesaplama demektir.
Klip başına beş sent kulağa önemsiz gibi gelir ancak yanıltıcı olan kısım budur. Kullanılabilir ilk beş saniyeniz asla tek bir render işleminden ibaret değildir. Bir video modeline komut vermek bir arayış sürecidir; belirli bir harekete sahip bir çekim için, nihai sonucu almadan önce yirmi ila kırk render almak normaldir. Bu nedenle bir çalışma oturumu sentler yerine dolarlarla ifade edilir ve kiralanan donanım üzerinde bir öğleden sonra süren yinelemeli çalışma, bir öğle yemeği maliyetine denk gelir.
Kiralama sürecinde gözden kaçırıldığında ciddi maliyet yaratan iki detay vardır. Sistem ağırlıkları indirirken ücretlendirilirsiniz; metin kodlayıcı ve VAE içeren Wan 2.2 dosyaları onlarca gigabayt boyutundadır, bu yüzden kalıcı depolama alanı (persistent volume) sunan bir sağlayıcı seçin ve indirme işlemini bir kez yapın. Ayrıca SSH oturumunuz açıkken sistem boşta beklediğinde de ücretlendirilirsiniz. Terminali kapatmak yerine instance'ı durdurun.
GPU sunucusuna ComfyUI kurulumu
NVIDIA sürücüsü halihazırda kurulu olan bir Ubuntu 24.04 sistemi ile başlayın. İlk olarak sürücüyü kontrol edin; çünkü bu kontrol yapılmadığında sonraki tüm hatalar birbirinin aynısı gibi görünür.
nvidia-sminvidia-smi
Bu komut, ekran kartınızı ve CUDA sürümünü içeren bir tablo çıktısı vermelidir. Eğer NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver çıktısı alıyorsanız, çekirdek modülü yüklenmemiş demektir; bu durum genellikle yeniden başlatılmayan bir çekirdek yükseltmesinden sonra meydana gelir. Sorunu buradan giderin. Aksi takdirde ComfyUI, CPU yoluna dönecek ve modelin çalışmaması nedeniyle bir saatinizi boşa harcayacaksınız.
sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txtpython3 -c "import torch; print(torch.cuda.is_available())"
Tek bir ağırlık dosyası indirmeden önce PyTorch'un kartı gördüğünden emin olun.
python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"python3 -c "import torch; print(torch.cuda.get_device_name(0))"
True ve ardından kartınızın adı, yığının sağlıklı olduğunu gösterir. False ise kurulu olan paketin sadece CPU sürümü olduğu anlamına gelir; bu durum pip, daha önceki bir kurulumdan kalan önbelleğe alınmış torch sürümünü bulduğunda gerçekleşir. Yukarıdaki index URL'sini kullanarak yeniden kurulum yapın.
Wan 2.2 model dosyalarını indirme
ComfyUI herhangi bir ağırlık dosyasıyla birlikte gelmez ve bir video modeli tek bir dosyadan oluşmaz. Bu bir difüzyon modeli, bir metin kodlayıcı ve bir VAE'den meydana gelir; her biri kendi dizinine yerleştirilmelidir. Bir dosyayı yanlış klasöre koyarsanız, yükleyici düğümü dosyayı listelemez ve nedenini açıklayan bir hata mesajı da vermez.
cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors5B modeli hem metinden videoya hem de görüntüden videoya dönüştürme işlemlerini yönetebilir, bu nedenle makul bir başlangıç noktasıdır. Her zaman .ckpt yerine .safetensors tercih edilmelidir. Bir .ckpt dosyası, pickle ile işlenmiş bir Python nesnesidir; bu nedenle bir dosyanın yüklenmesi, onu oluşturan kişi tarafından yazılan kodun çalıştırılması anlamına gelir. Disk alanını cömertçe ayırın: tek bir model ailesi ve çıktılarıyla çalışan bir kurulum 100 GB alan gerektirir; ayrıca video dosyaları, görüntü iş akışlarının geride bıraktığı PNG görsellerinden çok daha büyüktür. İş akışı JSON dosyalarınızı nesne depolama alanına şifreli artımlı yedekler gibi bir yöntemle yedekleyin; çünkü ağırlık dosyaları tekrar indirilebilir ancak üzerinde ince ayar yaptığınız iş akışlarınız indirilemez.
Uygulamayı çalıştırın ve güvenli bir şekilde erişin
cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188ComfyUI içerisinde bir giriş ekranı veya kullanıcı hesabı sistemi bulunmamaktadır. 8188 numaralı porta erişebilen herhangi bir kişi iş kuyruğuna öğe ekleyebilir, oluşturduğunuz tüm klipleri okuyabilir ve özel düğümler (custom nodes) yükleyebilir; bu durum sunucunuzda keyfi kod yürütülmesine (arbitrary code execution) olanak tanır. Uygulamayı localhost adresine bağlayın ve kendi makinenizden bir SSH tüneli aracılığıyla erişim sağlayın.
ssh -N -L 8188:127.0.0.1:8188 you@your-serverArdından tarayıcınızda http://127.0.0.1:8188 adresini açın. Düğümleri manuel olarak birbirine bağlamak yerine ComfyUI şablon menüsünden Wan 2.2 şablon iş akışını yükleyin. Resmi şablonlar, modelin optimize edildiği örnekleyici (sampler) ayarlarını içerir; bir video iş akışında, bir görüntü iş akışına kıyasla değerlerin hatalı girilebileceği çok daha fazla nokta bulunmaktadır.
API kullanmanın dürüst bir tercih olduğu durumlar
Video üretimini kendi sunucunuzda barındırmak (self-hosting), hacim yüksek ve istikrarlı olduğunda, karelerinizin altyapınızdan dışarı çıkmaması gerektiğinde veya hiçbir barındırılan hizmetin sunmadığı özel bir model ya da özelleştirilmiş bir adaptöre ihtiyaç duyduğunuzda doğru tercihtir. Ayrıca, pipeline yapınızın bir yıl sonra da aynı şekilde çalışması gerektiğinde de bu yöntem doğrudur; çünkü barındırılan bir model, sürüm sabitleme imkanı olmaksızın aniden değişebilir.
Ayda sadece birkaç klip üretmeniz gerektiğinde, açık kaynaklı modellerin üretebileceğinden daha uzun veya daha büyük çıktılara ihtiyaç duyduğunuzda ya da bu hafta yetişmesi gereken bir teslim tarihiniz olduğunda barındırılan bir API kullanın. Başabaş noktasını dürüstçe hesaplayın. Temmuz 2026 medyan fiyatlarına göre 7/24 kiralanan 24 GB'lık bir kartın maliyeti aylık yaklaşık 260 dolardır; aynı kartı satın almak ise henüz tek bir kare bile üretmeden bu tutardan daha fazla peşin ödeme yapmanızı gerektirir. Boşta duran, kendi barındırdığınız bir sunucu, klip başına ücretlendirilen API fiyatlarına karşı her zaman kaybeder. Bu, kendi kendine barındırılan LLM sunumu için Ollama ve vLLM karşılaştırması bölümünde ele alınan metin modellerini nasıl sunacağınızla ilgili kararla aynı ticari dengedir ve GPU içeren bir VPS'nin maliyetine değip değmeyeceği konusundaki daha temel sorunun üzerine oturur.
Render başarısız olduğunda kontrol edilmesi gerekenler
Sampler çubuğu tamamlandıktan hemen sonra, yani en sonda sonlanan bir render işlemi, VAE decode aşamasında bellek yetersizliği yaşıyordur. Kare sayısını azaltın veya tiled decode düğümüne geçiş yapın. Adım sayısını değiştirmek bir işe yaramayacaktır, çünkü decode işlemi tüm adımlar çalıştırıldıktan sonra yalnızca bir kez gerçekleşir.
Tamamen siyah veya bozuk görünen çıktılar, genellikle VAE ile modelin uyumsuz olduğu anlamına gelir. Wan 2.2 diffusion modeli ile yüklenen bir Wan 2.1 VAE tam olarak bu sonucu verir ve günlük kayıtlarında herhangi bir hata görünmez.
GPU'su olduğunu bildiğiniz bir makinede çalışan ancak saatler süren bir render, ComfyUI'ın CPU yolunu kullandığını gösterir. Başlangıç günlüklerinde cihaz satırını kontrol edin, ardından yukarıdaki torch.cuda.is_available() denetimini tekrar çalıştırın.
İşlemin dmesg içinde Killed ile aniden kaybolması ve herhangi bir Python traceback çıktısı vermemesi, çekirdeğin bellek yetersizliği nedeniyle süreci sonlandırdığı (OOM killer) anlamına gelir; yani sorun VRAM değil, sistem RAM'idir. Offloading işlemi modelin tamamının sistem RAM'inde bulunmasını gerektirir, bu da 5B boyutunda bir modeli offload etmeye çalışan 16 GB RAM'li bir sistemin yetersiz kalacağı anlamına gelir. RAM ekleyin veya swap alanını artırın.
FAQ
GPU olmayan bir VPS üzerinde yapay zeka ile video oluşturabilir miyim?
Hayır, verimli bir şekilde kullanamazsınız. 24 GB GPU üzerinde dokuz dakika süren beş saniyelik 720p bir klip, CPU üzerinde saatlerce sürer; çünkü modelin üzerinde çalışabileceği matris donanımı yoktur ve sistem RAM bant genişliği, GPU bellek bant genişliğinin çok altındadır. Bir CPU sunucusu ComfyUI arayüzünü barındırabilir, modellerinizi saklayabilir ve iş akışlarınızı tutabilir ancak render işleminin kendisi için bir GPU gereklidir.
Wan 2.2 için ne kadar VRAM gerekir?
TI2V-5B modeli için ComfyUI yerel offloading ile 8 GB alt sınırdır; Alibaba, yayınlanan hızlara ulaşmak için 24 GB önermektedir. A14B metinden videoya ve görselden videoya modelleri için model kartı, tek GPU ile çıkarım yapmak için en az 80 GB VRAM talep etmektedir; bu nedenle bunlar veri merkezi sınıfı kartlar gerektirir.
Kendi barındırdığım bir klip ne kadar uzun olabilir?
Temmuz 2026 itibarıyla 720p çözünürlükte yaklaşık beş saniye pratik bir birimdir. Daha uzun çıktılar, segmentler oluşturulup bunların birleştirilmesiyle elde edilir; bir segmentin son karesi, bir sonrakinin ilk karesi olarak kullanılır. Birleşim noktalarında kalite sapmaları oluştuğu için uzun bir videoyu tek bir üretimden ziyade bir kurgu işi olarak değerlendirin.
GPU'yu saatlik kiralamak, kart satın almaktan daha mı ucuzdur?
Günde birkaç saatten az render işlemi yapıyorsanız kiralama daha avantajlıdır. 24 GB bir kart için Temmuz 2026 medyanı olan saatlik yaklaşık 0.36 dolar üzerinden, kartın satın alma fiyatına ulaşana kadar uzun süre kiralama yapabilirsiniz; ayrıca kullanmak istediğiniz model için yanlış sınıfta bir donanım satın alma riskinden de kurtulursunuz. Satın alma işlemi, yalnızca sunucu her gün günün büyük bölümünde meşgul olduğunda avantajlıdır.