SSD Nodes Learn 8GB RAM — $66/rok
Przewodniki Matt ConnorAutor: Matt Connor · Zaktualizowano 2026-08-01

Samodzielny generator wideo AI: wymagania i koszty

Sprawdzono Wan 2.2, HunyuanVideo i LTX-Video: 24 GB VRAM wystarcza na klip 720p przez 5 sekund w kilka minut, a 12 GB trwa co najmniej 20 minut.

Co może faktycznie zrobić samodzielnie hostowany generator wideo AI

Samodzielnie hostowany generator wideo AI działa już obecnie, ale jest wolniejszy i ma mniejsze możliwości, niż sugerują materiały demonstracyjne. W lipcu 2026 warte uruchomienia otwarte modele to Wan 2.2 firmy Alibaba i HunyuanVideo firmy Tencent, a także LTX-Video firmy Lightricks, gdy szybkość jest ważniejsza niż realizm. Wszystkie działają pod kontrolą ComfyUI na komputerze z Linux i procesorem graficznym NVIDIA. Wynikiem jest klip o długości około pięciu sekund w rozdzielczości 720p. Nie jest to scena. Nie jest to minuta gotowego materiału.

Najpierw podano krótką odpowiedź. Karta z 24 GB renderuje klip 720p o długości pięciu sekund w czasie kilku minut. Karta z 12 GB wykonuje to samo zadanie w co najmniej dwadzieścia minut, ponieważ wagi modelu nie mieszczą się w pamięci wideo, a oprogramowanie stale przenosi warstwy między pamięcią wideo a systemową pamięcią RAM. Serwer bez procesora graficznego nie może wykonywać tego zadania w praktycznie użyteczny sposób. To samo obliczeniowe ograniczenie, które spowalnia generowanie obrazów na CPU, sprawia, że generowanie wideo na CPU jest pozbawione sensu.

Jeśli przeczytano już zestawienie sprzętu dla samodzielnie hostowanego generatora obrazów, wideo jest tym samym argumentem, ale z każdą wartością przesuniętą o jedną klasę wyżej. VRAM (pamięć wideo, czyli pamięć RAM umieszczona obok układu graficznego) nadal jest jedyną specyfikacją, która decyduje o tym, czy korzystanie z tego rozwiązania będzie wygodne, czy uciążliwe.

Dlaczego jeden film kosztuje znacznie więcej niż jeden obraz

Model dyfuzyjny generuje obraz, odszumiając go etapami. Na każdym etapie odczytuje wszystkie wagi modelu. Model wideo wykonuje tę samą operację jednocześnie na całym bloku klatek. Dodatkowo stosuje mechanizm uwagi w czasie, dzięki czemu klatka 80 uwzględnia wygląd klatki 12. Pięć sekund przy 24 klatkach na sekundę oznacza 120 klatek w jednej partii.

To właśnie uwaga w czasie powoduje, że koszt nie rośnie proporcjonalnie do długości klipu. Podwojenie liczby klatek zwiększa wymaganą pamięć samplera o więcej niż dwukrotnie. Skutkiem nie jest wolniejsze renderowanie. Renderowanie kończy się błędem.

Występuje również drugi, nieoczekiwany skok zużycia pamięci. Po zakończeniu próbkowania VAE (variational autoencoder, czyli komponent przekształcający skompresowany latent w rzeczywiste piksele) dekoduje cały latent wideo jednocześnie. Dekodowanie może wymagać więcej pamięci niż próbkowanie. Objawem jest zadanie, w którym pasek postępu wskazuje ukończenie, a następnie wyświetlany jest komunikat:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Rozwiązaniem jest dekodowanie kafelkowe albo skrócenie klipu. Ustalenie, na którym etapie zabrakło pamięci, pozwala uniknąć przez godzinę dostrajania niewłaściwego ustawienia.

Ile pamięci VRAM potrzeba do generowania wideo przez AI

Dwie opublikowane wartości wyznaczają ramy całej decyzji i pozornie są ze sobą sprzeczne. Alibaba podaje, że model Wan 2.2 TI2V-5B generuje klipy 720p z szybkością 24 klatek na sekundę i o długości pięciu sekund w czasie krótszym niż dziewięć minut na pojedynczym konsumenckim GPU, takim jak 4090, oraz zaleca co najmniej 24 GB pamięci VRAM. Dokumentacja ComfyUI podaje, że ten sam model 5B „powinien bez problemu zmieścić się w 8 GB pamięci VRAM przy użyciu natywnego mechanizmu offloading w ComfyUI”.

Obie wartości są prawidłowe, ponieważ dotyczą różnych warunków. 8 GB oznacza minimalną pamięć, przy której model się mieści. 24 GB zapewnia komfortową pracę. Mechanizm offloading polega na przechowywaniu większości modelu w pamięci RAM systemu i przesyłaniu warstw do GPU przy każdym kroku. W rezultacie karta przez część czasu oczekuje na magistralę PCIe zamiast wykonywać obliczenia. Ten koszt występuje przy każdym kroku samplera, a nie tylko raz.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Tylko ostatni wiersz przedstawia wartość podaną przez producenta. Karta z 24 GB pamięci VRAM generuje jeden klip w czasie 9 minut, co odpowiada opublikowanej przez Alibaba wartości dla tego modelu. Pozostałe wiersze pokazują wpływ mechanizmu offloading. Są to wartości orientacyjne rzędu wielkości, a nie wyniki testów porównawczych. Najważniejsza jest zależność: 40 minut na karcie z 8 GB pamięci VRAM oznacza konfigurację, która technicznie działa, ale praktycznie wymaga pozostawienia zadania do wykonania na całą noc.

Większe modele Wan 2.2 wymagają zupełnie innych zasobów. Warianty A14B do generowania wideo z tekstu oraz z obrazu wymagają co najmniej 80 GB pamięci VRAM przy wnioskowaniu na pojedynczym GPU. Jest to sprzęt centrów danych, a nie karta przeznaczona do komputera biurkowego. Na tym etapie samodzielne hostowanie oznacza już wynajmowanie cudzego akceleratora na godziny.

Ile kosztuje klip na wynajętym GPU

Wynajem to właściwy sposób testowania dla większości osób, ponieważ zakupiona karta będzie niewłaściwym sprzętem, jeśli wybrany model będzie wymagał 80 GB. Mediana cen na żądanie na rynku wynajmu GPU według stanu na lipiec 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Wiersz dotyczący 4090 umożliwia uruchomienie modelu 5B i kosztuje około 0.05 dolarów za klip przy cenie 0.36 dolarów za godzinę. Wiersze dotyczące kart 80 GB obejmują modele 14B. Dlatego koszt jednego klipu wzrasta do 0.6 dolarów, mimo że sam sprzęt jest znacznie szybszy. Większy model wymaga większej mocy obliczeniowej na sekundę nagrania.

Pięć centów za klip brzmi jak niewielki koszt. To jednak mylące. Pierwsze użyteczne pięć sekund nigdy nie powstaje w jednym renderowaniu. Generowanie promptów dla modelu wideo jest procesem wyszukiwania. Przy ujęciu z określonym ruchem normalne jest wykonanie od dwudziestu do czterdziestu renderowań przed uzyskaniem właściwego wyniku. Sesja robocza kosztuje więc dolary, a nie centy. Popołudnie iteracyjnej pracy na wynajętym sprzęcie kosztuje mniej więcej tyle co obiad.

Dwa szczegóły dotyczące wynajmu mogą generować rzeczywiste koszty, jeśli zostaną pominięte. Opłaty są naliczane podczas pobierania wag przez instancję. Pliki Wan 2.2 wraz z enkoderem tekstu i VAE zajmują dziesiątki gigabajtów. Należy więc wybrać dostawcę oferującego trwały wolumin i pobrać pliki tylko raz. Opłaty są również naliczane, gdy instancja pozostaje bezczynna przy otwartej sesji SSH. Należy zatrzymać instancję, a nie tylko zamknąć terminal.

Instalacja ComfyUI na serwerze GPU

Rozpocząć od Ubuntu 24.04 z już zainstalowanym sterownikiem NVIDIA. Najpierw sprawdzić sterownik, ponieważ bez tego sprawdzenia każda późniejsza awaria wygląda tak samo.

nvidia-smi

Powinna zostać wyświetlona tabela zawierająca kartę i wersję CUDA. Jeśli zostanie wyświetlone NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, moduł jądra nie jest załadowany. Zwykle jest to skutek aktualizacji jądra bez ponownego uruchomienia systemu. Należy naprawić ten problem na tym etapie. W przeciwnym razie ComfyUI przełączy się na ścieżkę CPU, a przyczyna problemu może zostać błędnie przypisana modelowi.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Przed pobraniem choćby jednego pliku z wagami należy potwierdzić, że PyTorch wykrywa kartę.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True wraz z nazwą karty oznacza, że stos działa prawidłowo. False oznacza, że zainstalowany wheel jest kompilacją przeznaczoną wyłącznie dla CPU. Dzieje się tak, gdy pip znajdzie buforowany pakiet torch z wcześniejszej instalacji. Należy wykonać ponowną instalację z użyciem powyższego adresu URL indeksu.

Pobieranie plików modelu Wan 2.2

ComfyUI nie zawiera wag, a model wideo nie jest pojedynczym plikiem. Składa się z modelu dyfuzyjnego, enkodera tekstu i VAE. Każdy z tych elementów należy umieścić w osobnym katalogu. Umieszczenie pliku w niewłaściwym folderze sprawi, że węzeł loader nie wyświetli go na liście. Nie zostanie przy tym wyświetlony błąd wyjaśniający przyczynę.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B obsługuje zarówno generowanie wideo na podstawie tekstu, jak i generowanie wideo na podstawie obrazu. Dlatego stanowi rozsądny punkt wyjścia. Zawsze należy wybrać .safetensors zamiast .ckpt. Plik .ckpt jest obiektem Python typu pickle, dlatego jego wczytanie powoduje wykonanie kodu zapisanego przez autora pliku. Należy zapewnić odpowiednią ilość miejsca na dysku. Działająca instalacja z jedną rodziną modeli i wygenerowanymi plikami wymaga 100 GB. Pliki wideo są znacznie większe niż obrazy PNG pozostawiane przez proces przetwarzania obrazów. Pliki JSON workflow należy tworzyć w kopiach zapasowych, na przykład przy użyciu szyfrowanych przyrostowych kopii zapasowych w magazynie obiektowym, ponieważ wagi można pobrać ponownie, a dostrojonych workflow nie.

Uruchamianie i bezpieczny dostęp

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI nie ma ekranu logowania ani kont użytkowników. Każdy, kto może połączyć się z portem 8188, może dodawać zadania do kolejki, odczytać każdy wygenerowany klip i zainstalować węzły niestandardowe. Oznacza to możliwość wykonania dowolnego kodu na serwerze. Należy powiązać usługę z localhost i uzyskiwać do niej dostęp za pośrednictwem tunelu SSH z własnego komputera.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Następnie należy otworzyć http://127.0.0.1:8188 w przeglądarce. Należy załadować szablonowy workflow Wan 2.2 z menu szablonów ComfyUI, zamiast ręcznie łączyć węzły. Oficjalne szablony zawierają ustawienia samplera, dla których dostrojono model. Workflow wideo ma znacznie więcej miejsc, w których można niepostrzeżenie ustawić nieprawidłową wartość, niż workflow obrazów.

Kiedy właściwą odpowiedzią jest użycie API

Samodzielne hostowanie generowania wideo jest właściwym rozwiązaniem, gdy obciążenie jest duże i stałe, gdy klatki nie mogą opuszczać własnej infrastruktury albo gdy wymagany jest określony model lub niestandardowy adapter, którego nie oferuje żadna usługa hostowana. Jest to również właściwe rozwiązanie, gdy potok musi działać tak samo za rok, ponieważ model hostowany może zostać zmieniony bez możliwości przypięcia konkretnej wersji.

Z hostowanego API należy korzystać, gdy potrzebnych jest kilka klipów miesięcznie, gdy wymagany jest wynik dłuższy lub większy niż wyniki generowane przez modele open source albo gdy termin upływa w tym tygodniu. Próg rentowności należy obliczać realistycznie. Karta o pojemności 24 GB wynajmowana przez całą dobę, według mediany z July 2026, kosztuje około 260 dollars miesięcznie, a zakup takiej samej karty kosztuje z góry więcej, zanim zostanie wygenerowana choćby jedna klatka. Bezczynny serwer utrzymywany samodzielnie za każdym razem przegrywa z rozliczaniem API za pojedynczy klip. Jest to ten sam kompromis, który decyduje o sposobie udostępniania modeli tekstowych i został omówiony w Ollama a vLLM w samodzielnym hostowaniu modeli LLM, a także kwestia zależna od bardziej podstawowego pytania przedstawionego w czy VPS z GPU jest w ogóle wart tych pieniędzy.

Co sprawdzić, gdy renderowanie kończy się niepowodzeniem

Renderowanie, które kończy się niepowodzeniem na samym końcu, po ukończeniu paska samplera, wyczerpało pamięć podczas dekodowania VAE. Należy zmniejszyć liczbę klatek albo przełączyć się na węzeł dekodowania kafelkowego. Zmiana liczby kroków nie pomoże, ponieważ dekodowanie odbywa się raz, po wykonaniu wszystkich kroków.

Jednolity czarny lub poważnie zniekształcony obraz wyjściowy zwykle oznacza niezgodność VAE z modelem. Załadowanie VAE Wan 2.1 dla modelu dyfuzji Wan 2.2 daje dokładnie taki wynik, a w logu nie pojawia się żaden błąd.

Jeśli renderowanie działa, ale na komputerze wyposażonym w GPU trwa wiele godzin, oznacza to, że ComfyUI korzysta ze ścieżki CPU. Należy sprawdzić w logu uruchamiania wiersz dotyczący urządzenia, a następnie ponownie wykonać powyższe sprawdzenie torch.cuda.is_available().

Zniknięcie procesu z komunikatem Killed w dmesg i bez śladu stosu Pythona oznacza działanie systemowego zabójcy procesów z powodu braku pamięci. W tym przypadku chodzi o RAM systemu, a nie VRAM. Offloading wymaga załadowania całego modelu do pamięci RAM systemu, dlatego komputer z 16 GB RAM, który wykonuje offloading modelu 5B, ma za mało pamięci. Należy dodać RAM albo utworzyć swap.

FAQ

Czy można generować wideo AI na VPS bez GPU?

Nie, nie w sposób, który uzasadniałby powtarzanie tej czynności. Wygenerowanie 5-sekundowego klipu 720p, które na GPU z 24 GB zajmuje 9 minut, na CPU trwa wiele godzin, ponieważ model nie może korzystać ze sprzętowych jednostek macierzowych, a przepustowość pamięci RAM jest o rząd wielkości niższa niż przepustowość pamięci GPU. Serwer CPU może udostępniać interfejs ComfyUI, przechowywać modele i workflows, ale samo renderowanie wymaga GPU.

Ile VRAM jest potrzebne dla Wan 2.2?

W przypadku modelu TI2V-5B minimum wynosi 8 GB przy użyciu natywnego offloading w ComfyUI, natomiast 24 GB jest wymagane do osiągnięcia szybkości opublikowanej przez Alibaba. W przypadku modeli A14B text-to-video i image-to-video karta modelu wymaga co najmniej 80 GB VRAM do wnioskowania na pojedynczym GPU, dlatego potrzebne są karty do centrów danych.

Jak długi może być klip hostowany samodzielnie?

Według stanu na July 2026 praktyczną jednostką jest około 5 sekund w rozdzielczości 720p. Dłuższy materiał tworzy się przez generowanie segmentów i ich łączenie, wykorzystując ostatnią klatkę jednego segmentu jako pierwszą klatkę następnego. Jakość zmienia się w miejscach łączenia, dlatego długi materiał należy traktować jako zadanie montażowe, a nie pojedyncze generowanie.

Czy wynajem GPU na godziny jest tańszy niż zakup karty?

Wynajem jest korzystniejszy, jeśli renderowanie trwa mniej niż kilka godzin dziennie. Przy medianie z July 2026 wynoszącej około 0.36 dollars za godzinę za kartę z 24 GB można wynajmować ją przez długi czas, zanim koszt osiągnie cenę zakupu tej karty. Unika się również zakupu sprzętu, który okaże się nieodpowiednią klasą dla używanego modelu. Zakup jest korzystniejszy tylko wtedy, gdy serwer jest obciążony przez większą część dnia, każdego dnia.

#ai-video#comfyui#gpu#self-hosting#wan#vram