SSD Nodes Learn Hosting plans →
Przewodniki Matt ConnorAutor: Matt Connor · Zaktualizowano 2026-08-13

Samodzielny generator wideo AI: realne możliwości 2026

Analiza wydajności modeli Wan 2.2, HunyuanVideo i LTX-Video w lipcu 2026 roku. Sprawdź wymagania VRAM, koszty wynajmu GPU oraz czas renderowania 5-sekundowych klipów w 720p.

Możliwości samodzielnie hostowanego generatora wideo AI

Samodzielnie hostowany generator wideo AI działa w obecnych warunkach, jednak jest wolniejszy i oferuje mniejszą skalę niż sugerują materiały demonstracyjne. Według stanu na lipiec 2026 roku, otwarte modele warte uruchomienia to Wan 2.2 od Alibaba oraz HunyuanVideo od Tencent, a także LTX-Video od Lightricks, gdy szybkość jest ważniejsza niż realizm. Wszystkie one działają w środowisku ComfyUI na maszynie z systemem Linux i kartą graficzną NVIDIA. Wynikiem jest klip o długości około pięciu sekund w rozdzielczości 720p. Nie jest to scena. Nie jest to minuta gotowego materiału.

Oto krótka odpowiedź przed szczegółami. Karta z 24 GB VRAM renderuje pięciosekundowy klip 720p w czasie liczonym w pojedynczych minutach. Karta z 12 GB VRAM wykonuje to samo zadanie w dwadzieścia minut lub dłużej, ponieważ wagi modelu nie mieszczą się w pamięci wideo, a oprogramowanie stale przenosi warstwy między VRAM a pamięcią RAM systemu. Serwer bez GPU nie jest w stanie wykonać tego zadania w żaden użyteczny sposób. Arytmetyka, która sprawiała, że generowanie obrazów na CPU było wolne, czyni generowanie wideo na CPU bezcelowym.

Jeśli czytano już drabinę sprzętową dla samodzielnie hostowanego generatora obrazów, wideo stanowi ten sam argument, w którym każda wartość została przesunięta o klasę wyżej. VRAM (pamięć wideo, RAM przylutowany obok układu graficznego) pozostaje jedynym parametrem decydującym o tym, czy praca z tym oprogramowaniem jest przyjemnością, czy udręką.

Dlaczego koszt wygenerowania wideo znacznie przewyższa koszt wygenerowania obrazu

Model dyfuzyjny generuje obraz poprzez odszumianie go w kolejnych krokach, a każdy krok odczytuje wszystkie wagi modelu. Model wideo wykonuje tę samą operację na całym bloku klatek jednocześnie, dodając mechanizm uwagi w czasie (temporal attention), dzięki czemu klatka 80 „wie”, jak wyglądała klatka 12. Pięć sekund przy 24 klatkach na sekundę oznacza 120 klatek w jednej partii (batch).

Wspomniana uwaga czasowa sprawia, że koszt nie rośnie liniowo wraz z długością klipu. Podwojenie liczby klatek powoduje ponad dwukrotny wzrost zapotrzebowania na pamięć samplera, dlatego błędem nie jest wolniejsze renderowanie, lecz całkowite przerwanie procesu.

Istnieje drugi skok zapotrzebowania na pamięć, którego użytkownicy często się nie spodziewają. Po zakończeniu pracy samplera, VAE (wariacyjny autokoder, komponent przekształcający skompresowane przestrzenie utajone w rzeczywiste piksele) dekoduje całe wideo jednocześnie. Ten proces dekodowania może wymagać więcej pamięci niż samo próbkowanie. Objawem jest zadanie, które wyświetla pasek postępu zakończony w 100%, a następnie zwraca następujący błąd:

torch.cuda.OutOfMemoryError: CUDA out of memory. Tried to allocate 9.31 GiB

Rozwiązaniem jest dekodowanie kafelkowe (tiled decoding) lub skrócenie klipu. Wiedza o tym, który etap wyczerpał pamięć, pozwala uniknąć godzin bezcelowej optymalizacji niewłaściwych parametrów.

Ile pamięci VRAM potrzeba do generowania wideo przez AI

Dwie opublikowane wartości definiują całą decyzję i na pierwszy rzut oka wydają się sprzeczne. Alibaba podaje, że model Wan 2.2 TI2V-5B generuje klipy 720p przy 24 klatkach na sekundę i długości pięciu sekund w czasie poniżej dziewięciu minut na pojedynczym konsumenckim GPU, takim jak 4090, zalecając przy tym co najmniej 24 GB VRAM. Dokumentacja ComfyUI stwierdza natomiast, że ten sam model 5B „powinien dobrze mieścić się w 8 GB VRAM przy użyciu natywnego offloadingu w ComfyUI”.

Oba stwierdzenia są prawdziwe, ponieważ mierzą różne parametry. 8 GB to wartość, przy której model się mieści. 24 GB to wartość, przy której praca jest komfortowa. Offloading polega na utrzymywaniu większości modelu w pamięci RAM systemu i przesyłaniu warstw do GPU na każdym kroku, przez co karta spędza czas na oczekiwaniu na magistralę PCIe zamiast na obliczeniach. Ten koszt ponosi się na każdym kroku samplera, a nie tylko raz.

ChartWan 2.2 TI2V-5B, one 5 second 720p clip (typical, July 2026)
The data behind this chart
[
  {
    "label": "8GB VRAM, heavy offloading",
    "minutes_per_clip": 40
  },
  {
    "label": "12GB VRAM",
    "minutes_per_clip": 22
  },
  {
    "label": "16GB VRAM",
    "minutes_per_clip": 14
  },
  {
    "label": "24GB VRAM, 4090 class",
    "minutes_per_clip": 9
  }
]

Tylko ostatni wiersz zawiera wartość producenta. Karta 24 GB osiąga wynik 9 minut na klip, co jest oficjalną liczbą podaną przez Alibabę dla tego modelu. Pozostałe wiersze pokazują wpływ offloadingu i są raczej rzędem wielkości niż wynikami benchmarków. Istotny jest kształt tej zależności: 40 minut na karcie 8 GB to technicznie działająca konfiguracja, która w praktyce staje się zadaniem wsadowym uruchamianym na całą noc.

Większe modele Wan 2.2 to zupełnie inna kategoria. Warianty A14B text-to-video oraz image-to-video wymagają co najmniej 80 GB VRAM do inferencji na pojedynczym GPU. Jest to sprzęt klasy centrum danych, a nie karta montowana w komputerze biurkowym; to punkt, w którym self-hosting zaczyna oznaczać wynajmowanie akceleratora innej firmy na godziny. Ta sama arytmetyka działa jeszcze intensywniej w przypadku tekstu, gdzie self-hosting modelu o 2,8 biliona parametrów, takiego jak Kimi K3 przestaje być pytaniem o jedną kartę, a staje się pytaniem o to, ile kart 80 GB można ze sobą połączyć.

Koszt wygenerowania klipu na wynajętym GPU

Wynajem jest zalecaną metodą testowania, ponieważ zakupiona karta może okazać się niewłaściwym sprzętem, jeśli docelowy model wymaga 80 GB pamięci VRAM. Mediana cen na żądanie na rynku wynajmu GPU, stan na lipiec 2026:

ChartMedian on-demand GPU rental and cost per 5 second clip (July 2026)
The data behind this chart
[
  {
    "label": "RTX 4090, 24GB",
    "usd_per_hour": 0.36,
    "usd_per_clip": 0.05
  },
  {
    "label": "A100, 80GB",
    "usd_per_hour": 1.79,
    "usd_per_clip": 0.6
  },
  {
    "label": "H100, 80GB",
    "usd_per_hour": 2.99,
    "usd_per_clip": 0.55
  }
]

Wiersz dla 4090 obsługuje model 5B i kosztuje około 0.05 dolara za klip przy stawce 0.36 dolara za godzinę. Wiersze z 80 GB pamięci obsługują modele 14B, dlatego koszt za klip wzrasta do 0.6 dolara, mimo że sam sprzęt jest znacznie szybszy. Większy model oznacza większe zapotrzebowanie na moc obliczeniową na sekundę wideo.

Pięć centów za klip wydaje się kwotą znikomą, jednak jest to mylące. Pierwsze użyteczne pięć sekund materiału nigdy nie powstaje w wyniku pojedynczego renderowania. Tworzenie promptów dla modelu wideo to proces poszukiwawczy; wykonanie od dwudziestu do czterdziestu renderów przed uzyskaniem satysfakcjonującego ujęcia z określonym ruchem jest normą. Sesja robocza kosztuje zatem dolary, a nie centy, a popołudnie spędzone na iteracjach na wynajętym sprzęcie kosztuje tyle, co obiad.

Dwa szczegóły dotyczące wynajmu generują realne koszty, jeśli zostaną pominięte. Opłata jest naliczana w czasie, gdy serwer pobiera wagi modelu, a pliki Wan 2.2 wraz z enkoderem tekstu i VAE zajmują dziesiątki gigabajtów, dlatego należy wybrać dostawcę oferującego wolumeny trwałe (persistent volume) i pobrać dane tylko raz. Opłata jest również naliczana, gdy serwer pozostaje bezczynny z otwartą sesją SSH. Należy zatrzymać instancję zamiast jedynie zamykać terminal.

Instalacja ComfyUI na serwerze z GPU

Rozpocznij od systemu Ubuntu 24.04 z zainstalowanym sterownikiem NVIDIA. Najpierw sprawdź sterownik, ponieważ bez tego kroku każda późniejsza awaria wygląda identycznie.

nvidia-smi

Polecenie to musi wyświetlić tabelę z informacjami o karcie oraz wersją CUDA. Jeśli wyświetli NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver, oznacza to, że moduł jądra nie został załadowany, co zazwyczaj zdarza się po aktualizacji jądra bez restartu systemu. Należy to naprawić w tym miejscu. W przeciwnym razie ComfyUI przełączy się na przetwarzanie przez CPU, a diagnoza przyczyny problemu z modelem zajmie godzinę.

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

Upewnij się, że PyTorch widzi kartę graficzną przed pobraniem jakiegokolwiek pliku wag.

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True wraz z nazwą karty oznacza, że stos oprogramowania działa poprawnie. False oznacza, że zainstalowana paczka to wersja przeznaczona wyłącznie dla CPU, co zdarza się, gdy pip korzysta z pamięci podręcznej torch z wcześniejszej instalacji. Zainstaluj ponownie, używając powyższego adresu URL indeksu.

Pobieranie plików modelu Wan 2.2

ComfyUI jest dostarczany bez wag, a model wideo nie składa się z jednego pliku. Jest to model dyfuzyjny, koder tekstu oraz VAE, a każdy z nich wymaga umieszczenia w odpowiednim katalogu. Umieszczenie pliku w niewłaściwym folderze spowoduje, że węzeł ładujący po prostu go nie wyświetli, bez żadnego komunikatu o błędzie wyjaśniającego przyczynę.

cd ~/ComfyUI/models
wget -P diffusion_models https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/diffusion_models/wan2.2_ti2v_5B_fp16.safetensors
wget -P text_encoders https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget -P vae https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/vae/wan2.2_vae.safetensors

Model 5B obsługuje zarówno generowanie wideo z tekstu, jak i z obrazu, dlatego jest najbardziej rozsądnym punktem wyjścia. Zawsze należy preferować .safetensors zamiast .ckpt. Plik .ckpt jest obiektem Python w formacie pickle, więc jego załadowanie uruchamia kod napisany przez osobę, która go przygotowała. Należy zapewnić odpowiednią ilość miejsca na dysku: działająca instalacja z jedną rodziną modeli i jej wynikami wymaga 100 GB, a pliki wideo są znacznie większe niż pliki PNG pozostawiane przez procesy generowania obrazów. Pliki JSON z przepływami pracy należy zabezpieczać za pomocą narzędzi takich jak szyfrowane kopie zapasowe przyrostowe do pamięci obiektowej, ponieważ wagi można pobrać ponownie, natomiast dostrojone przepływy pracy nie podlegają odzyskaniu.

Uruchomienie i bezpieczny dostęp

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI nie posiada ekranu logowania ani kont użytkowników. Każdy podmiot mający dostęp do portu 8188 może kolejkować zadania, odczytywać wszystkie wygenerowane pliki oraz instalować niestandardowe węzły (custom nodes), co oznacza możliwość wykonania dowolnego kodu na serwerze. Należy powiązać usługę z localhost i uzyskiwać do niej dostęp poprzez tunel SSH z własnej maszyny.

ssh -N -L 8188:127.0.0.1:8188 you@your-server

Następnie otwórz http://127.0.0.1:8188 w przeglądarce. Załaduj szablon workflow Wan 2.2 z menu szablonów ComfyUI zamiast ręcznie łączyć węzły. Oficjalne szablony zawierają ustawienia samplera, dla których model został dostrojony, a workflow wideo posiada znacznie więcej miejsc, w których można błędnie skonfigurować wartości niż w przypadku workflow obrazów.

Kiedy uczciwą odpowiedzią jest użycie API

Self-hosting generowania wideo jest właściwym wyborem, gdy wolumen jest duży i stały, gdy klatki nie mogą opuścić własnej infrastruktury lub gdy wymagany jest konkretny model bądź niestandardowy adapter, którego nie oferuje żadna usługa zewnętrzna. Jest to również właściwe rozwiązanie, gdy potok przetwarzania musi działać w ten sam sposób za rok, ponieważ model zewnętrzny może ulec zmianie bez możliwości przypięcia wersji.

Użyj zewnętrznego API, gdy potrzebujesz kilku klipów miesięcznie, gdy potrzebujesz wyjścia dłuższego lub większego niż to, co generują modele otwartoźródłowe, lub gdy masz termin realizacji w tym tygodniu. Uczciwie przeprowadź analizę progu rentowności. Karta 24 GB wynajmowana całodobowo według mediany z lipca 2026 roku kosztuje około 260 dolarów miesięcznie, a zakup tej samej karty kosztuje więcej z góry, zanim wygenerujesz choć jedną klatkę. Bezczynny serwer self-hosted zawsze przegrywa z modelem płatności za klip w API. Jest to ten sam kompromis, który decyduje o sposobie serwowania modeli tekstowych, omówiony w Ollama kontra vLLM w self-hosted serwowaniu LLM, i opiera się na bardziej podstawowym pytaniu zawartym w czy VPS z GPU w ogóle jest opłacalny.

Co sprawdzić, gdy renderowanie kończy się niepowodzeniem

Renderowanie, które przerywa się na samym końcu, po zakończeniu paska samplera, oznacza brak pamięci podczas dekodowania VAE. Należy zmniejszyć liczbę klatek lub przełączyć się na węzeł dekodowania kafelkowego (tiled decode node). Zmiana liczby kroków nie pomoże, ponieważ dekodowanie następuje jednorazowo, już po wykonaniu wszystkich kroków.

Dane wyjściowe, które są całkowicie czarne lub mocno zniekształcone, zazwyczaj oznaczają, że VAE nie pasuje do modelu. VAE z Wan 2.1 załadowane do modelu dyfuzyjnego Wan 2.2 daje dokładnie taki efekt, a w dzienniku nie pojawia się żaden błąd.

Renderowanie, które działa, ale zajmuje godziny na maszynie wyposażonej w GPU, oznacza, że ComfyUI korzysta ze ścieżki CPU. Należy sprawdzić dziennik uruchamiania pod kątem linii dotyczącej urządzenia, a następnie ponownie wykonać sprawdzenie torch.cuda.is_available() opisane powyżej.

Zniknięcie procesu z Killed w dmesg bez śladu stosu (traceback) języka Python oznacza działanie mechanizmu OOM killer (out-of-memory killer) jądra systemu. Problem dotyczy pamięci RAM, a nie VRAM. Offloading wymaga, aby cały model znajdował się w pamięci RAM, co oznacza, że maszyna z 16 GB RAM przy offloadingu modelu 5B ma zbyt mało zasobów. Należy zwiększyć ilość pamięci RAM lub dodać przestrzeń wymiany (swap).

FAQ

Czy mogę generować wideo AI na VPS bez GPU?

Nie, nie w sposób, który nadawałby się do powtórnego użycia. Pięciosekundowy klip 720p, którego wygenerowanie na karcie z 24 GB VRAM zajmuje dziewięć minut, na procesorze CPU trwa wiele godzin. Model nie ma dostępu do sprzętowego przyspieszenia obliczeń macierzowych, a przepustowość pamięci RAM jest o rząd wielkości niższa niż przepustowość pamięci GPU. Serwer z samym CPU może obsługiwać interfejs ComfyUI, przechowywać modele i zarządzać workflowami, ale samo renderowanie wymaga GPU.

Ile VRAM potrzeba dla Wan 2.2?

Dla modelu TI2V-5B minimum wynosi 8 GB przy użyciu natywnego offloadingu w ComfyUI, natomiast 24 GB to wartość zalecana przez Alibaba w celu uzyskania deklarowanej wydajności. W przypadku modeli A14B (text-to-video oraz image-to-video) karta modelu wymaga co najmniej 80 GB VRAM do inferencji na pojedynczym GPU, co oznacza konieczność użycia kart klasy data-center.

Jak długi może być klip wygenerowany lokalnie?

Na lipiec 2026 roku praktycznym standardem jest około pięć sekund w rozdzielczości 720p. Dłuższe materiały uzyskuje się poprzez generowanie segmentów i łączenie ich, przy czym ostatnia klatka jednego segmentu służy jako pierwsza klatka kolejnego. Jakość może ulegać pogorszeniu na łączeniach, dlatego długie wideo należy traktować jako zadanie montażowe, a nie pojedynczą generację.

Czy wynajem GPU na godziny jest tańszy niż zakup karty?

Wynajem jest bardziej opłacalny przy renderowaniu trwającym mniej niż kilka godzin dziennie. Przy medianie cen z lipca 2026 roku wynoszącej około 0,36 dolara za godzinę pracy karty z 24 GB VRAM, można wynajmować sprzęt przez bardzo długi czas, zanim koszt zrówna się z ceną zakupu karty. Pozwala to również uniknąć zakupu sprzętu, który okaże się nieodpowiedni dla modeli, z których faktycznie chcesz korzystać. Zakup staje się opłacalny tylko wtedy, gdy jednostka jest obciążona przez większość dnia, każdego dnia.