SSD Nodes Learn Hosting plans →
Посібники Matt ConnorВід Matt Connor · Оновлено 2026-08-13

Чи потрібен VPS із GPU для запуску нейромереж?

Дізнайтеся, коли варто орендувати VPS із GPU, а коли достатньо CPU. Розбираємо пропускну здатність пам'яті для моделей 7B-27B, Whisper та ембедингів. Почніть із вимірів.

Чи потрібен VPS із GPU, чи достатньо CPU?

VPS із GPU змінює два аспекти самостійного запуску моделей: швидкість генерації токенів та можливість розміщення моделі в пам'яті. Більше нічого не змінюється. Якщо ваше завдання — це квантована чат-модель розміром від 7B до 27B для одного користувача, завдання з ембедингу з низьким навантаженням або транскрипція мовлення через Whisper small, звичайний CPU VPS з достатнім обсягом RAM впорається з роботою. Почніть із CPU, виміряйте показник, який вас не влаштовує, а потім переходьте на вищий рівень.

Причина полягає в пропускній здатності пам'яті. Коли мовна модель генерує один токен, вона зчитує кожну необхідну вагу з пам'яті. Модель 8B, квантована до 4 біт, займає приблизно 4.7 GB на диску та стільки ж у пам'яті, тому створення одного токена означає передачу близько 4.7 GB даних. Розділіть пропускну здатність пам'яті машини на це число, і ви отримаєте граничну кількість токенів за секунду. Це просте ділення пояснює майже кожен бенчмарк, який ви зустрінете.

Що насправді дає GPU

Пропускна здатність. Оперативна пам'ять DDR5 на сучасному сервері передає дані зі швидкістю десятки гігабайтів на секунду. Відеопам'ять (VRAM) — сотні або навіть понад тисячу. Співвідношення цих показників і визначає приріст швидкості, який є значним.

Місткість у поєднанні зі швидкістю. Сервер із CPU та 64 GB RAM може завантажити модель 70B у 4-бітному квантуванні. Вона працюватиме, але швидкість буде ближчою до швидкості читання, ніж до швидкості спілкування. GPU допоможе лише в тому випадку, якщо модель повністю вміщується у VRAM. Як тільки шари моделі виходять за межі відеопам'яті в системну RAM, швидкість знову обмежується повільним каналом.

Пропускна здатність пакетів (batch throughput). Це аспект, який часто недооцінюють. Коли GPU генерує відповідь для одного користувача, більша частина обчислювальних потужностей простоює, оскільки система очікує на дані з пам'яті. Якщо обробляти 20 запитів одночасно, одне зчитування ваг моделі обслуговує всі 20 запитів. Сумарна кількість токенів за секунду зростає в рази, тоді як швидкість для кожного окремого користувача майже не падає. CPU так не вміє. Два одночасні користувачі на CPU-сервері приблизно вдвічі знижують швидкість роботи один для одного. Якщо ви створюєте API, до якого звертається багато клієнтів, пакетна обробка є вагомішим аргументом на користь GPU, ніж швидкість обробки одного потоку.

Обробка промптів. Читання довгого промпту обмежене обчислювальною потужністю, а не швидкістю пам'яті, і саме тут GPU мають найбільшу перевагу. Контекст на 30 000 токенів, який CPU обробляє цілу хвилину, GPU опрацьовує за кілька секунд. Системи пошуку (retrieval), які додають документи до кожного запиту, постійно відчувають цей ефект.

Орієнтовні показники та як їх інтерпретувати

Блок нижче містить типові опубліковані показники для однопотокової обробки моделі 8B з 4-бітною квантизацією станом на липень 2026 року. Це орієнтовні значення, а не гарантовані результати. Ваша квантизація, довжина контексту та рушій виводу (inference engine) впливатимуть на ці цифри.

Chart8B model at 4-bit: typical single-stream generation speed (July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU, DDR4",
    "mem_bandwidth_gbs": 40,
    "tokens_per_sec": 6
  },
  {
    "label": "16 vCPU, DDR5",
    "mem_bandwidth_gbs": 75,
    "tokens_per_sec": 11
  },
  {
    "label": "24GB GPU",
    "mem_bandwidth_gbs": 300,
    "tokens_per_sec": 50
  },
  {
    "label": "40GB data-centre GPU",
    "mem_bandwidth_gbs": 1555,
    "tokens_per_sec": 130
  }
]

Рядок для GPU з 24 GB пам'яті показує 50 токенів на секунду проти 11 для системи з CPU та пам'яттю DDR5. Це приблизно в п'ять разів більше, що відповідає співвідношенню пропускної здатності пам'яті, а не різниці в чистій обчислювальній потужності. Реальна пропускна здатність також виявляється нижчою за пропускну здатність пам'яті, поділену на розмір моделі, оскільки механізм attention при збільшенні контексту додає обчислювальне навантаження, яке просте ділення не враховує.

Для порівняння, людина читає зі швидкістю приблизно від 5 до 10 слів на секунду. Будь-яка швидкість від 15 токенів на секунду і вище вже сприймається одним користувачем як звичайний набір тексту. Саме тому багато конфігурацій, що працюють лише на CPU, цілком прийнятні для використання.

Розрахунок обсягу VRAM перед купівлею

Розмір файлу моделі — це лише мінімальний поріг, а не повна вимога. Враховуйте ваги, KV-кеш (key-value cache, пам'ять для кожного токена, яку використовує механізм attention), а також приблизно 1 GB для системних потреб.

Практичне правило станом на липень 2026 року: візьміть розмір файлу моделі в гігабайтах і додайте 20 відсотків для стандартного контексту від 8k до 16k. Моделі 8B розміром 4.7 GB потрібно близько 6 GB VRAM. Модель 27B у 4-бітному квантуванні займає близько 16 GB і потребує приблизно 20 GB. Модель 70B у 4-бітному квантуванні займає близько 40 GB, тому для неї потрібна карта на 48 GB або дві менші карти. Ця арифметика працює і для значно більших моделей, а математика VRAM для моделі з 2.8 трильйонами параметрів, як-от Kimi K3 показує, що вибір відеокарти перестає бути головним питанням.

Великі контексти порушують це правило. KV-кеш зростає лінійно залежно від довжини контексту, і при 128k токенах він може перевищити обсяг самих ваг. Якщо ви плануєте використовувати великі контексти, спочатку розраховуйте обсяг для кешу та перевірте, які методи квантування кешу підтримує ваш рушій.

Перевірка наявного обладнання

На інстансі з GPU спочатку переконайтеся, що драйвер розпізнає відеокарту.

nvidia-smi

Ви повинні побачити таблицю з назвою GPU, версією драйвера та використанням пам'яті відносно загального обсягу. Помилка NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver означає, що драйвер відсутній або модуль ядра не перезібрався після оновлення ядра. У стандартному образі Ubuntu зазвичай допомагає sudo apt install -y ubuntu-drivers-common && sudo ubuntu-drivers install, після чого потрібно перезавантажити систему для завантаження нового модуля.

Для контейнерів самого драйвера недостатньо. Docker потребує NVIDIA Container Toolkit для прокидання пристрою.

sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Далі перевірте, чи працює прокидання пристрою всередині контейнера:

sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smi

Має з'явитися та сама таблиця. Помилка docker: Error response from daemon: could not select device driver, що вказує на неможливість задовольнити вимоги GPU, означає, що toolkit встановлено, але Docker не було переналаштовано або перезапущено. Повторно виконайте nvidia-ctk та перезапустіть службу. У Compose аналогом є запис deploy.resources.reservations.devices, де driver має значення nvidia, а список можливостей містить gpu. Це додається до звичайних визначень сервісів, описаних у Docker Compose на VPS.

Вимірювання перед оновленням

Запустіть модель, яку ви плануєте використовувати, на наявному сервері та зафіксуйте показники. У випадку з самостійним хостингом LLM через Ollama на VPS для цього достатньо одного прапорця:

ollama run llama3.1:8b --verbose "Summarise the causes of the 1929 crash in 200 words."

Вивід завершується даними про час виконання. eval rate — це швидкість генерації в токенах за секунду. prompt eval rate показує, як швидко машина обробила ваш вхідний запит. Ці два числа вказують на те, яке саме оновлення допоможе: низький показник eval rate свідчить про обмежену пропускну здатність пам'яті, а низький prompt eval rate на довгих вхідних даних — про недостатню обчислювальну потужність.

На машині з GPU переконайтеся, що модель дійсно завантажилася в пам'ять відеокарти:

ollama ps

У стовпці PROCESSOR має бути значення 100% GPU, якщо модель повністю помістилася, або значення на кшталт 43%/57% CPU/GPU, якщо ні. Часткове розділення моделі зазвичай працює гірше, ніж ви очікуєте, оскільки кожен токен все одно очікує на завершення обробки повільною частиною системи.

Питання вартості

GPU-інстанси коштують у кілька разів дорожче за порівнянні CPU-інстанси, і оплата за них нараховується за кожну годину існування, а не за згенеровані токени. Постійно активний GPU, що обробляє лише кілька запитів на день, — це найдорожчий спосіб запуску інференсу. Точка беззбитковості залежить від рівня утилізації: завантажений GPU коштує дешево в перерахунку на токен, а той, що простоює, — це чисті збитки.

Існують три ефективні підходи. Стабільні завдання з низьким обсягом навантаження краще тримати на CPU VPS. Епізодичні складні запити варто надсилати до hosted API з оплатою за токен. GPU слід орендувати погодинно для пакетної обробки, донавчання (fine-tuning) або масового створення ембедингів, після чого видаляти інстанс. Поєднання цих методів є стандартною практикою, а дисципліна бюджетування, описана в контролі витрат на AI-агенти на постійно активному VPS, застосовується і тут, з тією різницею, що головним джерелом витрат є час простою, а не кількість токенів.

Що все ще добре працює без GPU

Ембединги при невеликих обсягах. Мала модель для ембедингів обробляє сотні коротких документів за хвилину на кількох ядрах CPU, а індекс, який ви будуєте один раз, не потребує високої швидкості.

Whisper small та base для транскрипції. Faster-whisper на CPU транскрибує майже в реальному часі для моделі small, чого достатньо для конвеєра, який працює вночі.

Квантовані чат-моделі розміром приблизно до 27B для одного або двох користувачів. Повільно, але читабельно та придатне для використання.

Будь-що, що можна назвати пакетним завданням (batch job). Якщо ніхто не дивиться на екран, швидкість виконання — це питання планування, а не вимога.

Що дійсно потребує GPU: навчання або донавчання (fine-tuning), окрім невеликих адаптерів, обслуговування багатьох одночасних користувачів, генерація зображень і відео, а також мовлення в реальному часі, де затримка є критичним параметром продукту.

FAQ

Скільки VRAM потрібно для моделі 7B або 8B?

Приблизно 6 GB для 4-бітної квантованої моделі 8B при стандартному контексті від 8k до 16k. Вага моделі становить близько 4.7 GB, решта — це KV-кеш плюс приблизно 1 GB накладних витрат. Карта з 12 GB VRAM забезпечує достатньо місця для довших контекстів. Якщо ви плануєте працювати з контекстом 128k, розраховуйте розмір кешу окремо, оскільки він може перевищувати розмір ваг моделі.

Чи можна запустити Ollama без GPU?

Так. Ollama автоматично перемикається на CPU і потребує лише достатньої кількості RAM для завантаження моделі. Очікуйте приблизно 5–12 токенів на секунду для 4-бітної моделі 8B залежно від швидкості пам'яті, що близько до швидкості читання для одного користувача. Довгі запити (prompts) є основною проблемою при роботі на CPU, оскільки обробка 30 000 токенів контексту обмежена обчислювальною потужністю і займає значно більше часу, ніж генерація відповіді.

Чому мій GPU працює ледь швидше за CPU?

Зазвичай це стається тому, що модель не повністю вмістилася у VRAM, тому частина шарів виконується на CPU, і кожен токен очікує завершення обробки на повільній частині. Запустіть ollama ps і перевірте, чи стовпець PROCESSOR показує 100% GPU. Якщо відображається розділення, використайте меншу квантизацію або меншу модель. Інша поширена причина — короткий бенчмарк, де час завантаження моделі переважає над часом генерації.

Чи варто орендувати GPU VPS для одного користувача?

Зазвичай ні. Одна людина читає зі швидкістю 5–10 слів на секунду, і CPU-сервер генерує токени швидше за цю швидкість для моделей розміром до 13B. Випадки, що виправдовують витрати для одного користувача: довгі запити, генерація зображень та fine-tuning. Обслуговування багатьох користувачів одночасно є найсильнішим аргументом, оскільки пакетна обробка (batching) дозволяє одному GPU відповідати на двадцять запитів майже за ту саму ціну, що й на один.

Чи краще орендувати GPU погодинно, чи тримати його постійно увімкненим?

Орендуйте погодинно, коли робота має епізодичний характер: fine-tuning, масове створення ембедингів або пакетна транскрибація. Тримайте сервер постійно увімкненим лише тоді, коли карта постійно завантажена, оскільки за GPU-інстанс нараховується плата за факт існування, а не за кількість згенерованих токенів. Асистент із низьким трафіком дешевше обійдеться на CPU VPS або через API з оплатою за токени, ніж на простоюючому GPU.