SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-13

Нужен ли VPS с GPU для запуска нейросетей

Узнайте, когда аренда VPS с GPU оправдана для работы с нейросетями. Разбираем, почему квантованные модели и Whisper small эффективно работают на обычном CPU с достаточным RAM.

Нужен ли вам VPS с GPU или достаточно CPU?

VPS с GPU меняет два аспекта при самостоятельном запуске модели: скорость генерации токенов и возможность размещения модели в памяти. Больше ничего не меняется. Если ваша задача — работа с квантованной чат-моделью от 7B до 27B для одного пользователя, выполнение задач по созданию эмбеддингов с низкой интенсивностью или транскрибация речи с помощью Whisper small, обычного VPS с CPU и достаточным объемом RAM будет достаточно. Начните с CPU, оцените показатели, которые вас не устраивают, и только потом переходите на более мощное оборудование.

Причина кроется в пропускной способности памяти. Когда языковая модель генерирует один токен, она считывает из памяти все необходимые веса. Модель 8B, квантованная до 4 бит, занимает на диске примерно 4.7 GB, столько же — в оперативной памяти. Таким образом, генерация одного токена требует передачи около 4.7 GB данных. Разделите пропускную способность памяти машины на это число, и вы получите предельное количество токенов в секунду. Это простое деление объясняет почти все результаты тестов, которые вы встретите.

Что на самом деле дает GPU

Пропускная способность. Оперативная память DDR5 на современном сервере передает данные со скоростью десятки гигабайт в секунду. Видеопамять (VRAM) — сотни и более тысячи. Отношение этих скоростей и есть показатель ускорения, и он весьма значителен.

Емкость и скорость. Сервер с CPU и 64 GB оперативной памяти может загрузить 70B модель в 4-битном квантовании. Она будет работать, но скорость генерации будет ближе к чтению текста, чем к живому общению. GPU помогает здесь только в том случае, если модель полностью помещается в VRAM. Как только слои модели начинают выгружаться в системную оперативную память, процесс снова ограничивается низкой скоростью шины.

Пакетная обработка (batch throughput). Это аспект, который часто недооценивают. Когда GPU генерирует ответ для одного пользователя, большая часть вычислительных мощностей простаивает, так как процессор ожидает данные из памяти. Если обрабатывать 20 запросов одновременно, одни и те же веса модели обслуживают всех 20 пользователей сразу. Суммарное количество токенов в секунду возрастает в несколько раз, при этом скорость для каждого отдельного пользователя почти не падает. CPU так не умеет. Два одновременных пользователя на CPU-сервере делят производительность примерно пополам. Если вы создаете API, к которому обращаются многие клиенты, пакетная обработка — это главный аргумент в пользу GPU, более весомый, чем скорость работы в однопоточном режиме.

Обработка промптов. Чтение длинного промпта ограничено вычислительной мощностью, а не пропускной способностью памяти, и именно здесь GPU выигрывают с наибольшим отрывом. Контекст в 30 000 токенов, который CPU обрабатывает целую минуту, GPU прочитывает за несколько секунд. Системы поиска (retrieval), которые добавляют документы в каждый запрос, постоянно ощущают это преимущество.

Примерные показатели и их интерпретация

Ниже приведены типичные опубликованные значения для однопоточного режима работы модели 8B с 4-битной квантованием по состоянию на июль 2026 года. Это ориентировочные данные, а не гарантия производительности. Итоговые показатели зависят от выбранного метода квантования, длины контекста и движка инференса.

Chart8B model at 4-bit: typical single-stream generation speed (July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU, DDR4",
    "mem_bandwidth_gbs": 40,
    "tokens_per_sec": 6
  },
  {
    "label": "16 vCPU, DDR5",
    "mem_bandwidth_gbs": 75,
    "tokens_per_sec": 11
  },
  {
    "label": "24GB GPU",
    "mem_bandwidth_gbs": 300,
    "tokens_per_sec": 50
  },
  {
    "label": "40GB data-centre GPU",
    "mem_bandwidth_gbs": 1555,
    "tokens_per_sec": 130
  }
]

Строка для GPU с 24 GB видеопамяти показывает 50 токенов в секунду против 11 для системы с CPU и памятью DDR5. Разница составляет примерно пять раз, что соответствует соотношению пропускной способности памяти, а не различиям в чистой вычислительной мощности. Реальная пропускная способность всегда ниже, чем результат деления пропускной способности памяти на размер модели, так как механизм attention при увеличении контекста создает дополнительную нагрузку, которую простое деление не учитывает.

Для сравнения: человек читает со скоростью примерно 5–10 слов в секунду. Любая скорость от 15 токенов в секунду и выше воспринимается одним пользователем как обычный темп печати. Именно поэтому многие конфигурации, работающие только на CPU, вполне пригодны для использования.

Расчет объема VRAM перед покупкой

Размер файла модели — это нижний порог, а не итоговое требование. Учитывайте вес модели, KV cache (key-value cache — память для каждого токена, необходимая механизму внимания) и около 1 GB на накладные расходы.

Практическое правило на июль 2026 года: возьмите размер файла модели в гигабайтах и добавьте 20 процентов для стандартного контекста от 8k до 16k. Модели 8B размером 4.7 GB требуется около 6 GB VRAM. Модель 27B в 4 бита занимает около 16 GB и требует примерно 20 GB. Модель 70B в 4 бита занимает около 40 GB, поэтому для нее нужна карта на 48 GB или две карты меньшего объема. Эта арифметика работает и для гораздо больших моделей, а расчет VRAM для модели с 2.8 триллионами параметров, такой как Kimi K3 показывает, что выбор видеокарты перестает быть единственной проблемой.

Длинные контексты нарушают это правило. KV cache растет линейно вместе с длиной контекста, и при 128k токенов он может превысить размер самих весов модели. Если вы планируете использовать длинные контексты, рассчитывайте объем памяти прежде всего под кэш и проверяйте, поддерживает ли ваш движок квантование кэша.

Проверка аппаратного обеспечения

На инстансе с GPU прежде всего убедитесь, что драйвер распознает видеокарту.

nvidia-smi

Вы должны увидеть таблицу с названием GPU, версией драйвера и объемом используемой памяти относительно общего объема. Ошибка NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver означает, что драйвер отсутствует или модуль ядра не был пересобран после обновления ядра. В стандартном образе Ubuntu проблему обычно решает команда sudo apt install -y ubuntu-drivers-common && sudo ubuntu-drivers install, после которой требуется перезагрузка для загрузки нового модуля.

Для контейнеров одного драйвера недостаточно. Docker требует NVIDIA Container Toolkit для проброса устройства.

sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Затем проверьте, работает ли проброс изнутри контейнера:

sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smi

Должна отобразиться та же таблица. Ошибка docker: Error response from daemon: could not select device driver, указывающая на невозможность удовлетворить требования GPU, означает, что инструментарий установлен, но Docker не был перенастроен или перезапущен. В этом случае повторно выполните команду nvidia-ctk и перезапустите службу. В Compose эквивалентом является запись deploy.resources.reservations.devices, где driver имеет значение nvidia, а список возможностей содержит gpu; это встраивается в обычные определения сервисов, описанные в Docker Compose на VPS.

Замеряйте показатели перед обновлением

Запустите модель, которую планируете использовать, на текущем процессоре и зафиксируйте результаты. При работе с Ollama self-hosting an LLM on a VPS для этого достаточно одного флага:

ollama run llama3.1:8b --verbose "Summarise the causes of the 1929 crash in 200 words."

Вывод завершается временными показателями. eval rate — это скорость генерации в токенах в секунду. prompt eval rate показывает, как быстро машина обработала ваш ввод. Эти два числа подсказывают, какое обновление поможет: низкий показатель eval rate указывает на проблему с пропускной способностью памяти, а низкий prompt eval rate на длинных входных данных — на проблему вычислительной мощности.

Если на машине есть GPU, убедитесь, что модель действительно загружена в видеопамять:

ollama ps

В столбце PROCESSOR должно быть значение 100% GPU, если всё поместилось, или что-то вроде 43%/57% CPU/GPU, если нет. Частичное распределение модели обычно работает хуже, чем ожидается, так как каждый токен всё равно ожидает завершения обработки на медленной части системы.

Вопрос стоимости

GPU-инстансы стоят в несколько раз дороже сопоставимых CPU-инстансов, при этом оплата взимается за каждый час работы, а не за количество сгенерированных токенов. Постоянно работающий GPU, который обрабатывает лишь несколько запросов в день — это самый дорогой способ запуска инференса. Точка безубыточности зависит от утилизации: загруженный GPU обходится дешево в пересчете на токен, а простаивающий — это прямые убытки.

Существуют три эффективные стратегии. Постоянную нагрузку с низким объемом запросов лучше оставить на CPU VPS. Редкие сложные запросы стоит отправлять через API с оплатой за токены. GPU следует арендовать почасово для пакетной обработки, дообучения (fine-tuning) или массового создания эмбеддингов, после чего инстанс нужно удалять. Комбинирование этих подходов — нормальная практика. Дисциплина бюджетирования, описанная в контроле расходов на AI-агентов при работе на постоянном VPS, применима и здесь, с той разницей, что основным источником потерь является время простоя, а не количество токенов.

Что по-прежнему хорошо работает без GPU

Эмбеддинги при небольших объемах данных. Небольшая модель эмбеддингов обрабатывает сотни коротких документов в минуту на нескольких ядрах CPU, а индекс, который вы строите один раз, не требует высокой скорости.

Модели Whisper small и base для транскрибации. Faster-whisper на CPU выполняет транскрибацию почти в реальном времени для модели small, чего достаточно для конвейера, работающего в ночное время.

Квантованные чат-модели размером примерно до 27B для одного или двух пользователей. Медленно, но текст читаем и пригоден для использования.

Любые задачи, которые можно назвать пакетной обработкой (batch job). Если никто не смотрит на экран, время выполнения — это лишь вопрос планирования, а не жесткое требование.

Что действительно требует GPU: обучение или дообучение (fine-tuning) моделей (за исключением небольших адаптеров), обслуживание большого количества одновременных пользователей, генерация изображений и видео, а также распознавание речи в реальном времени, где задержка напрямую влияет на качество продукта.

FAQ

Сколько видеопамяти (VRAM) нужно для модели 7B или 8B?

Около 6 GB для 4-битной квантованной модели 8B при стандартном контексте от 8k до 16k. Веса занимают примерно 4.7 GB, остальное — это KV-кэш и около 1 GB накладных расходов. Карта на 12 GB оставляет достаточный запас для более длинных контекстов. Если вы планируете использовать контекст 128k, рассчитывайте размер кэша отдельно, так как он может превысить размер весов.

Можно ли запустить Ollama без GPU?

Да. Ollama автоматически переключается на CPU и требует лишь достаточно оперативной памяти для загрузки модели. Ожидайте примерно от 5 до 12 токенов в секунду для 4-битной модели 8B в зависимости от скорости памяти, что близко к скорости чтения для одного пользователя. Длинные промпты — основная проблема при работе на CPU, так как обработка 30,000 токенов контекста ограничена вычислительной мощностью и занимает гораздо больше времени, чем генерация ответа.

Почему мой GPU работает почти так же медленно, как CPU?

Обычно это происходит из-за того, что модель не поместилась в VRAM целиком, поэтому часть слоев выполняется на CPU, и каждый токен ожидает завершения медленной части. Запустите ollama ps и проверьте, что в столбце PROCESSOR указано 100% GPU. Если отображается разделение, используйте меньшую квантованную версию или модель меньшего размера. Другая частая причина — короткий тест производительности, где время загрузки модели преобладает над временем генерации.

Стоит ли арендовать GPU VPS для одного пользователя?

Обычно нет. Один человек читает со скоростью 5–10 слов в секунду, и CPU-сервер уже генерирует токены быстрее этого для моделей размером до 13B. Случаи, оправдывающие затраты для одного пользователя: длинные промпты, генерация изображений и дообучение (fine-tuning). Обслуживание множества пользователей одновременно — самый весомый аргумент, так как пакетная обработка позволяет одному GPU отвечать на двадцать запросов почти по той же цене, что и на один.

Что лучше: арендовать GPU почасово или держать постоянно включенным?

Арендуйте почасово, если работа носит эпизодический характер: дообучение, массовая генерация эмбеддингов или пакетная транскрипция. Держите GPU постоянно включенным только в том случае, если карта загружена работой, так как оплата за GPU-инстанс взимается за факт существования, а не за количество сгенерированных токенов. Ассистент с низкой посещаемостью дешевле обходится на CPU VPS или через API с оплатой за токены, чем на простаивающем GPU.