SSD Nodes Learn Hosting plans →
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-09-15

Zanus AI или свой сервер: что выгоднее для бизнеса

Сравнение готового решения Zanus AI и самостоятельной сборки стека на базе GPU. Узнайте, когда аренда сервера оправдана и почему API часто выгоднее покупки оборудования.

Что продает Zanus AI по состоянию на сентябрь 2026 года

Zanus AI продает частный AI-сервер для бизнеса, и вопрос, стоящий за большинством поисковых запросов о нем, заключается в том, сколько стоит собрать такой же сервер самостоятельно. Краткий ответ: устройство представляет собой готовое решение без необходимости программирования (no-code), цена на которое предоставляется по запросу. Оно поставляется настроенным и может работать без подключения к интернету. Самостоятельная сборка — это арендованный GPU-сервер (графический процессор), на котором работают LLM (большие языковые модели) с открытыми весами, сервер инференса, чат-интерфейс, векторное хранилище и агентский фреймворк. Для этого нужен один специалист, умеющий работать с Linux. Выбор пути зависит от четырех факторов: кто будет заниматься технической частью, где разрешено хранить данные, есть ли возможность обеспечить питание для устройства мощностью 6 кВт и сколько токенов в день вы реально используете.

Вся информация о Zanus взята с сайта zanusai.com по состоянию на сентябрь 2026 года. Компания описывает себя как «частную американскую C-Corp, специализирующуюся на высокотехнологичных AI-решениях и инжиниринге, со штаб-квартирой в Помпано-Бич, Флорида», что, согласно их же сайту, относится к агломерации Форт-Лодердейл. Утверждается, что оборудование и программное обеспечение «разработаны и собраны в США».

Продукт состоит из трех уровней. Front Office AI — это «AI-персонал, с которым общаются ваши клиенты»: телефон, веб-чат, расчеты стоимости и бронирование. Back Office AI — это «AI-операционная система, на которой работает ваша компания», описанная как «15+ модулей. Без программирования. Встроено». Среди модулей, упомянутых на странице, — векторное хранилище, AI-чат, клиенты, поставщики, календарь, задачи, автоматизация, веб-чат-боты и API (интерфейс прикладного программирования). На вопрос «Нужен ли нам разработчик?» страница отвечает: «Нет». Третий уровень, Private On-Premises AI, — это та же система на оборудовании Zanus внутри вашего здания. Она работает под управлением «Zanus OS», продается как «полная собственность: оборудование + бессрочные лицензии на ПО» и поддерживает «air-gap» (изоляцию от сети), получая обновления через USB, если вы не подключаете устройство к интернету.

Что касается моделей, на странице сервера указано, что устройство работает с «ведущими семействами моделей с открытыми весами», которые «подбираются и масштабируются вместе с вами при конфигурации», и что вы можете «заменять или добавлять модели в любое время: новые веса загружаются через скачивание». Конкретные семейства, модели GPU, объем RAM или размер хранилища, помимо «RAID 10 NVMe», не называются. По питанию: требуется «стандартная цепь 50A при 115/220V», потребление составляет «6 кВт макс» при полной нагрузке. Страница описывает устройство как бесшумное и подходящее для офиса, не требующее серверной комнаты. По цене: стоимость устройства определяется по RFQ (запросу котировок) и «рассчитывается исходя из объема памяти GPU (модели), RAM/контекста и количества токенов в день». Публичной цены на оборудование нет. Размещенные в облаке тарифы Front Office содержат фиксированные годовые цены от 4 900 до 49 900 долларов в год по состоянию на сентябрь 2026 года, но это облачные арендаторы в дата-центре Zanus, а не само устройство. Срок поставки настроенного оборудования составляет около трех недель.

Это публичная спецификация. Ниже не приводится никакой дополнительной информации или предположений.

Как выглядит такой же частный AI-сервер при самостоятельной сборке

Устройство объединяет четыре компонента, которые вы можете арендовать и собрать самостоятельно: GPU, сервер логического вывода (inference server) для загрузки моделей с открытыми весами, чат-интерфейс для пользователей и векторное хранилище с уровнем автоматизации, который превращает ваши документы в ответы. Настройка Linux-части занимает вторую половину дня. Бизнес-модули требуют недель работы, и этот разрыв — реальное различие между двумя путями.

Сначала выберите оборудование. VPS (виртуальный выделенный сервер) только с CPU и 16–32 ГБ оперативной памяти запускает модели 7B и 8B для одного-двух пользователей одновременно со скоростью, которую следует измерить в токенах в секунду, прежде чем кто-либо начнет от нее зависеть. Арендованный GPU с 24 ГБ VRAM (памяти видеокарты) запускает модели 8B достаточно быстро для небольшой команды и вмещает модели до 30B в 4-битном квантовании; 48–80 ГБ — это класс 70B. Какие модели подходят для какой карты, разобрано в разделе какие AI-модели можно разместить самостоятельно при разном объеме памяти.

Установите сервер логического вывода. Установка Ollama в Linux выполняется одной командой, полное руководство доступно в статье запуск Ollama на VPS для хостинга LLM:

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -v

systemctl status ollama должно читаться как active (running). На машине без GPU установщик выводит WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode. и продолжает работу, что подходит для тестирования, но будет медленным для пользователей.

Загрузите модель и обратитесь к API. Сервис прослушивает порт 11434 только на адресе loopback:

ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
  -d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'

Корректный ответ представляет собой JSON-объект с полем response и "done":true. Ответ {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"} с вашими собственными двумя цифрами означает, что веса не помещаются в RAM, поэтому выберите модель поменьше или используйте более сильное квантование.

Добавьте чат-интерфейс. Open WebUI — наиболее распространенный выбор, и в его README приведена одна команда для случая, когда Ollama запущена на том же хосте:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Перейдите на порт 3000 по адресу сервера, создайте первую учетную запись (она станет администратором) и откройте список моделей. Если список пуст, причина в привязке к loopback, описанной выше: внутри контейнера host.docker.internal разрешается в адрес Docker-моста хоста, а Ollama прослушивает только 127.0.0.1, поэтому в соединении отказано. docker logs open-webui показывает Cannot connect to host host.docker.internal:11434. Исправьте это с помощью переопределения systemd:

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama

0.0.0.0 означает все интерфейсы, включая публичный. С этого момента API доступен из интернета, если только брандмауэр не блокирует порт 11434, а у самого API нет пароля, поэтому защитите эндпоинт Ollama API, прежде чем загружать первый корпоративный документ. Если Open WebUI кажется вам слишком тяжелым, существуют более легкие альтернативы Open WebUI, работающие с тем же портом.

Добавьте векторное хранилище. Qdrant запускается как отдельный контейнер. Привяжите его к loopback, так как доступ к нему должны иметь только приложения на этом же сервере:

docker run -d --name qdrant --restart always \
  -p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
  -v qdrant_storage:/qdrant/storage \
  qdrant/qdrant
curl http://127.0.0.1:6333/collections

При свежей установке проверка возвращает {"result":{"collections":[]},"status":"ok"} и поле с временем выполнения. Open WebUI имеет встроенное хранилище документов, которого достаточно для небольшой библиотеки; Qdrant нужен, когда фреймворку агентов требуется напрямую запрашивать эмбеддинги.

Если сервером будет пользоваться более нескольких человек одновременно, замените Ollama на vLLM, который пакетно обрабатывает запросы пользователей на GPU. Официальный образ содержит всё необходимое для установки:

docker run -d --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 127.0.0.1:8000:8000 --ipc=host \
  vllm/vllm-openai:latest --model Qwen/Qwen3-8B

Если Docker отвечает, что could not select device driver с возможностями GPU, значит, NVIDIA Container Toolkit не установлен, и Docker не может передать карту контейнеру. Установите toolkit, перезапустите Docker и выполните команду снова. Когда какой сервер предпочесть, описано в Ollama против vLLM.

Последний уровень — это то, что в готовых решениях называют модулями. На пути аренды это фреймворк агентов, который считывает данные из векторного хранилища, вызывает модель, выполняет действия в других ваших системах и ведет журнал операций. Кандидаты и их особенности сравниваются в статье лучшие AI-агенты для самостоятельного хостинга, а если агенту нужно запоминать пользователей между сессиями, сервер памяти Mem0 для самостоятельного хостинга предоставит такую возможность. Ничего из этого не существует, пока вы не настроите это сами, и именно за эту часть работы вы фактически платите при покупке готового устройства.

Стоимость: коммерческое предложение против ежемесячного счета

Здесь нет номера Zanus, и выдумывать его было бы бесполезно. Сайт указывает, как рассчитывается стоимость предложения: на основе объема видеопамяти GPU для моделей, оперативной памяти для контекста и количества токенов в день. Это те же переменные, которые определяют цену арендованного пути, поэтому вы можете хотя бы честно провести сравнение со своей стороны.

В случае с арендой стоимость представляет собой фиксированную ежемесячную плату за GPU плюс оплату времени специалиста, который его обслуживает. Арендная плата не меняется независимо от того, простаивает карта или работает на пределе возможностей. Это превращает сравнение с API, работающим по модели оплаты за токены, в задачу поиска точки безубыточности: разделите ежемесячную арендную плату на среднюю цену за миллион токенов API, который вы бы использовали в противном случае. Результат — это количество токенов в месяц, которое вы должны пропустить через систему, чтобы владение GPU стало выгоднее аренды токенов. При меньшем объеме API выигрывает по деньгам. Расчеты с учетом нюансов простоя и размера пакетов приведены в GPU VPS против API токенов: где находится точка безубыточности.

В случае с готовым устройством ситуация иная: это капитальные вложения, бессрочная лицензия на программное обеспечение, затраты на электроэнергию и тот же расчет токенов в день, выполненный для вас при составлении сметы. Предложение, рассчитанное под текущий объем, также является пределом возможностей. Рост нагрузки сверх этого лимита потребует нового коммерческого предложения, в то время как для арендованного GPU достаточно просто сменить тарифный план.

Кто занимается технической реализацией

Основной аргумент в пользу готового устройства заключается в том, что никто этим не занимается. Фразы «Никакого программирования. Всё встроено» и «Нужен ли нам разработчик? Нет» — это суть предложения. Вам всё равно придётся внедрять изменения в бизнес-процессы, так как сотрудникам нужно освоить новые инструменты, а кому-то — загрузить базу знаний и настроить голосовое меню, но при этом никому не нужно знать, что такое systemd unit.

Арендуемый путь требует наличия одного человека, который может самостоятельно выполнить все приведённые выше команды и поддерживать систему в рабочем состоянии. Конкретно этот человек отвечает за обновления операционной системы, Docker-образы, межсетевой экран и TLS (transport layer security) сертификаты, резервное копирование векторного хранилища и истории чатов, обновление моделей, а также за мониторинг, который оповестит его о том, что драйвер GPU перестал работать после обновления ядра. Заложите один день на первичную установку и несколько часов в месяц на последующее обслуживание. Затем учтите реальный объём работы: ни одно решение на арендуемом пути не поставляется с готовой таблицей клиентов, списком поставщиков, календарём или процессом бронирования. Каждая из этих функций — это интеграция, которую вы пишете для своих существующих систем, либо агентская среда, которую вы настраиваете, а затем отлаживаете, когда она начинает вести себя странно. Если в штате нет желающих взять на себя эту работу, ответ «разработчик не нужен» стоит дороже любых характеристик оборудования.

Где хранятся данные

Главное преимущество устройства — его физическое расположение. Фразы «ваши данные никогда не покидают устройство» и «данные физически остаются в вашем здании» описывают машину, которую можно отключить от сети и продолжать использовать. Для клиники или юридической фирмы, чей договор требует локального хранения данных, это решающий фактор, с которым не сравнится ни один VPS.

Скажем прямо о варианте с арендой: VPS — это компьютер в чужом дата-центре. Ваши запросы, документы, ответы модели и векторный индекс обрабатываются в оперативной памяти на хосте, принадлежащем провайдеру, и хранятся на диске, к которому у провайдера есть физический доступ. «Приватный ИИ» на VPS означает лишь приватность от разработчика модели и публичного интернета, не более того. Ваш хостинг-провайдер по-прежнему имеет доступ к данным, а клиент или аудитор на вопрос о месте их хранения получит название города, а не номер комнаты в вашем здании. Шифрование данных в состоянии покоя защищает диск в случае его изъятия. Оно не защищает то, что находится в оперативной памяти в момент генерации ответа моделью.

Промежуточный вариант — собственное оборудование в арендованной стойке или выделенный сервер, который вы ни с кем не делите. Это сохраняет гибкость моделей и ежемесячную оплату арендованного пути, при этом устраняя большую часть физических рисков. Однако это возвращает задачу, которую решает устройство: кто-то должен собрать и настроить этот сервер.

Питание и пространство

Машина мощностью 6 кВт — это не офисный ПК. Стандартная настенная розетка в США рассчитана на цепь 15 А или 20 А; для данного устройства требуется цепь 50 А, которую обычно используют электрические плиты или быстрые зарядные устройства для электромобилей, поэтому для установки потребуется электрик. На сайте указано, что устройство работает бесшумно, подходит для офиса и потребляет пиковую мощность только во время работы. Потребление в режиме простоя не публикуется.

Электроэнергия — это единственная эксплуатационная статья расходов, которую можно точно рассчитать, так как это простая арифметика. При мощности 6 кВт каждый час работы при полной нагрузке составляет 6 кВт⋅ч:

ChartElectricity for a 6 kW appliance by daily full-load hours, at 0.15 USD per kWh
The data behind this chart
[
  {
    "label": "1 h/day at full load",
    "kwh_per_month": 180,
    "cost_usd_month": 27
  },
  {
    "label": "4 h/day at full load",
    "kwh_per_month": 720,
    "cost_usd_month": 108
  },
  {
    "label": "8 h/day at full load",
    "kwh_per_month": 1440,
    "cost_usd_month": 216
  },
  {
    "label": "24 h/day at full load",
    "kwh_per_month": "4,320",
    "cost_usd_month": 648
  }
]

Устройство, работающее один час в день, обходится примерно в 27 USD в месяц при тарифе 0.15 USD за кВт⋅ч. Устройство, работающее круглосуточно на полной мощности, потребляет 4,320 кВт⋅ч и обходится примерно в 648 USD. Собственная оценка поставщика составляет «примерно 1 доллар в час» при полной нагрузке, что подразумевает несколько более высокий тариф, чем предполагает расчет, поэтому используйте свои собственные показатели. Вся эта энергия покидает машину в виде тепла — примерно 20 000 BTU (британских тепловых единиц) в час на пике, которые должна отводить система кондиционирования помещения.

При аренде оборудования расходы на электроэнергию и охлаждение включены в стоимость аренды, а дата-центр провайдера берет на себя обеспечение соответствующей электрической цепи. Минус в том, что вы не видите счетчик: стоимость плана с GPU одинакова независимо от того, работает он один час в день или 24 часа.

Выбор модели

Устройство поставляется с моделями, выбранными вами при настройке из «ведущих семейств с открытыми весами», а на странице указано, что новые веса загружаются отдельно. Какие именно семейства поддерживаются, как выполняется замена внутри Zanus OS, можно ли загрузить модель вне списка поставщика и кто именно выполняет замену — публично не задокументировано, поэтому уточняйте эти детали до подписания договора.

Арендованный вариант позволяет запускать любые модели с опубликованными весами, если объема памяти достаточно для их размещения. Новый релиз с открытыми весами — это ollama pull или имя репозитория Hugging Face, передаваемое в vLLM в день выхода. Если вам требуется специфическая квантованная версия или собственная дообученная модель, вы самостоятельно импортируете GGUF-файл в Ollama. Обратная сторона этого подхода: вы также самостоятельно отвечаете за оценку качества. Никто не подбирал размер модели под ваши документы или количество токенов в день, поэтому первый месяц уйдет на определение того, какая модель обеспечивает достаточную точность при приемлемой скорости, и какую квантованную версию позволяет использовать ваш объем памяти.

Частный сервис ответов на базе ИИ: модуль против отдельного проекта

Значительная часть трафика к «частному ИИ-серверу» на самом деле направлена на поиск телефонного секретаря, поэтому этот сценарий следует рассматривать отдельно.

В экосистеме Zanus за телефонного агента отвечает Front Office AI. На странице указано, что он «отвечает на каждый звонок в вашем меню, выбранными вами голосами, 24/7 на 40 языках» с использованием IVR-меню (интерактивного голосового меню), которое вы составляете сами. Продукт продается как размещаемый арендный сервис (hosted tenant) с возможностью локального развертывания (on-premises) в рамках максимального тарифного плана. Какие именно речевые модели используются и какова задержка ответа, не публикуется.

При самостоятельном развертывании голосовой агент представляет собой отдельный проект, более сложный, чем стек чат-бота, описанный выше. Для него требуются четыре дополнительных компонента: точка входа для телефонии (SIP-транк, где SIP — это протокол инициации сеанса, либо API телефонии, передающий аудиопоток), система распознавания речи (STT), LLM и система синтеза речи (TTS). Все они должны быть связаны в цепочку так, чтобы вызывающий абонент слышал ответ примерно через секунду после завершения фразы. Каждое звено добавляет задержку, поэтому модели должны быть компактными, а GPU — находиться максимально близко. Информация о компонентах STT и TTS, движках для локального запуска и их производительности приведена в самостоятельном развертывании STT и TTS на VPS. Будьте готовы к тому, что голосовой агент потребует больше ресурсов, чем весь стек чат-бота, а первая версия будет перебивать собеседника. Если ваша единственная цель — секретарь, то использование модуля готового устройства или облачного голосового продукта будет более коротким путем, а чат-сервер в данном случае — лишь отвлекающий фактор.

Правило принятия решения

Приобретайте оборудование, если выполняются все четыре условия: контракт или регулятор требуют хранения данных внутри периметра, в штате нет специалистов по Linux, у вас есть или будет установлена цепь питания на 50 A, а модули на странице соответствуют вашим реальным задачам. Цена предложения — это стоимость отсутствия инженера в штате. Перед подписанием договора получите в письменном виде список моделей и процедуру их замены.

Арендуйте и собирайте систему самостоятельно, если сервер может обслуживать один человек, данные могут находиться у проверенного вами хостинг-провайдера, вы хотите самостоятельно выбирать модель, а нагрузка достаточно стабильна, чтобы ежемесячная аренда GPU была выгоднее оплаты токенов при достижении точки безубыточности, указанной выше. Вы получаете доступ к любой модели с открытыми весами в день её релиза и счёт, который можно изменить в следующем месяце. При этом все интеграции вам придётся выполнять самостоятельно.

Используйте API, если нагрузка носит скачкообразный или небольшой характер, данные не являются конфиденциальными, никто не хочет заниматься обслуживанием инфраструктуры, а решение нужно внедрить на этой неделе. При объёмах ниже точки безубыточности этот вариант дешевле, а запуск всегда происходит быстрее. В дальнейшем можно добавить уровень self-hosted, если расходы на токены или политика работы с данными потребуют перехода на него.

FAQ

Что именно продает Zanus AI?

По состоянию на сентябрь 2026 года сайт zanusai.com описывает три уровня продуктов. Front Office AI обрабатывает телефонные звонки, веб-чаты, коммерческие предложения и бронирования. Back Office AI — это «более 15 модулей. Без программирования. Встроено». Private On-Premises AI — это то же самое программное обеспечение на оборудовании Zanus под управлением Zanus OS, которое устанавливается в вашем помещении, продается в полную собственность и поддерживает работу в изолированной сети (air-gap). Цена оборудования определяется по запросу (RFQ). Оно требует выделенной линии на 50 A и потребляет до 6 кВт. Штаб-квартира компании находится в Помпано-Бич, штат Флорида.

Сколько стоит частный сервер Zanus AI?

Публичной цены на оборудование нет. На странице сервера указано «Цена по запросу» (Price by RFQ), которая зависит от объема видеопамяти (GPU memory), оперативной памяти (RAM) и количества токенов в день. Облачные тарифы Front Office имеют фиксированную годовую стоимость на сентябрь 2026 года, но они работают в дата-центре Zanus и являются подпиской, поэтому не отражают стоимость «коробочного» решения. Для сравнения оцените стоимость арендованного варианта с теми же переменными и рассчитайте точку окупаемости относительно стоимости API-токенов.

Можно ли собрать частный AI-сервер на VPS без GPU?

Да, для небольшого числа пользователей и небольших моделей. VPS только с CPU и объемом RAM от 16 ГБ до 32 ГБ позволяет запускать модели 7B и 8B через Ollama со скоростью несколько токенов в секунду, чего достаточно для тестирования помощника по работе с документами. Этого недостаточно для одновременной работы команды или для голосового агента, где критически важно время отклика. Измерьте количество токенов в секунду на вашем тарифе, прежде чем делать его доступным для пользователей.

Является ли self-hosted LLM на VPS действительно приватным?

Решение является приватным по отношению к поставщику модели и публичному интернету, при условии, что файрвол блокирует порт 11434, а интерфейс чата защищен TLS. Исключением является хостинг-провайдер: его сотрудники имеют доступ к диску, а хост-система исполняет модель в оперативной памяти. Если контракт требует, чтобы данные оставались в пределах вашего здания, VPS не подходит. Для этого требуется собственное оборудование, размещенное в вашем офисе или в арендованной стойке.

Включает ли самостоятельная сборка (DIY) функции телефонного секретаря?

Нет, не «из коробки». Голосовой агент — это отдельный проект: точка входа для телефонии, преобразование речи в текст (speech-to-text), LLM и преобразование текста в речь (text-to-speech), объединенные в цепочку с такой задержкой, чтобы вызывающий абонент слышал ответ примерно через секунду. Это самая сложная часть арендованного пути, и именно здесь модуль готового устройства или облачный голосовой продукт экономят больше всего времени.

#zanus#private-ai#self-hosted-llm#ollama#gpu#ai-appliance