AI-агент, LLM и AI-ассистент: в чём разница
LLM требует RAM для весов, ассистент добавляет чат и историю, а агент использует инструменты и учётные данные, поэтому нужен постоянно включённый сервер.
В чём разница между AI-агентом, LLM и AI-ассистентом?
AI-агент, LLM и AI-ассистент — это три уровня одного стека. Отличить их можно по тому, что каждому из них требуется от сервера. LLM (большая языковая модель) — это файл с весами, которому нужны RAM и вычислительные ресурсы. Ассистент — это модель, встроенная в интерфейс чата, с учётной записью и сохранённой историей. Почти всегда он работает на чужом оборудовании. Агент — это ассистент, у которого также есть инструменты и цикл выполнения задач. Он хранит учётные данные, поэтому его приходится размещать на машине, которая постоянно включена.
Большинство материалов на эту тему ограничиваются определениями. Определения важны только потому, что каждый уровень требует разных затрат. Первый требует RAM. Следующий — публичный URL и TLS (защита транспортного уровня). Последний — учётные данные. Если агент использовал учётные данные, их теперь необходимо заменить.
LLM — это веса, а весам нужна RAM
LLM — это файл с числами. Вы скачиваете его, runtime загружает его в память, после чего модель отвечает на один запрос за раз. Контракт узкий: на вход подаётся текст, на выходе получается текст. У модели нет памяти между вызовами, часов, доступа к сети и возможности открыть файл. Всё, что LLM как будто помнит, программа, которая вызывает модель, добавляет в её контекст.
Размер этого файла определяет тариф VPS, потому что во время работы модели он целиком находится в памяти. При 4-битной квантизации, которую Ollama использует по умолчанию, рассчитывайте примерно на 0.6 GB на каждый миллиард параметров. Дополнительно потребуется ещё 1–2 GB для контекстного окна и самого runtime.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]Сборка qwen3:8b занимает 5.2 GB на диске и требует около 8 GB RAM для работы без обращения к swap. VPS с 4 GB не загрузит qwen3:14b: до ввода первого слова он занимает 9.3 GB. Самая большая строка здесь, qwen3:32b, требует около 24 GB. В большинстве прайс-листов это уже другой тариф и другой ежемесячный платёж.
Поместить модель в память — один вопрос. Скорость — другой. На VPS только с CPU узким местом обычно становится пропускная способность памяти, а не тактовая частота. Поэтому даже подходящая по размеру модель может отвечать со скоростью несколько токенов в секунду. Для задачи, которая выполняется всю ночь, это нормально. Для чата такая скорость неудобна. GPU увеличивает этот показатель примерно на порядок, но также увеличивает стоимость. Поэтому принимайте решение по результатам измерений: проверьте VPS на рабочей нагрузке, которую планируете запускать и ознакомьтесь с материалом когда VPS с GPU оправдывает свою стоимость. Чтобы вообще запустить модель с этими весами, начните с инструкции Ollama на собственном VPS.
Ассистент — это LLM и интерфейс чата
Ассистент — это прикладной слой вокруг модели. ChatGPT и Claude — ассистенты: модель, окно чата, учётная запись, сохранённые диалоги и ограничение частоты запросов. Почти ничего из этого не работает на оборудовании под вашим управлением. Поэтому hosted assistant требует подписки и почти не использует RAM.
В self-hosted варианте используется front end, например Open WebUI, подключённый к локальному Ollama или hosted API. Front end — это небольшое программное обеспечение. Для интерфейса чата потребуется около 1 GB resident memory сверх объёма, необходимого модели. Но bare model не требуется public URL и сертификат. Ассистенту они нужны, если вы хотите обращаться к нему с телефона: выпустите сертификат с помощью Certbot и Nginx или завершайте TLS на Traefik перед несколькими приложениями. Если вы ещё выбираете front end, сравните альтернативы Open WebUI.
Ассистент отвечает. Он не выполняет действия. Когда он формирует shell-команду, человек читает её и решает, вставлять ли её в терминал. Этот человек является уровнем безопасности, а agent — это компонент, который его устраняет.
Агент добавляет инструменты и цикл
Агент — это помощник, который может вызывать функции и затем читать результаты. Работу выполняют две части. Первая часть — инструмент: описание функции, которую может запросить модель, и ваш код, который фактически её запускает. Вторая часть — цикл: программа вызывает модель, модель запрашивает инструмент, программа запускает его, добавляет результат в контекст и снова вызывает модель. Это повторяется, пока модель не сообщит о завершении или пока не будет достигнут установленный предел.
Цикл представляет собой обычный код. Базовая реализация занимает менее ста строк. Агентом его делает наличие у инструментов реальных учётных данных: благодаря этому цикл может изменять что-либо за пределами самого себя. Именно это определяет все последующие решения по размещению. Навыки агента и серверы MCP (model context protocol) позволяют предоставить агенту дополнительные инструменты без переписывания цикла.
- Он работает дольше вашего сеанса. Чат завершается после закрытия вкладки. Запуск агента может длиться двадцать минут и должен продолжаться, даже если ноутбук перейдёт в спящий режим. Поэтому агент следует размещать на постоянно включённом сервере и запускать через сервис или таймер systemd, который восстановит его работу после перезагрузки.
- Он хранит секреты. Это может быть API key, SSH key или пароль базы данных. Любые данные, которые агент способен прочитать, скрытая во входных данных вредоносная инструкция может заставить его использовать. Поэтому нужно хранить секреты вне доступа агента.
- Его стоимость растёт вместе с количеством итераций цикла, а не с размером вашего вопроса. На каждом шаге весь диалог снова передаётся во входных данных, поэтому запуск из десяти шагов оплачивает эту расшифровку десять раз. Поэтому входные токены формируют основную часть затрат на агента и необходимо установить жёсткий предел расходов на один запуск.
- Он может ошибиться так, что результатом станет изменение данных. Неправильный ответ в чате требует повторной проверки. Неправильная команда удаления внутри цикла может удалить каталог. Запускайте агент от имени пользователя с минимальными правами, достаточными для его работы, а для агентов программирования сначала используйте sandbox, прежде чем предоставлять доступ к репозиторию.
Что требуется каждому уровню от сервера
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]Внимательно изучите столбец RAM: в нём не учитывается модель. Frontend чата и runtime агента — небольшие программы. Если агент вызывает hosted model, для её работы достаточно 2 GB RAM, и дешёвого тарифа действительно достаточно, а не только в качестве компромисса. Если разместить веса на том же сервере, строка модели объёмом 8 GB будет определять требования сильнее всего остального.
Остальные столбцы важнее, чем обычно ожидают. Только уровень модели ускоряется с помощью GPU. Только уровню assistant по умолчанию требуется публичный URL, поскольку браузер должен обращаться к нему. Агенту URL нужен лишь тогда, когда подключаться к нему должен внешний компонент, например через webhook. Кроме того, агент хранит several учётных данных. Именно это отличает его от окна чата. Окно чата может ошибаться. Агент может ошибиться и затем выполнить действие на основе этой ошибки.
Нужен ли GPU для запуска AI-агента?
Нет, если только вы не размещаете веса модели на том же компьютере. Цикл работы агента состоит из HTTP-запросов, разбора JSON и вызовов subprocess. В ожидании сетевых ответов CPU почти не загружен. Поэтому вопрос о GPU на самом деле сводится к вопросу об уровне LLM.
Сначала разделите эти решения. Если текст не должен покидать ваш сервер, выделите средства на память для хранения модели и, для приемлемой скорости, на GPU для её запуска. Если вам нужна только автоматизация, оплачивайте модель по числу токенов, а сэкономленные средства направьте на обеспечение доступности и резервное копирование. В 2026 большинство self-hosted-агентов обращаются к hosted-модели, поэтому их эксплуатация обходится дешевле.
Можно ли самостоятельно разместить AI agent?
Да. AI agent — наиболее целесообразный компонент для самостоятельного размещения, поскольку именно в его цикле работы хранятся ваши данные и учётные данные. Небольшой VPS с 2 GB оперативной памяти, менеджером сервисов и исходящим сетевым доступом запускает полноценный agent. Выберите самостоятельную сборку на VPS, если хотите управлять циклом работы самостоятельно, или разверните один из готовых self-hosted agents, если предпочитаете начать с уже подготовленного решения.
Самостоятельно разместить assistant несложно: для этого нужны один контейнер и сертификат. Самостоятельное размещение model — самая затратная часть. От этого часто отказываются, увидев, как токены медленно обрабатываются на CPU. Размещайте weights самостоятельно, если данные нельзя передавать за пределы сервера или если объём использования делает оплату за каждый токен слишком дорогой. В остальных случаях пусть agent обращается к API, а наиболее важные компоненты остаются локальными.
Является ли ChatGPT AI-агентом?
Чат-продукт становится агентом в тот момент, когда он может вызвать инструмент и обработать результат без предварительного запроса к вам. По этому критерию размещённые сервисом ассистенты с функциями просмотра веб-страниц, выполнения кода или подключения к внешним системам являются агентами. Для вас важно, где выполняется этот цикл и чьи учётные данные он использует. В размещённом сервисом продукте и цикл, и учётные данные принадлежат поставщику. На собственном сервере и цикл, и учётные данные принадлежат вам. Вместе с этим на вас возлагается ответственность за все действия цикла, в том числе выполняемые глубокой ночью.
Реактивные, планирующие и мультиагентные системы
В обзорах часто перечисляют семь типов агентов. Большинство таких типов относятся к маркетингу. Два различия влияют на код, который вы пишете, а одно — на стоимость. Реактивный агент вызывает инструмент, читает ответ и формирует результат. Планирующий агент сначала составляет план, а затем выполняет его по шагам. Такой подход лучше работает для длительных задач, но требует больше токенов, потому что план повторно передаётся на каждом шаге. Мультиагентная система позволяет одному агенту запускать других агентов. При этом одновременно увеличиваются расход токенов и количество возможных отказов. Поэтому такой подход оправдан только тогда, когда подзадачи действительно независимы, например при одновременном поиске по четырём источникам. Начните с реактивного подхода. Добавьте планирование, когда задачи станут длительными. К мультиагентной архитектуре переходите в последнюю очередь. Для более полного обзора см. что стоит изучить об AI-агентах в 2026 году.
Как определить, какой слой фактически запущен
На сервере проверьте, какие процессы занимают память.
free -h
ps -eo rss,comm --sort=-rss | head -5Если в верхней строке указано, что ollama или llama-server занимает несколько гигабайт RSS (resident set size, фактически занятый процессом объём памяти), вы размещаете модель. Если ни один процесс не занимает больше нескольких сотен мегабайт, а расходы на API продолжают расти, вы размещаете агента или ассистента и арендуете модель. Если этот список пуст, потому что всё выполняется во вкладке браузера, вы пользуетесь ассистентом. Это нормально, пока вам не понадобится программное обеспечение, которое действует от вашего имени.
Что вы хотите запустить?
- Чтобы сохранить текст в закрытом контуре, запустите модель: разверните LLM самостоятельно с Ollama, а затем сравните производительность через Ollama и vLLM, когда один пользователь превратится в десять.
- Чтобы самостоятельно управлять циклом работы и инструментами, соберите агента: создайте собственного AI-агента на VPS.
- Чтобы получить работающий результат уже сегодня вечером, разверните готовый вариант из списка self-hosted-агентов, которые стоит запустить.
- Если под этим ещё нет сервера, начните с материала что именно даёт VPS.
FAQ
Является ли AI-агент просто LLM с дополнительными этапами?
Дополнительные этапы и составляют продукт. LLM преобразует текст в текст и больше ничего не делает. Агент предоставляет модели инструменты, которые она может вызывать, и цикл, в котором эти вызовы продолжаются. Инструменты используют учётные данные, поэтому результат может изменить файл, базу данных или работающий сервис. Поэтому агенту нужны постоянно включённая машина, менеджер сервисов и политика управления секретами. LLM достаточно памяти для хранения весов во время формирования ответа.
Нужен ли GPU для запуска AI-агента?
Для самого агента GPU не нужен. Цикл агента выполняет HTTP-запросы, обрабатывает JSON и запускает subprocess. С этим справляется любой CPU, пока агент ожидает ответов по сети. GPU нужен только в том случае, если вы самостоятельно размещаете веса модели и хотите получать от неё больше нескольких токенов в секунду. Агент, который обращается к hosted model, стабильно работает на небольшом VPS без GPU.
Сколько RAM нужно VPS для AI-агента?
Около 2 GB, если агент обращается к hosted model. В этом случае он хранит только runtime, его зависимости и небольшую локальную базу данных. Если вы размещаете веса самостоятельно, добавьте модель к этому объёму: один только qwen3:8b требует около 8 GB. Поэтому конфигурация all-in-one начинается с этого значения и увеличивается в зависимости от выбранной модели.
Можно ли самостоятельно разместить AI-ассистента и сохранить конфиденциальность разговоров?
Да, но есть одно критически важное условие. Self-hosted frontend, например Open WebUI, хранит учётные записи и историю на вашем сервере. Сами разговоры остаются конфиденциальными только в том случае, если модель за ним также работает локально. Если направить тот же frontend к hosted API, текст каждого сообщения всё равно покидает ваш сервер. В таком случае вы сохраняете историю, но не конфиденциальность.
В чём разница между AI-агентом и chatbot?
Chatbot отвечает и останавливается. Агент решает, что делать дальше, вызывает инструмент, читает результат и снова принимает решение, пока задача не будет выполнена или ограничение не остановит его. Практический критерий такой: если программное обеспечение может что-либо изменить без нажатия человеком кнопки между ответом и действием, это агент. Ему нужны соответствующая инфраструктура размещения и защитные ограничения.