Типы AI-агентов: классификация и архитектура
Узнайте различия между простыми рефлексивными, целеориентированными и обучающимися AI-агентами. Разбираем архитектурные особенности каждого типа и возможности их локального запуска.
Типы AI-агентов
Типы AI-агентов классифицируются по одной таксономии: простые рефлексивные, рефлексивные на основе моделей, целеориентированные, основанные на полезности и обучающиеся агенты. Каждое название описывает один аспект: объем памяти агента и глубину планирования перед выполнением действия. Еще два термина, мультиагентные и иерархические, описывают способы взаимодействия нескольких агентов, а не принципы принятия решений отдельным агентом.
Этот список старше любой модели, которую вы использовали. Он взят из стандартного учебника по AI и сохранил актуальность после появления больших языковых моделей, так как ставит вопрос, определяющий проектирование: что именно агент должен знать перед выполнением действия? Если вы еще не определились, где заканчивается агент и начинается чат-ассистент, сначала прочитайте разницу между AI-агентом и LLM, на которой он работает. Эта страница продолжает тему после указанной границы.
Простые рефлексивные агенты: одно условие, одно действие
Простой рефлексивный агент сопоставляет текущие входные данные с действием и не сохраняет историю предыдущих событий. Если температура выше 25, включить вентилятор. Это весь механизм работы.
Вы почти наверняка запускали такой агент. Вебхук, который запускает рабочий процесс n8n, считывающий данные из формы и записывающий строку в базу данных, является простым рефлексивным агентом. Он остается таковым, даже если в процессе участвует языковая модель, определяющая категорию для этой строки. Спросите его, что он делал час назад, и он не сможет ответить, так как нигде не сохранилось никаких данных.
Этот тип агентов оказывается эффективным чаще, чем принято считать. Он дешев в эксплуатации, а причины его сбоев легко отследить: условие либо выполнилось, либо нет. Когда задача звучит как «при получении X сделать Y», наличие памяти лишь создает дополнительные возможности для ошибок, не принося никакой пользы. Агент n8n, запускаемый вебхуком — это пример данной категории с пользовательским интерфейсом поверх логики.
Агент перестает работать, как только правильное действие начинает зависеть от истории. Бот для ответов без поддержки состояния диалога будет противоречить сам себе на третьем сообщении, так как первые два сообщения никогда не были частью его входных данных.
Агенты с моделью состояния: сохранение данных между событиями
Агент с моделью состояния хранит внутреннее представление среды и обновляет его при поступлении новых входных данных. Слово «модель» здесь означает модель мира, а не нейронную сеть. Этот термин появился примерно за сорок лет до того, как стал ассоциироваться с нейросетями, поэтому он почти всех сбивает с толку при первом прочтении.
Правило домашней автоматизации, которое выключает свет через 20 минут при отсутствии движения, является примером работы с моделью состояния. Иначе и быть не может. Для простого рефлексивного агента «нет движения сейчас» и «нет движения с 21:40» — это идентичные входные данные, поэтому только сохраненное состояние позволяет их различить.
Версия для LLM — это любой агент, за которым закреплено хранилище памяти: сводка текущего диалога или обычный markdown-файл, который агент считывает перед каждым запуском. Локальная служба памяти для агента — это реализация данной концепции. Механизм остается прежним. Представление агента о мире существует дольше, чем событие, которое его сформировало.
У состояния есть своя цена. Устаревший факт хуже, чем отсутствие данных, так как агент будет действовать на его основе с полной уверенностью и без предупреждений. Любые хранимые данные должны иметь механизм истечения срока действия или способ повторной проверки, иначе агент продолжит строить логические выводы о сервере, который вы вывели из эксплуатации еще в марте.
Агенты на основе целей: планирование с проверкой состояния
Агент на основе целей получает целевое состояние и ищет последовательность действий для его достижения. Он работает в обратном направлении от конечной точки, поэтому путь не задается заранее.
Агент для написания кода — самый наглядный пример, который вы можете запустить самостоятельно. Инструкция «сделай так, чтобы упавший тест прошел» не содержит имен файлов или конкретных шагов. Агент читает тест, формирует план, вносит правки, запускает тест, анализирует ошибку и повторяет попытку. Цикл завершается проверкой, которую агент может выполнить физически; именно поэтому данная инструкция работает, а «улучши этот код» — нет. Цель, которую агент может оценить, — это цель, которую агент может достичь. Цель, которую он не может оценить, превращается в бесконечный цикл с выставленным счетом. Запуск агента для написания кода на собственном VPS позволяет перенести этот цикл туда, где он может работать, не занимая ресурсы вашего ноутбука.
Стоимость зависит от количества итераций. Каждый шаг планирования — это новый вызов модели, передающий всю накопленную историю, поэтому задача из десяти шагов стоит дороже, чем десять отдельных запросов. Важнейшим инженерным аспектом является структура цикла и условие его завершения, что подробно рассматривается в проектировании циклов.
Агенты на основе полезности: выбор между несколькими подходящими ответами
Цель бинарна. Полезность — это оценка. Агент на основе полезности сталкивается с несколькими приемлемыми результатами и выбирает тот, который получает наивысший балл согласно написанной вами функции.
Задача резервного копирования, которая должна завершиться до начала рабочего дня, не перегружая канал связи, — это задача на оптимизацию полезности. Здесь нет единственно верного ответа, есть только компромисс. Маршрутизатор, который решает, какая модель будет обрабатывать запрос, взвешивая цену и качество ответа, работает по тому же принципу.
Сложность заключается не в алгоритме. Сложность в написании честной функции полезности. Если оценивать только по стоимости, вы будете получать самую дешевую модель на каждом запросе, включая тот единственный запрос, для которого требовалась дорогая модель. Система оптимизирует ровно то, что вы измерили, и это становится проблемой, если критерий был выбран только из-за простоты измерения.
Обучающиеся агенты: тип, который, как полагает большинство, у них уже есть
Обучающийся агент меняет собственное поведение на основе обратной связи о прошлых результатах. Ему требуется механизм для оценки исхода и механизм для изменения политики в ответ на эту оценку.
Очень немногие self-hosted системы соответствуют этому определению. Агент, который читает заметки, сделанные им на прошлой неделе, является модельным агентом с файлом памяти. Его веса идентичны. Его политика идентична. Извлечение данных не является обучением, и это различие имеет практическое значение: система, основанная на памяти, будет повторять ошибку бесконечно, пока кто-то не отредактирует память, в то время как обучающаяся система должна перестать её совершать.
Если вам нужна обучающая составляющая, сначала создайте систему оценки. Оцениваемый набор тестов, прогон ваших изменений на нем и принятие решения о сохранении или отмене изменений — это замкнутый цикл, в котором вы выступаете в роли обучающего компонента. Это медленнее, чем кажется, но на сегодняшний день это единственный вариант, работающий для self-hosted решений. Развертывание системы оценки (eval harness) на собственном сервере — это то, с чего следует начать.
Мультиагентные и иерархические системы: способы организации, а не типы
Это не шестой и не седьмой типы систем. Они описывают способы организации агентов.
Мультиагентная система запускает несколько агентов одновременно в общей среде, например, в очереди или репозитории git. Поскольку среда общая, агенты конфликтуют между собой. Стандартная ошибка — когда два агента редактируют один файл; решение заключается в использовании блокировок или очереди задач. Никакой промпт не решит эту проблему.
Иерархическая система ставит супервизора над исполнителями. Супервизор разбивает задачу, распределяет части и объединяет полученные результаты. Этот подход популярен, так как соответствует человеческому разделению труда, но он затратен, поскольку контекст супервизора растёт с каждым прочитанным отчётом. Мультиагентная обвязка демонстрирует реализацию этого подхода на практике.
Один работающий агент лучше четырёх, которые работают лишь частично.
Каждая передача задачи — это место, где может потеряться информация. Начните с одного цикла. Разделяйте его только тогда, когда сможете чётко определить этап, являющийся «узким местом».
Почему почти любая реальная система является гибридной
Рассмотрим агент развертывания, который вы запускаете самостоятельно. Его работа начинается с вебхука — это рефлекторный механизм. Агент считывает текущее состояние релиза — это модель. Он планирует шаги перехода от текущей версии к целевой — это целеполагание. Он выбирает окно для развертывания на основе текущей нагрузки — это оценка полезности. Агент не меняет собственные правила, поэтому он не является обучаемым.
Одна система одновременно использует четыре уровня классификации. Эта классификация полезна как контрольный список при проектировании, а не как ярлык для готового продукта. Когда система работает некорректно, важно понять, какой именно уровень дал сбой. Триггер, сработавший не по тому событию; состояние, которое устарело; проверка цели, которая никогда не будет пройдена; и оценка, поощряющая неверный результат — это четыре разные ошибки, требующие четырех разных способов исправления.
Выбор типа архитектуры для конкретной задачи
- Фиксированный триггер, фиксированный отклик, история не требуется: простой рефлекс.
- Правильный отклик зависит от предыдущих событий: рефлекс на основе модели.
- Конечное состояние проверяемо, но путь к нему заранее неизвестен: целеориентированный подход.
- Несколько приемлемых результатов с необходимостью выбора между ними: подход на основе полезности.
- Требуется улучшение результатов со временем: создайте цикл оценки и примите тот факт, что вы сами являетесь обучающим компонентом.
Можно ли разместить эти агенты самостоятельно и сколько это стоит?
Да, и стоимость складывается из двух составляющих. Оркестрация обходится недорого. Экземпляр n8n или цикл агента на Python большую часть времени ожидает сетевых вызовов, поэтому ему достаточно 2 vCPU и 4 GB RAM. Основные расходы приходятся на модель.
Если агент обращается к внешнему API, серверу почти ничего не требуется, а счет зависит от количества токенов. Для агента, работающего на основе целей, это означает зависимость от количества разрешенных шагов планирования, поэтому ограничивайте цикл.
Если вы запускаете модель на собственном оборудовании, объем RAM определяет, что именно вы сможете запустить. Приведенные ниже цифры — это типичные опубликованные размеры файлов для 4-битных квантованных весов на август 2026 года, рядом с расчетным значением общего объема RAM, так как контекстному окну и среде выполнения требуется дополнительное место сверх весов модели.
The data behind this chart
[
{
"label": "3B model",
"weights_gb": 2,
"ram_needed_gb": 6
},
{
"label": "8B model",
"weights_gb": 4.9,
"ram_needed_gb": 10
},
{
"label": "14B model",
"weights_gb": 9,
"ram_needed_gb": 16
},
{
"label": "32B model",
"weights_gb": 20,
"ram_needed_gb": 32
},
{
"label": "70B model",
"weights_gb": 43,
"ram_needed_gb": 64
}
]Модель 8B с квантованием 4-bit занимает около 4.9 GB весов, и сервер с 10 GB RAM выполняет её без использования swap. Модель 70B при той же квантовании занимает 43 GB весов и требует около 64 GB RAM. Обратите внимание, что эти цифры не учитывают скорость. На VPS без GPU модель 8B с квантованием 4-bit генерирует единицы токенов в секунду. Это приемлемо для агента, обрабатывающего очередь в фоновом режиме, но крайне медленно для задач, ожидаемых пользователем. Используйте локальный инференс для пакетной обработки, а для интерактивных задач — GPU или API. В кратком списке AI-агентов для self-hosting указано, какие проекты стоят места на диске, а в плане обучения по агентам в 2026 году описано, что и в каком порядке изучать.
Где таксономия перестает помогать
Она ничего не говорит об инструментах или правах доступа. Учебные агенты воспринимают среду и действуют в ней. Авторы этой главы не задумывались о том, что агент может обладать производственным API token. Агент, ориентированный на достижение цели и имеющий доступ к shell, и агент с доступом к базе данных только для чтения находятся в одной строке таблицы, но несут совершенно разные риски. Определите, к чему агент может обращаться, прежде чем решать, насколько «умным» он должен быть, и прочитайте как не допустить утечки секретов в AI-агента, прежде чем передавать ему учетные данные.
Она также ничего не говорит о том, что происходит при сбое на каком-либо этапе. Реальные агенты большую часть времени тратят на обработку ошибок: ограничение частоты запросов (rate limit) или инструмент, который вернул данные, не соответствующие ожиданиям модели. Именно этот код определяет, будет ли ваша система работоспособной, и ни одна строка таксономии не описывает этот процесс.
FAQ
Какие существуют пять типов агентов ИИ?
Агенты с простой рефлексией, рефлексивные агенты на основе моделей, целеориентированные агенты, агенты на основе полезности и обучающиеся агенты. Они упорядочены по объему знаний, которыми агент обладает перед совершением действия. Агент с простой рефлексией видит только текущие входные данные. Агент на основе модели хранит состояние окружающей среды. Целеориентированный агент планирует действия для достижения целевого состояния. Агент на основе полезности оценивает несколько приемлемых результатов и выбирает лучший из них. Обучающийся агент меняет собственную стратегию на основе обратной связи, что практически не встречается в self-hosted решениях.
Какой тип агента ИИ следует использовать для простой автоматизации?
Агент с простой рефлексией, что на практике означает webhook или расписание, запускающее фиксированную последовательность действий. Если правильный ответ зависит только от поступивших входных данных, добавление памяти лишь создает дополнительные точки отказа, не добавляя функциональности. Переходите к проектированию на основе модели в тот момент, когда сможете назвать хотя бы одно решение, требующее знания о прошлых событиях.
Могу ли я запускать собственные агенты ИИ на VPS?
Да. Уровень оркестрации требует мало ресурсов, поэтому 2 vCPU и 4 GB RAM позволяют комфортно запускать движок рабочих процессов или цикл агента. Основной вопрос заключается в том, где выполняется модель. Использование API стороннего сервиса позволяет сохранить легкость сервера и переносит расходы на оплату токенов. Локальная модель требует объема RAM, пропорционального количеству параметров, а без GPU она генерирует лишь несколько токенов в секунду, что подходит для пакетной обработки в очередях, а не для чат-интерфейса.
Является ли большая языковая модель агентом ИИ сама по себе?
Нет. Модель преобразует входной текст в выходной и останавливается. Она становится агентом, когда некая оболочка помещает её в цикл, позволяющий воздействовать на окружающую среду и возвращать результат обратно. Для этого требуются инструменты, которые модель может вызывать, и условие, определяющее момент завершения цикла. Оболочка — это и есть агент. Модель — лишь один из компонентов внутри него.
Нужна ли мне мультиагентная система?
Обычно нет. Один цикл с несколькими инструментами справляется с большинством задач, и его гораздо проще отлаживать. Несколько агентов полезны, когда части задачи действительно независимы и могут выполняться одновременно, или когда для одной из частей требуется другая модель. Цена этого — сложность координации: общее состояние и супервизор, чей контекст растет с каждым отчетом от исполнителя. Добавляйте второго агента только тогда, когда сможете точно указать на этап, который работает медленно.