SSD Nodes Learn 8GB RAM — $66/год
Руководства Matt ConnorАвтор: Matt Connor · Обновлено 2026-08-01

Как изучить AI-агентов с нуля: путь из 6 этапов

Пошаговый план обучения AI-агентам: понятия, собственный цикл, инструменты, память, проектирование и безопасность. На каждом этапе вы создадите один объект.

Путь из шести этапов

Чтобы изучить AI-агентов с нуля, последовательно пройдите шесть этапов: основные понятия, первый цикл, инструменты, память, проектирование цикла и безопасность. На каждом этапе вы самостоятельно создаёте один объект. Преждевременный переход к следующим темам — самая частая причина остановки обучения, поскольку фреймворк скрывает именно ту часть, которую вам нужно было увидеть.

AI-агент — это цикл вокруг языковой модели, которой разрешено вызывать инструменты. В этом предложении заключается вся тема. Всё остальное — детали о том, что входит в цикл, к каким ресурсам могут обращаться инструменты и как остановить цикл при ошибке. Если вы можете объяснить этот цикл другому человеку, значит, вы освоили суть. Если вы можете только назвать фреймворки, значит, вы ещё не освоили её.

Приведённый ниже план предполагает обучение через практическую разработку. Прочитайте описание этапа, создайте небольшой объект, намеренно сломайте его, а затем переходите дальше. Этап, который вы только прочитали, нельзя считать пройденным.

Что на самом деле нужно до этапа 1

Список обязательных условий невелик и короче, чем обычно указывают на страницах курсов.

  • Вы умеете читать и писать код на Python или TypeScript на уровне скрипта из пятидесяти строк.
  • Вы уверенно работаете в оболочке Linux: устанавливаете пакет, редактируете файл, читаете журнал.
  • У вас есть API key для размещённой модели или компьютер, на котором можно запустить локальную модель.

Это весь список. Вам не нужны знания теории машинного обучения и не нужно самостоятельно обучать модель. В работе с агентами не используются градиенты или обучающие данные. Видеокарта нужна только при самостоятельном запуске модели. Это отдельный навык, который можно освоить позже по инструкции размещение Ollama на VPS для самостоятельного запуска LLM.

Часто недооценивают работу в оболочке. Агенты дают сбои из-за прав доступа, путей, переменных окружения и процессов, которые завершаются без сообщений. Если трассировка стека с упоминанием PATH или режима файла заставляет вас закрыть терминал, сначала потратьте выходные на изучение основ Linux. Позже это сэкономит вам месяц.

Этап 1: что такое агент и чем он не является

Начните с одного API-вызова без цикла. Отправьте запрос, выведите ответ и посмотрите количество токенов в ответе. Теперь вы понимаете единицу стоимости и единицу задержки.

Затем изучите использование инструментов. Это единственная действительно новая идея во всей области. Опишите функцию для модели: укажите ее имя, описание и схему JSON (JavaScript object notation) для входных данных. Модель ничего не запускает. Она отправляет структурированный запрос: вызовите run_command с такими аргументами. Ваш код выполняет функцию, отправляет результат обратно в виде сообщения и снова обращается к модели. Модель планирует действия, читая и создавая текст. Ваш код выполняет действия.

Чат-бот завершает работу после одного ответа. Агент повторяет этот обмен, пока модель не перестанет запрашивать инструменты. В этом и состоит вся разница. Поэтому различаются и режимы отказа. Чат-бот один раз выдает неправильный ответ. Агент несколько раз выполняет действия на основе неправильного ответа, прежде чем это кто-либо заметит.

Этап 2: один раз напишите цикл самостоятельно

Не начинайте с фреймворка. Напишите около тридцати строк на Python, чтобы самостоятельно определить структуру программы.

sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-here
import subprocess
import anthropic

client = anthropic.Anthropic()

tools = [{
    "name": "run_command",
    "description": "Run a read only shell command and return its output.",
    "input_schema": {
        "type": "object",
        "properties": {"command": {"type": "string"}},
        "required": ["command"],
    },
}]

messages = [{"role": "user", "content": "How much disk space is free here?"}]

while True:
    response = client.messages.create(
        model="claude-opus-5",
        max_tokens=4096,
        tools=tools,
        messages=messages,
    )
    if response.stop_reason != "tool_use":
        break
    messages.append({"role": "assistant", "content": response.content})
    results = []
    for block in response.content:
        if block.type == "tool_use":
            done = subprocess.run(
                block.input["command"], shell=True,
                capture_output=True, text=True, timeout=10,
            )
            results.append({
                "type": "tool_result",
                "tool_use_id": block.id,
                "content": done.stdout or done.stderr,
            })
    messages.append({"role": "user", "content": results})

print(next(b.text for b in response.content if b.type == "text"))

Запустите программу с помощью python3 agent.py. При успешном выполнении выводится один абзац с именами ваших файловых систем и объемом свободного места. Это происходит потому, что модель запросила df -h, ваш код выполнил команду, а второй проход преобразовал эту таблицу в предложение. Если ничего не выводится, цикл завершился до появления текстового блока. Добавьте print(response.stop_reason) внутрь цикла и проследите, как меняются значения.

Теперь намеренно нарушьте работу программы. Удалите строку tool_use_id и изучите ошибку. Результат инструмента без соответствующего идентификатора отклоняется API, и это самая распространенная ошибка начинающих. Задайте вопрос, для ответа на который нужны две команды, и проследите, как цикл выполнится дважды. Задайте невыполнимый вопрос и посмотрите, завершит ли программа работу или зациклится.

Обратите внимание на одно ограничение этого примера. Он напрямую передает вывод модели в shell с помощью shell=True. Это допустимо на тестовой машине, которую можно восстановить, но неприемлемо в остальных случаях. Вопросы безопасности рассматриваются на этапе 6. Концепции, лежащие в основе этого цикла, подробнее рассмотрены в материале создание собственного AI-агента на VPS.

Этап 3: инструменты, которых у агента ещё не было

Ваш инструмент run_command работает, но реальному агенту нужны инструменты для доступа к внешним системам: тикетной системе, базе данных, репозиторию. Написание отдельной оболочки для каждого сервиса и каждого агента не масштабируется.

Model Context Protocol (MCP) стал принятым в отрасли решением. MCP-сервер предоставляет набор инструментов через стандартный транспорт, и любой агент с поддержкой MCP может использовать их без специального связующего кода. Эталонный сервер файловой системы запускается одной командой:

npx -y @modelcontextprotocol/server-filesystem /home/you/projects

Для этого требуется установленный Node, а аргумент с каталогом задаёт единственный путь, к которому сервер получит доступ. Это упрощённая модель безопасности: границу определяет сервер, а не модель. Подключите к нему клиент, и агент получит возможность читать и записывать файлы, для чего вам не пришлось писать собственный код. Правильный запуск таких серверов под служебной учётной записью с объяснением вариантов транспорта описан в разделе запуск MCP-серверов на VPS для AI-агентов программирования.

Главный вывод этого этапа: проектирование инструментов — самая важная работа. Расплывчатое описание заставляет модель угадывать. Инструмент, возвращающий сорок тысяч символов, переполняет контекстное окно. Инструмент, который может удалять объекты, рано или поздно что-нибудь удалит.

Этап 4: память, которая в основном состоит из файлов

На этом этапе начинающие разработчики обращаются к векторной базе данных. По крайней мере пока этого делать не следует.

Между вызовами у агента нет памяти. При каждом вызове вы заново передаёте весь диалог. Поэтому длинный сеанс обходится дороже за один обмен сообщениями, чем короткий. Таким образом, память включает две задачи. Первая — определить, что помещается в окно контекста прямо сейчас. Это решают с помощью суммирования, удаления старого вывода инструментов и кэширования стабильного префикса запроса, чтобы платить за него лишь небольшую часть стоимости. Вторая — сохранить данные после перезапуска. Для этого требуется хранилище.

Для второй задачи обычный файл markdown, который агент может читать и изменять, подходит почти для любого первого проекта лучше векторной базы данных. Предоставьте агенту один файл, укажите его формат, поручите читать этот файл перед началом работы и обновлять его при получении новых сведений. Вы получите большую часть преимуществ и сможете открыть файл, чтобы увидеть, что считает агент. Обращайтесь к embeddings и retrieval, когда заметки перестанут помещаться в окно контекста, но не раньше.

Этап 5: цикл — это продукт

Теперь вы умеете создавать агента, который работает, пока вы за ним наблюдаете. На этапе 5 нужно добиться его работы без вашего участия.

Безопасность автономного агента определяют четыре вопроса. Что его запускает, чтобы он не работал без задачи. В каких границах он действует, чтобы ошибка оставалась ограниченной. Как проверяется результат, поскольку агент, который сам проверяет свою работу, всегда поставит себе положительную оценку. Какой бюджет ограничивает его работу — в токенах или по фактическому времени. Проектирование этих четырех элементов является основой дисциплины, описанной в разделе проектирование циклов и содержание этого определения.

Упражнение: возьмите агента из этапа 2, задайте ему задачу, для которой требуется четыре или пять шагов, и добавьте жесткое ограничение числа итераций. Затем уберите это ограничение и проследите, как неограниченный цикл увеличивает расходы на токены. Один раз выполните это с небольшим бюджетом, чтобы случайно не повторить такой эксперимент с большим бюджетом.

Этап 6: безопасность, секреты и расходы

Этот этап нельзя пропускать. Он стоит последним только потому, что вы не можете оценить риск, пока не создадите что-то работающее.

Запускайте агент от отдельного непривилегированного пользователя. Никогда не запускайте его от root или от своей учетной записи. Это ограничит возможный ущерб каталогом, а не всей машиной. Не помещайте учетные данные в область, доступную модели. Все, что находится в контекстном окне, можно процитировать обратно через вызов инструмента. Решение — токены с коротким сроком действия, доступ к которым предоставляется через вспомогательный компонент, как описано в разделе как не допустить утечки секретов через AI-агентов. Установите жесткий лимит расходов. Неконтролируемый цикл тарифицирует каждую итерацию, пока за ним никто не следит. Ограничения и пакетная обработка, которые позволяют контролировать расходы, описаны в разделе контроль расходов AI-агента на постоянно работающем VPS.

Расходы требуют одного конкретного числа. По состоянию на July 2026 Claude Opus 5 тарифицирует $5 за миллион входных токенов и $25 за миллион выходных токенов. Агент, который постоянно отправляет увеличивающийся диалог, может передать через одну задачу несколько сотен тысяч токенов. Кэширование промптов и использование меньшей модели для обычных шагов меняют эту арифметику гораздо сильнее, чем любые изменения промпта.

Инъекции в промпт также относятся к этой теме. Если агент читает веб-страницу, issue tracker или входящие сообщения, автор этого текста одновременно задает инструкции вашему агенту. Защита заключается не в более хитром системном промпте. Она заключается в границе полномочий. Если агент не может удалить репозиторий, его нельзя убедить это сделать.

Какую карту следует выбрать?

Выберите одну учебную программу и пройдите ее полностью, вместо того чтобы просматривать шесть программ по отдельности. Репозиторий Microsoft ai-agents-for-beginners — наиболее полный бесплатный вариант: это курс из восемнадцати уроков, который по состоянию на июль 2026 года набрал более 70,000 звезд. Он хорошо соответствует описанным выше этапам. Подборки популярных репозиториев агентов полезны, чтобы понять, какие проекты существуют, но гораздо хуже подходят в качестве учебной программы. Список, отсортированный по числу звезд, отражает популярность, а не порядок обучения.

Для практики лучше всего сначала выбрать реальный проект с агентом для программирования. Обратная связь поступает сразу, инструменты понятны, а ошибки легко исправить. В материале Запуск ИИ-агента для программирования на VPS описан весь процесс от начала до конца. Если вы предпочитаете изучать работающие системы, а не создавать их с нуля, в сравнении лучших самостоятельно размещаемых ИИ-агентов показано, как несколько проектов по-разному реализуют один и тот же цикл.

Сколько это занимает?

Для человека, который уже умеет программировать, этапы 1 и 2 займут один вечер. Этап 3 — одни выходные. Большая часть времени уйдет на описания инструментов, а не на протокол. Этапы 4 и 5 требуют нескольких недель реального использования. Вы узнаете, что забывает ваш агент, только наблюдая за тем, как он это забывает. Этап 6 не завершается полностью: каждая новая предоставленная возможность снова требует его пересмотра.

Два месяца регулярных занятий по вечерам позволяют большинству создать работающего, ограниченного и полезного агента. Те, кому требуется год, обычно продолжают читать вместо того, чтобы создавать.

FAQ

Нужно ли знать машинное обучение, чтобы создать AI-агента?

Нет. Создание агента означает вызов модели через API и подключение ее запросов к инструментам к реальным функциям. Это обычная разработка приложений. Вам не нужно работать с обучением, градиентами или наборами данных. От схем инструментов, обработки ошибок и разрешений Linux зависит, будет ли агент работать правильно. Теория машинного обучения становится актуальной только при последующей тонкой настройке модели. Это другая задача с другими предварительными требованиями.

Следует ли начинать с фреймворка, например LangChain или CrewAI?

Сначала напишите один цикл без фреймворка, а затем используйте фреймворк. Фреймворк заменяет тридцать строк на этапе 2 объектом конфигурации. Это удобно, когда вы понимаете, что именно он заменяет, и усложняет работу до этого. При непредсказуемом поведении агента необходимо напрямую анализировать список сообщений и результаты работы инструментов. Это намного сложнее, если вы никогда их не видели. После написания собственного цикла фреймворк экономит время, а не скрывает механизм работы.

Сколько стоит изучение AI-агентов?

Меньше, чем ожидает большинство людей, если ограничить расходы. Hosted API key и небольшой VPS покрывают все необходимое на этих шести этапах. Основной риск связан не с почасовой оплатой, а с неограниченным циклом, который списывает средства за каждую итерацию, пока вы спите. В первый же день установите жесткий лимит расходов в своей учетной записи API, добавьте ограничение числа итераций в каждый цикл и используйте более дешевую модель для обычных операций. Локальный запуск модели устраняет расходы на токены, но требует соответствующего оборудования.

В чем разница между AI-агентом и чат-ботом?

Чат-бот отвечает один раз. Агент повторяет цикл: модель запрашивает инструмент, ваш код запускает его, результат возвращается модели, а модель решает, что делать дальше. Благодаря этому повторению агент может завершать задачи, состоящие из нескольких этапов. Поэтому агентам нужны ограничения, которые не требуются чат-ботам. Неправильный ответ чат-бота — это ошибочный абзац. Неправильный ответ агента — это ошибочный абзац и все действия, которые он успел выполнить.

#ai-agents#learning#curriculum#mcp#self-hosting