ИИ-агенты 2026: обзор платформ от AutoGPT до новых фреймворков

Агентом называют систему, которая получает цель, сама решает, какие шаги предпринять, вызывает инструменты и продолжает, пока не сочтёт задачу выполненной. Демонстрации выглядят впечатляюще. В работе выясняется, что главная сложность не в том, чтобы агент действовал, а в том, чтобы он останавливался, не зацикливался и не делал необратимого.
Из чего состоит любая платформа
| Часть | За что отвечает | Где ломается |
|---|---|---|
| Планировщик | Разбивает цель на шаги | Бесконечные циклы, ветвление без сходимости |
| Инструменты | Действия во внешнем мире | Неверные параметры вызова, отсутствие отката |
| Память | Состояние между шагами | Переполнение контекста, потеря цели |
| Критик | Оценка результата шага | Оценивает сам себя и почти всегда доволен |
| Ограничители | Лимиты шагов, бюджета, прав | Часто добавляются последними |
Различия между платформами в основном в удобстве описания этих частей и в готовых интеграциях. Принципиальных архитектурных различий меньше, чем кажется из маркетинга.
На что смотреть при выборе
- Наблюдаемость. Можно ли посмотреть каждый шаг, каждый вызов инструмента, каждый ответ модели. Без этого отладка невозможна, а отлаживать придётся много.
- Детерминированные ограничители. Лимит шагов, лимит расходов, белый список инструментов — на уровне кода, а не в промте. Ограничение, записанное только в инструкции, не является ограничением.
- Возобновляемость. Что происходит при сбое на шестом шаге из десяти: всё сначала или продолжение с точки остановки.
- Подтверждение человеком. Возможность потребовать одобрения перед необратимыми действиями — отправкой, оплатой, удалением.
- Тестируемость. Можно ли прогнать сценарий на записанных ответах, без обращения к модели.
- Стоимость прогона. Агент делает десятки вызовов на одну задачу; считайте цену задачи, а не запроса.
Что стабильно не работает
- Полностью автономные длинные цепочки. Вероятность ошибки накапливается: при 95% успеха на шаге двадцатишаговая цепочка доходит до конца примерно в трети случаев.
- Самооценка качества. Модель, проверяющая собственную работу, систематически завышает оценку.
- Работа без ограничения бюджета. Зацикливание обнаруживается по счёту, а не по логам.
- Свободный доступ к необратимым действиям. Всё, что нельзя откатить, должно проходить через подтверждение.
Что работает
Короткие цепочки из трёх-пяти шагов с проверяемым результатом каждого. Задачи, где ошибка дёшева и заметна. Сценарии, где агент готовит результат, а применяет его человек. Пакетная обработка, где сто запусков дают статистику и брак виден сразу.
Практический каркас, независимый от платформы: - максимум шагов — жёсткое число; - бюджет на задачу — жёсткое число; - список разрешённых инструментов — явный; - необратимые действия — только с подтверждением; - каждый шаг логируется целиком: запрос, ответ, вызов, результат; - при трёх неудачных шагах подряд — остановка и передача человеку.
Когда агент не нужен
Если последовательность шагов известна заранее — это обычный скрипт, и он надёжнее, дешевле и отлаживается нормальными средствами. Агент оправдан там, где шаги действительно зависят от промежуточных результатов и заранее их перечислить нельзя. Значительная часть проектов, начинавшихся как агентные, заканчивается конвейером с одним-двумя вызовами модели внутри — и это не поражение, а нормальный исход проектирования.
Конкретные названия фреймворков и их возможности здесь не перечисляются намеренно: этот слой инструментов меняется быстрее всего, а критерии выбора и список того, что не работает, держатся уже несколько лет.