Что такое рациональный агент в ИИ?
Рациональный агент — это ИИ-агент, который выбирает действие, наиболее вероятно ведущее к достижению цели при текущих условиях. Он оценивает доступные действия, используя свои наблюдения, знания, ограничения и меру эффективности. Для агента на основе LLM рациональным действием может быть вызов инструмента, сбор дополнительных данных, доработка результата, запрос одобрения человека или остановка задачи. Рациональность не гарантирует идеальный результат. Она означает выбор наиболее обоснованного варианта с учётом информации и ресурсов, доступных в данный момент.
Что означает подход рационального агента в ИИ?
Подход рационального агента рассматривает ИИ как действующее лицо в рамках среды задачи. Он получает восприятия и отслеживает релевантное состояние. Он рассматривает осуществимые действия, а затем выбирает то, которое даёт наибольший ожидаемый вклад в его меру эффективности. Для LLM-агента это может быть вызов инструмента, запрос данных, контрольная точка одобрения, доработка или намеренная остановка.
Это отличается от оценки интеллекта по беглости диалога. Узкое правило может быть рациональным в рамках ограниченной задачи. Свободные рассуждения всё равно могут оптимизировать неверную цель. Рациональность требует чётко заявленной меры и наблюдаемого процесса принятия решений.
Модель PEAS для рационального агента
PEAS описывает рабочую среду, в которой рациональный агент принимает решения. Буквы обозначают Performance measure (критерий эффективности), Environment (среда), Actuators (исполнительные механизмы) и Sensors (датчики). Критерий эффективности определяет, что считается успешным результатом. Среда задаёт условия, в которых агент должен действовать, исполнительные механизмы определяют доступные ему действия, а датчики — что он способен воспринимать. Вместе эти элементы дают информацию, необходимую для оценки того, выбрал ли агент наиболее рациональное действие для достижения своей цели.
| Элемент PEAS | Вопрос проектирования | Пример ИИ-агента для исследований |
|---|---|---|
| Показатель эффективности | Какие результаты считаются успехом? | Качество источников и полнота охвата задачи; фактическая точность в требуемом формате |
| Среда | Где действует агент? | Бриф пользователя и веб-источники; загруженные файлы и результаты работы инструментов |
| Исполнительные механизмы | Как агент может влиять на среду? | Веб-поиск и чтение файлов; составление отчётов, а также уточнение вопросов или передача задачи выше |
| Датчики | Какую информацию может воспринимать агент? | Инструкции пользователя и найденные страницы; содержимое файлов и ответы инструментов |
PEAS также определяет границы полномочий. Исследовательский агент может иметь доступ к загруженному документу, но не иметь права публиковать отчёт по нему. Он может подготовить вывод, но нуждаться в одобрении перед его публикацией. Эти ограничения меняют то, какие действия оказываются осуществимыми.
Как работает рациональный агент?
Современный цикл рационального агента на основе LLM связывает рассуждения модели с инструментами, состоянием, валидаторами и средствами контроля со стороны человека. Модель может предложить действие, но решение о том, доступно ли оно и уместно, принимает система в целом.
Восприятие: получение инструкций, файлов, найденных страниц или ответов от инструментов.
Представление: обновление состояния задачи на основе текущих данных и релевантной истории. Фиксация нерешённых требований.
Генерация: выявление полезных и допустимых действий. Запрос уточнения тоже может быть действием.
Прогнозирование: оценка того, как каждый вариант может повлиять на качество, риск, затраты и объём оставшейся работы.
Выбор: выбор осуществимого действия с наилучшей ожидаемой эффективностью с учётом всех ограничений.
Действие: выполнение вызова инструмента или общение с пользователем. Фиксация того, было ли действие успешным.
Проверка: результат рассматривается как новое восприятие. Дальше — продолжение работы, запрос дополнительных данных, запрос одобрения, пересмотр, эскалация или остановка.
Кодинг-агент показывает, как этот цикл принятия решений работает на практике. Сначала он воспринимает задачу, читая проваленный тест и соответствующий код. Затем он формирует представление о вероятной проблеме и сравнивает осуществимые действия, например изучение другого файла или внесение точечного исправления. После выбора и выполнения действия агент проверяет результат, запуская соответствующий тест. Цикл продолжается только до тех пор, пока следующее действие обладает достаточной ожидаемой ценностью. Он должен остановиться, когда исправление проходит требуемые проверки, дальнейшее исследование вряд ли улучшит результат, либо следующее действие требует одобрения человека.
Что определяет, является ли агент рациональным?
Рациональность зависит от контекста принятия решения, а не от того, насколько отточен итоговый ответ. Оцените следующие факторы:
Критерий эффективности: он должен отражать реальную задачу, сохраняя при этом неотменяемые ограничения.
Последовательность восприятий: агент должен опираться на релевантную историю, а не на один неоднозначный снимок ситуации.
Предварительные знания: знания должны соответствовать предметной области и быть достаточно актуальными для решения задачи.
Доступные действия: набор инструментов должен обеспечивать выполнение работы, а права доступа — ограничивать небезопасные операции.
Неопределённость: слабые доказательства должны запускать безопасный запасной вариант, запрос уточнения или эскалацию.
Ресурсы: бюджет времени и вычислительных мощностей должен соответствовать риску и сложности задачи.
Условия остановки: критерии успеха, пределы допустимых сбоев или границы, требующие одобрения, должны завершать выполнение.
Эти факторы определяют, какое действие рационально в конкретной ситуации. Агент поддержки может ответить на стандартный вопрос о политике, если утверждённая база знаний предоставляет достаточные сведения. Если спор по счёту связан с отсутствующими записями или выходит за пределы полномочий агента, рациональным решением становится эскалация. Таким образом, оптимальное действие меняется в зависимости от доступной информации и разрешённых агенту полномочий.
Типы рациональных агентов в ИИ
В системах ИИ обычно используют пять архитектур агентов: простые рефлекторные, рефлекторные на основе модели, целенаправленные, агенты на основе полезности и обучающиеся агенты. Каждая архитектура предлагает свой способ выбора действий на основе доступной информации. Эти категории не являются исчерпывающими или взаимоисключающими. Современные агенты на основе LLM часто сочетают несколько из них в рамках одного рабочего процесса.
| Распространённая архитектура | Основа принятия решений | Полезна, когда | Основное ограничение |
|---|---|---|---|
| Простой рефлекс | Текущий ввод плюс правило | Задача узкая | Игнорирует скрытое состояние |
| Рефлекс на основе модели | Ввод плюс внутреннее состояние | История влияет на выбор | Состояние может устаревать |
| На основе цели | Продвижение к цели | Агент должен планировать | Цели могут не расставлять приоритеты в компромиссах |
| На основе полезности | Ожидаемая ценность результатов | Ценность или риск различаются | Оценки трудно спроектировать |
| Обучение | Опыт меняет поведение | Условия меняются | Плохая обратная связь приводит к дрейфу |
Простые рефлекторные агенты
Узкоспециализированный маршрутизатор поддержки может направлять сообщение с утверждённым ключевым словом, связанным с оплатой, в очередь по вопросам биллинга. Это может быть рациональным решением, когда метки однозначны, а риск низок. Такой подход даёт сбои, когда смысл зависит от истории.
Рефлекторные агенты на основе модели
Агент поддержки на основе модели поддерживает состояние сессии. Он может помнить о пройденной проверке личности и не повторять неудавшийся шаг. Состояние помогает, когда последнему сообщению не хватает контекста, хотя устаревшее состояние может ввести агента в заблуждение.
Целенаправленные агенты
Целенаправленный исследовательский агент разбивает бриф отчёта на вопросы, изучает источники, а затем дорабатывает недостающие разделы. Цель определяет его вызовы инструментов. Однако формулировка «завершить отчёт» не определяет достаточность доказательств и не задаёт приоритет между скоростью и глубиной проработки источников.
Агенты на основе полезности
Агент по организации поездок или закупок сравнивает варианты с разными затратами и рисками. Он может отдать предпочтение соответствию политике перед удобством по срокам, а затем запросить одобрение при превышении лимита. Сложность заключается в назначении обоснованных весов.
Обучающиеся агенты
Ассистент поддержки может учиться на том, какие предложенные ответы принимают проверяющие. Рекомендательный агент может использовать явную обратную связь, а не считать успехом каждый клик. Обучение остаётся рациональным только тогда, когда обратная связь отражает реальную цель, а защитные механизмы предотвращают отклонение от неё.
Современный агент на основе LLM может сочетать все эти элементы. Ярлык «на основе LLM» сам по себе не доказывает рациональность; критерии эффективности и механизмы контроля всё равно требуют осмысленного проектирования.
Рациональный агент против интеллектуального агента
«Интеллектуальный агент» — широкая категория для систем, действующих с некоторой степенью автономии. «Рациональный агент» фокусируется на выборе действий относительно критерия эффективности.
| Критерий | Рациональный агент | Интеллектуальный агент |
|---|---|---|
| Основной акцент | Ожидаемая эффективность | Автономность |
| Сложность | Может использовать простые правила | Диапазон от автоматизации до продвинутого ИИ |
| Ключевая проверка | Было ли действие разумным? | Способен ли он выполнить задачу? |
| Взаимосвязь | Механизм принятия решений | Категория системы |
Интеллектуальность не гарантирует ни разумной цели, ни безопасного действия. Кодинг-агент может сгенерировать корректный код, но при этом внести изменения за пределами заданной области. Исследовательский агент может написать связный текст на основе слабых источников. Рациональность оценивает, служил ли каждый выбор поставленной задаче в рамках заданных ограничений.
Примеры рациональных агентов из реальной жизни
Каждый пример описывает свою среду, наблюдения, действия и критерий эффективности, не предполагая рациональность по умолчанию.
ИИ-агент для исследований
Его среда включает запрос пользователя, веб-контент и переданные файлы. Наблюдениями служат инструкции и найденные данные. Агент может уточнить запрос, изучить источник, запросить пояснение или подготовить черновик. Результат зависит от качества источников и полноты охвата задачи; порог приемлемости задаёт фактическая точность в требуемом формате. Противоречивые данные могут стать основанием для нового поиска.
ИИ-агент для разработки
Агент для разработки работает в репозитории в рамках инструкций проекта и разрешённых инструментов. Он наблюдает исходные файлы и результаты тестов. Он может искать код, вносить изменения, запускать конкретный тест или запрашивать подтверждение для рискованных действий. Изменение должно решать поставленную задачу без влияния на не связанное с ней поведение. Перед завершением работы должна пройти соответствующая проверка.
ИИ-агент поддержки клиентов
Агент поддержки работает в рамках диалога, утверждённой базы знаний и границ доступа к аккаунту. Он наблюдает сообщения и состояние сессии. Он может обратиться к политике, подготовить ответ, запросить уточнения или передать вопрос эскалацией. Результат складывается из качества решения и соблюдения политики. Эскалация может быть обоснованной, если убедительных данных недостаточно.
ИИ-агент для анализа данных
Агент для анализа данных получает бизнес-вопрос и наборы данных. Он наблюдает схемы данных и результаты работы инструментов. Он может проверить пропуски в данных, выполнить запрос, построить график или отклонить необоснованный вывод. Результат сочетает аналитическую корректность и воспроизводимость. Перед интерпретацией тренда следует проверить единицы измерения и применённые фильтры.
ИИ-агент для рабочих процессов
Агент для рабочих процессов координирует процесс между разными программными инструментами. Он наблюдает входящие записи и обновления статуса. Он может извлекать поля, подготавливать черновик, направлять элемент по маршруту или приостанавливаться до получения подтверждения. Успех определяется корректными переходами состояний и возможностью аудита. Доступность API-вызова сама по себе не является достаточной причиной для продвижения задачи.
Мультиагентная исследовательская система
Рабочие агенты получают независимые исследовательские вопросы; координатор получает собранные ими данные. Рабочие агенты выполняют поиск или анализ в рамках своей области. Координатор может запросить повтор, разрешить противоречия, свести результаты вместе или остановить слабые направления. Важны итоговая точность и полнота охвата, но дублирование работы снижает пользу. Увеличение числа агентов помогает только тогда, когда разбиение задачи повышает ожидаемую результативность.
В каждом из этих случаев рациональность проявляется в выборе инструментов, запросах данных, проверках перед подтверждением, доработке и остановке. Каждое действие должно повышать ожидаемую результативность задачи настолько, чтобы оправдать свою стоимость.
Преимущества и ограничения рационального проектирования агентов
Этот подход превращает размытую автономность в явную модель принятия решений и делает ограничения рабочего процесса видимыми.
Преимущества
Чёткая оценка: мера результативности делает успех проверяемым.
Прозрачность решений: зафиксированные данные и вызовы инструментов облегчают анализ.
Контролируемая автономность: ограничения и точки подтверждения сдерживают действия.
Учёт компромиссов: полезность позволяет сравнивать конкурирующие результаты.
Осмысленная остановка: пороги снижают вероятность преждевременных ответов или бесконечных циклов.
Ограничения
Неверные цели: заменяющая метрика может не отражать истинную цель пользователя.
Неполнота информации: отсутствие данных может помешать обоснованному решению.
Ошибки модели: LLM может неверно интерпретировать состояние или выбрать неподходящий инструмент.
Вычислительные ограничения: приближённые методы могут упускать более удачные варианты.
Пробелы в подотчётности: значимые действия всё равно требуют ответственных лиц и проверки человеком.
Знакомьтесь с Kimi Agent: превращайте знания в готовую работу
Kimi Agent показывает, как рациональный агент на основе LLM способен справляться с наукоёмкими задачами. Задайте результат — и агент спланирует задачу, а затем выполнит нужные шаги с помощью встроенных инструментов. С его помощью можно исследовать тему, обработать исходные материалы или создать редактируемый результат без построения отдельного слоя оркестрации.
Подключите исходные знания к задаче
Kimi поддерживает загрузку до 50 файлов, каждый размером не более 100 МБ. Он умеет работать с PDF и распространёнными офисными документами. Изображения, файлы TXT и видео могут дать дополнительный контекст.
Эти материалы становятся частью рабочей среды агента. В запросе вы задаёте желаемый результат, а загруженные файлы предоставляют знания, необходимые для его достижения.
Превратите исследование в редактируемый результат
Kimi Agent способен пройти путь от сбора информации до готового к использованию результата:
Deep Research: создание структурированного отчёта с указанием источников.
Веб-сайты: создание работающего многостраничного сайта по краткому описанию.
Презентации: создание редактируемой PPT-презентации на основе исходных материалов.
Документы и таблицы: организация информации в практичные рабочие материалы.
Задача не обязана заканчиваться ответом в чате. Kimi Agent может превратить собранную информацию в редактируемый результат в рамках того же процесса.
Масштабируйте крупные задачи с Kimi Agent Swarm
Kimi Agent Swarm может разбить крупную цель на независимые потоки работы. Суб-агенты обрабатывают отдельные исследовательские вопросы или пакетные задачи, после чего их результаты объединяются.
Такой подход подходит для масштабного поиска, объёмных текстов и пакетной обработки. Параллельное выполнение наиболее полезно, когда ветви работы могут выполняться независимо друг от друга. Последовательное выполнение остаётся предпочтительным, когда каждый шаг зависит от проверенного результата предыдущего.
Как оценить рационального агента
Используйте этот чек-лист на этапе проектирования и тестирования. Изучайте не только итоговый результат, но и цепочку принятия решений.
Мера эффективности: отражает ли она успех и учитывает ли ограничения?
Наблюдаемость: какие условия агент способен воспринимать?
Знания: достаточно ли актуальны и подходящи имеющиеся знания?
Действия: может ли необходимая работа выполняться в рамках имеющихся прав?
Неопределённость: приводят ли слабые доказательства к проверке или эскалации?
Ресурсы: соответствует ли бюджет уровню риска задачи?
Проверка человеком: кто утверждает необратимые действия?
Логирование: могут ли проверяющие восстановить логику решений и их результаты?
Условие остановки: прекращается ли выполнение после успеха, ограниченного сбоя или эскалации?
Дайте исследовательскому агенту противоречивые источники и проверьте, начнёт ли он искать более надёжные доказательства. Дайте агенту для написания кода команду, которая завершилась с ошибкой, и посмотрите, проведёт ли он диагностику перед повторным редактированием. Агент поддержки при нехватке контекста должен запрашивать информацию, а не придумывать детали.
Оценивайте повторяющиеся поиски, игнорируемые ошибки, необоснованные утверждения, нарушения процедур согласования или преждевременные остановки. Неудачный вызов инструмента сам по себе не доказывает нерациональность, если агент осознаёт это и разумно восстанавливается. Проверьте, обеспечивают ли пороги остановки баланс между качеством и затратой ресурсов.
Заключение
Рациональный агент — это модель принятия решений для выбора действий на основе доступных данных в условиях реальных ограничений. Для современных агентов на базе LLM такие действия включают вызовы инструментов, запросы данных, проверки согласования, доработки или осознанную остановку. Эту модель могут использовать исследовательские агенты и агенты для написания кода, а также рабочие процессы поддержки или мультиагентные системы. По умолчанию рациональным не является ни один из них. Рациональность зависит от цели, наблюдений, полномочий, оценки и подходящей политики остановки.