합리적 에이전트: AI는 어떻게 목표 지향적 결정을 내리는가

합리적 에이전트가 지각(percept)과 지식을 활용해 제약 조건과 성능 척도를 지키면서 가능한 최선의 행동을 선택하는 방법을 알아보세요. 이 AI 프레임워크가 고전적인 아키텍처와 Kimi의 현대적인 목표 지향 워크플로를 어떻게 연결하는지 살펴봅니다.

12분 읽기2026-08-13
AI에서의 합리적 에이전트

AI에서 합리적 에이전트란 무엇인가요?

합리적 에이전트란 현재 조건에서 목표를 달성할 가능성이 가장 높은 행동을 선택하는 AI 에이전트입니다. 관측, 지식, 제약 조건, 성과 척도를 이용해 가능한 행동을 평가합니다. LLM 기반 에이전트의 경우, 합리적인 행동에는 도구 호출, 추가 근거 수집, 결과물 수정, 인간 승인 요청, 작업 중지 등이 포함될 수 있습니다. 합리성이 완벽한 결과를 보장하는 것은 아닙니다. 그것은 그 순간 사용 가능한 정보와 자원으로 가장 정당화할 수 있는 선택을 한다는 의미입니다.

AI에서 합리적 에이전트 접근법이란 무엇을 의미하나요?

합리적 에이전트 접근법은 AI를 작업 환경 내의 행위자로 취급합니다. 지각(percept)을 받아들이고 관련 상태를 유지합니다. 실행 가능한 행동들을 고려한 다음, 자신의 척도에 가장 크게 기여할 것으로 예상되는 행동을 선택합니다. LLM 에이전트의 경우, 이는 도구 호출, 근거 요청, 승인 체크포인트, 수정, 또는 의도적인 중지일 수 있습니다.

이는 유창한 대화만으로 지능을 판단하는 것과는 다릅니다. 좁은 범위의 규칙도 제한된 작업 안에서는 합리적일 수 있습니다. 유창한 추론이라도 잘못된 목표를 최적화하고 있을 수 있습니다. 합리성에는 명시된 척도와 관찰 가능한 결정 과정이 필요합니다.

합리적 에이전트의 PEAS 프레임워크

PEAS는 합리적 에이전트가 결정을 내리는 작업 환경을 정의합니다. 각 알파벳은 성과 척도(Performance measure), 환경(Environment), 행동유발기(Actuators), 센서(Sensors)를 나타냅니다. 성과 척도는 에이전트에게 무엇이 성공적인 결과로 간주되는지를 알려줍니다. 환경은 에이전트가 그 안에서 작동해야 하는 조건을 설정하며, 행동유발기는 사용 가능한 행동을 정의하고 센서는 관측할 수 있는 대상을 결정합니다. 이러한 요소들이 함께 작동하여 에이전트가 목표에 가장 합리적인 행동을 선택했는지 판단할 수 있는 정보를 제공합니다.

PEAS 요소설계 질문AI 연구 에이전트 예시
성능 척도어떤 결과가 성공으로 간주되는가?출처 품질과 작업 커버리지; 요구된 형식에서의 사실적 정확성
환경에이전트는 어디에서 작동하는가?사용자 요청과 웹 소스; 업로드된 파일과 도구 출력
액추에이터에이전트는 환경에 어떻게 영향을 줄 수 있는가?웹 검색과 파일 읽기; 보고서 작성과 명확화 또는 에스컬레이션
센서에이전트가 지각할 수 있는 정보는 무엇인가?사용자 지시와 검색된 페이지; 파일 콘텐츠와 도구 응답

PEAS는 권한 문제도 명확히 해줍니다. 리서치 에이전트는 업로드된 문서를 읽을 수는 있지만 보고서를 공개할 권한은 없을 수 있습니다. 결론의 초안을 작성할 수는 있지만 공유하기 전에 승인이 필요할 수 있습니다. 이러한 경계는 어떤 행동이 실행 가능한지를 바꿔놓습니다.

합리적 에이전트는 어떻게 작동하나요?

최신 LLM 기반 합리적 에이전트 루프는 모델의 추론을 도구, 상태, 검증기, 인간의 통제와 연결합니다. 모델이 행동을 제안할 수는 있지만, 그 행동이 가능하고 적절한지는 전체 시스템이 결정합니다.

  1. 인지(Perceive): 지시, 파일, 검색된 페이지, 또는 도구 응답을 받습니다.

  2. 표현(Represent): 현재 근거와 관련 이력을 바탕으로 작업 상태를 업데이트합니다. 미해결 요구 사항을 기록합니다.

  3. 생성(Generate): 허용된 유용한 행동을 식별합니다. 명확화 요청도 하나의 행동이 될 수 있습니다.

  4. 예측(Predict): 각 선택지가 품질, 위험, 비용, 남은 작업에 어떤 영향을 미칠지 추정합니다.

  5. 선택(Select): 제약 조건을 적용한 후 예상 성과가 가장 강한 실행 가능한 행동을 선택합니다.

  6. 실행(Act): 도구를 호출하거나 사용자와 소통합니다. 성공 여부를 기록합니다.

  7. 검토: 결과를 새로운 지각으로 취급한다. 계속 진행하거나, 증거를 요청하거나, 승인을 요청하거나, 수정하거나, 상위 단계로 넘기거나, 중단한다.

코딩 에이전트를 보면 이 의사결정 루프가 실제로 어떻게 작동하는지 알 수 있다. 에이전트는 먼저 실패한 테스트와 관련 코드를 읽어 작업을 지각한다. 그런 다음 가능한 원인을 표현하고, 다른 파일을 살펴보거나 특정 부분을 수정하는 등 실행 가능한 행동들을 비교한다. 행동을 선택하고 실행한 뒤에는 관련 테스트를 실행해 결과를 검토한다. 이 루프는 또 다른 행동이 충분한 기대 가치를 가질 때만 계속된다. 수정이 필수 검사를 통과했을 때, 추가 조사로는 결과가 개선될 가능성이 낮을 때, 또는 다음 행동에 사람의 승인이 필요할 때는 중단해야 한다.

에이전트가 합리적인지는 무엇으로 결정되는가?

합리성은 최종 응답의 완성도보다는 의사결정 맥락에 좌우된다. 다음 요소들을 평가해 보자.

  • 성과 측정 지표: 양보할 수 없는 제약을 유지하면서 실제 작업을 대표해야 한다.

  • 지각 시퀀스: 에이전트는 모호한 단일 스냅샷이 아니라 관련 이력을 활용해야 한다.

  • 사전 지식: 지식은 해당 도메인에 적합하고 작업에 필요한 만큼 최신이어야 한다.

  • 사용 가능한 행동: 도구 집합이 작업을 뒷받침해야 하며, 권한은 안전하지 않은 작업을 제한해야 한다.

  • 불확실성: 근거가 약할 경우 안전한 대안, 명확화 요청, 또는 상위 단계 이관을 유발해야 한다.

  • 리소스: 시간과 컴퓨팅 예산은 작업의 위험도 및 복잡성에 맞아야 한다.

  • 중단 조건: 성공 기준, 실패 한계, 또는 승인 경계가 실행을 종료해야 한다.

이러한 요소들이 특정 상황에서 어떤 행동이 합리적인지를 결정한다. 지원 에이전트는 승인된 지식베이스에 충분한 근거가 있을 경우 일반적인 정책 질문에 답할 수 있다. 계정 분쟁에 누락된 기록이 있거나 에이전트의 권한을 벗어나는 경우, 상위 단계로 넘기는 것이 합리적인 선택이 된다. 따라서 최선의 행동은 이용 가능한 정보와 에이전트에게 허용된 범위에 따라 달라진다.

AI의 합리적 에이전트 유형

AI 시스템은 일반적으로 다섯 가지 에이전트 아키텍처를 사용한다: 단순 반사, 모델 기반 반사, 목표 기반, 효용 기반, 학습 에이전트. 각 아키텍처는 이용 가능한 정보로부터 행동을 선택하는 방식이 서로 다르다. 이 분류들은 전부를 아우르지도 않고 서로 배타적이지도 않다. 최신 LLM 기반 에이전트는 이 중 여러 방식을 하나의 워크플로 안에서 결합하는 경우가 많다.

일반적인 아키텍처결정 기준유용한 경우주요 한계
단순 반사현재 입력과 규칙작업 범위가 좁을 때숨겨진 상태를 무시함
모델 기반 반사입력과 내부 상태이력이 선택에 영향을 미침상태가 오래되어 유효하지 않을 수 있음
목표 기반목표를 향한 진행 상황에이전트가 계획을 세워야 함목표만으로는 트레이드오프의 우선순위를 정하지 못할 수 있음
효용 기반결과의 기대값가치나 위험이 다름점수를 설계하기 어려움
학습경험이 행동을 갱신함조건이 변함잘못된 피드백이 편차를 유발함

단순 반사 에이전트

제한된 범위의 지원 라우터는 승인된 결제 키워드가 포함된 메시지를 결제 대기열로 보낼 수 있다. 라벨이 명확하고 위험이 낮을 때는 이것이 합리적일 수 있다. 하지만 의미가 이력에 좌우되는 경우에는 어려움을 겪는다.

모델 기반 반사 에이전트

모델 기반 지원 에이전트는 세션 상태를 유지한다. 완료된 신원 확인을 기억해 실패한 단계를 반복하지 않을 수 있다. 상태 정보는 최신 메시지에 맥락이 부족할 때 도움이 되지만, 오래된 상태는 에이전트를 잘못된 방향으로 이끌 수도 있다.

목표 기반 에이전트

목표 기반 리서치 에이전트는 보고서 개요를 여러 질문으로 나누고, 출처를 살핀 뒤 부족한 부분을 수정한다. 목표가 도구 호출을 이끈다. 하지만 “보고서를 완성한다”는 목표만으로는 충분한 근거가 무엇인지, 속도와 출처의 깊이 중 무엇을 우선할지는 정의되지 않는다.

효용 기반 에이전트

여행 또는 조달 에이전트는 비용과 위험이 서로 다른 선택지들을 비교한다. 일정 적합성보다 정책 준수를 우선할 수 있으며, 특정 한도를 넘으면 승인을 요청한다. 여기서의 과제는 정당화할 수 있는 가중치를 부여하는 것이다.

학습 에이전트

지원 어시스턴트는 검토자가 어떤 제안된 답변을 승인하는지 학습할 수 있다. 추천 에이전트는 모든 클릭을 성공으로 간주하는 대신 명시적인 피드백을 활용할 수 있다. 학습은 피드백이 실제 목표를 대표하고 안전장치가 표류를 막아줄 때만 합리적으로 유지된다.

최신 LLM 에이전트는 이러한 요소들을 모두 혼합할 수 있다. “LLM 기반”이라는 이름표 자체가 합리성을 증명하지는 않으며, 성과 측정 지표와 통제 장치는 여전히 의도적인 설계를 필요로 한다.

합리적 에이전트 vs. 지능형 에이전트

“지능형 에이전트”는 어느 정도 자율적으로 행동하는 시스템을 포괄하는 넓은 범주다. “합리적 에이전트”는 성과 측정 지표에 상대적인 행동 선택에 초점을 맞춘다.

차원합리적 에이전트지능형 에이전트
주요 초점기대 성능자율 수행 능력
복잡도단순한 규칙을 사용할 수 있음자동화부터 고급 AI까지 범위가 다양함
핵심 판단 기준그 행동이 합리적이었는가?해당 작업을 수행할 수 있는가?
관계의사 결정 프레임워크시스템 분류

지능이 있다고 해서 목표가 건전하거나 행동이 안전하다는 것이 보장되지는 않는다. 코딩 에이전트는 유효한 코드를 생성하면서도 범위를 벗어난 수정을 할 수 있다. 리서치 에이전트는 근거가 약한 출처로부터 유려한 글을 작성할 수 있다. 합리성은 각 선택이 제약 조건 아래에서 정해진 작업에 실제로 부합했는지를 묻는다.

합리적 에이전트의 실제 사례

각 사례는 합리성을 전제하지 않고 환경, 관찰, 행동, 성과 측정 지표를 매핑한다.

AI 리서치 에이전트

이 에이전트의 환경에는 사용자 요청, 웹 콘텐츠, 제공된 파일이 포함됩니다. 지시사항과 수집한 근거가 관찰 대상입니다. 에이전트는 질의를 다듬거나, 소스를 검토하거나, 명확화를 요청하거나, 초안을 작성할 수 있습니다. 성능은 소스 품질과 과제 커버리지에 좌우되며, 요구된 형식에서의 사실적 정확성이 수용 기준이 됩니다. 근거가 상충할 경우 추가 검색이 정당화될 수 있습니다.

코딩 에이전트

코딩 에이전트는 프로젝트 지시사항과 도구 권한 안에서 저장소를 다룹니다. 소스 파일과 테스트 결과를 관찰합니다. 코드를 검색하거나, 편집하거나, 특정 테스트를 실행하거나, 위험한 작업에 대해 승인을 요청할 수 있습니다. 변경 사항은 관련 없는 동작을 바꾸지 않으면서 제시된 문제를 해결해야 합니다. 멈추기 전에 관련 검증을 통과해야 합니다.

고객 지원 에이전트

지원 에이전트는 대화, 승인된 지식, 계정 접근 범위 안에서 동작합니다. 메시지와 세션 상태를 관찰합니다. 정책을 조회하거나, 답변을 작성하거나, 세부 정보를 요청하거나, 상급 처리로 넘길 수 있습니다. 성능은 해결 품질과 정책 준수를 함께 평가합니다. 결정적인 기록이 없을 때는 상급 처리로 넘기는 것이 합리적일 수 있습니다.

데이터 분석 에이전트

데이터 분석 에이전트는 비즈니스 질문과 데이터셋을 입력받습니다. 스키마와 도구 결과를 관찰합니다. 결측치를 확인하거나, 쿼리를 실행하거나, 차트를 만들거나, 근거가 부족한 결론을 거부할 수 있습니다. 성능은 분석의 정확성과 재현 가능성을 함께 평가합니다. 추세를 해석하기 전에 단위와 필터를 확인해야 합니다.

워크플로 에이전트

워크플로 에이전트는 여러 소프트웨어 도구에 걸친 프로세스를 조율합니다. 접수 기록과 상태 업데이트를 관찰합니다. 필드를 추출하거나, 초안을 준비하거나, 항목을 라우팅하거나, 승인을 위해 일시 정지할 수 있습니다. 성공은 올바른 상태 전환과 감사 가능성으로 정의됩니다. 사용 가능한 API 호출이 있다는 사실만으로 작업을 진행할 이유는 되지 않습니다.

다중 에이전트 리서치 시스템

워커들은 독립적인 리서치 질문을 받고, 코디네이터는 이들이 수집한 근거를 받습니다. 워커는 범위 내에서 검색하거나 분석합니다. 코디네이터는 재실행을 요청하거나, 충돌을 해결하거나, 종합하거나, 약한 갈래를 중단시킬 수 있습니다. 최종 정확성과 커버리지가 중요하지만, 중복 작업은 효용을 떨어뜨립니다. 에이전트 수가 늘어나는 것은 분해 방식이 예상 성능을 높일 때만 도움이 됩니다.

이러한 사례 전반에서 합리성은 도구 선택, 근거 요청, 승인 확인, 수정, 중단이라는 행동으로 드러납니다. 각 행동은 그 비용을 정당화할 만큼 예상 과제 성능을 향상시켜야 합니다.

합리적 에이전트 설계의 장점과 한계

이 프레임워크는 모호한 자율성을 명시적인 의사결정 모델로 전환하고, 워크플로의 한계를 명확하게 드러냅니다.

장점

  • 명확한 평가: 성능 척도가 있으면 성공 여부를 검증할 수 있습니다.

  • 추적 가능한 의사결정: 기록된 근거와 도구 호출이 조사에 도움이 됩니다.

  • 통제된 자율성: 제약 조건과 승인 지점이 행동을 제한합니다.

  • 트레이드오프 처리: 효용을 통해 경쟁하는 결과를 비교할 수 있습니다.

  • 유용한 중단: 임계값이 조기 답변이나 무한 반복을 줄여줍니다.

한계

  • 잘못된 목표: 대리 지표가 사용자의 실제 목표를 놓칠 수 있습니다.

  • 불완전한 정보: 근거가 부족하면 합당한 결정을 내릴 수 없습니다.

  • 모델 오류: LLM이 상태를 잘못 파악하거나 잘못된 도구를 선택할 수 있습니다.

  • 연산 제약: 근사 계산으로 더 나은 선택지를 놓칠 수 있습니다.

  • 책임 공백: 영향이 큰 작업은 여전히 담당자와 사람의 검토가 필요합니다.

Kimi Agent 소개: 지식을 완성된 작업으로

Kimi Agent는 LLM 기반의 합리적 에이전트가 지식 집약적 작업을 어떻게 처리할 수 있는지 보여줍니다. 원하는 결과를 알려주면 필요한 단계를 내장 도구로 완료하기 전에 작업을 계획할 수 있습니다. 별도의 오케스트레이션 계층을 구축하지 않고도 주제를 조사하거나, 소스 자료를 처리하거나, 편집 가능한 결과물을 만드는 데 활용할 수 있습니다.

소스 지식을 작업에 반영하기

Kimi는 최대 50개의 파일을 업로드할 수 있으며, 파일당 용량 제한은 100MB입니다. PDF와 일반적인 오피스 문서를 다룰 수 있습니다. 이미지, TXT 파일, 동영상은 추가적인 맥락을 제공할 수 있습니다.

이러한 자료는 에이전트의 작업 환경의 일부가 됩니다. 프롬프트가 원하는 결과를 정의하고, 업로드한 파일은 그 작업을 완료하는 데 필요한 지식을 제공합니다.

연구 결과를 편집 가능한 결과물로 만들기

Kimi Agent는 정보 수집에서 곧바로 사용 가능한 결과물 생성으로 이어질 수 있습니다:

  • 심층 연구: 근거 자료를 바탕으로 구조화된 보고서를 작성합니다.

  • 웹사이트: 간단한 개요만으로 실제로 동작하는 다중 페이지 웹사이트를 구축합니다.

  • 프레젠테이션: 원본 자료를 바탕으로 편집 가능한 PPT를 생성합니다.

  • 문서 및 스프레드시트: 정보를 실용적인 작업 결과물로 정리합니다.

작업이 채팅 응답으로 끝날 필요는 없습니다. Kimi Agent는 수집한 정보를 동일한 워크플로 안에서 편집 가능한 결과물로 바꿀 수 있습니다.

Kimi Agent Swarm으로 더 큰 작업 확장하기

Kimi Agent Swarm은 큰 목표를 독립적인 작업 흐름으로 나눌 수 있습니다. 하위 에이전트들은 각자 다른 연구 질문이나 일괄 작업 항목을 처리한 뒤 결과를 통합합니다.

이러한 방식은 대규모 검색, 장문 작성, 일괄 작업에 적합합니다. 병렬 실행은 각 갈래가 독립적으로 진행될 수 있을 때 가장 유용합니다. 각 단계가 앞선 결과의 검증에 의존하는 경우에는 순차 실행이 여전히 더 낫습니다.

합리적 에이전트를 평가하는 방법

설계와 테스트 과정에서 이 체크리스트를 활용하세요. 최종 산출물뿐 아니라 의사 결정 과정도 함께 살펴봐야 합니다.

  • 성과 지표: 성공을 제대로 나타내면서도 제약 조건을 지키고 있는가?

  • 관찰 가능성: 에이전트가 인지할 수 있는 조건은 무엇인가?

  • 지식: 사전 지식이 적절하고 최신인가?

  • 행동: 필요한 작업이 권한 범위 내에서 이루어질 수 있는가?

  • 불확실성: 근거가 약할 때 확인이나 상위 보고로 이어지는가?

  • 자원: 예산이 작업의 위험 수준에 맞는가?

  • 사람의 검토: 되돌릴 수 없는 행동은 누가 승인하는가?

  • 로깅: 검토자가 선택과 결과를 다시 파악할 수 있는가?

  • 정지 조건: 성공, 제한된 실패, 또는 상위 보고 이후 실행이 멈추는가?

연구 에이전트에게 서로 상충하는 자료를 주고 더 나은 근거를 찾으려 하는지 확인하세요. 코딩 에이전트에게 실패한 명령을 주고 다시 수정하기 전에 원인을 진단하는지 확인하세요. 맥락이 부족한 지원 에이전트는 세부 사항을 지어내는 대신 정보를 요청해야 합니다.

반복되는 검색, 무시된 오류, 근거 없는 주장, 승인 위반, 또는 이른 중단을 측정하세요. 도구 호출이 실패했다고 해서 에이전트가 비합리적이라고 단정할 수는 없습니다. 에이전트가 이를 인식하고 적절히 회복한다면 문제가 되지 않습니다. 정지 기준이 품질과 자원 사용 사이의 균형을 맞추고 있는지 테스트하세요.

결론

합리적 에이전트란 현실적인 제약 아래 주어진 근거로부터 행동을 선택하는 의사 결정 체계입니다. 현대의 LLM 기반 에이전트에서 행동에는 도구 호출, 근거 요청, 승인 확인, 수정, 또는 의도적인 중단이 포함됩니다. 연구 에이전트와 코딩 에이전트뿐 아니라 지원 워크플로나 다중 에이전트 시스템도 이 체계를 활용할 수 있습니다. 어떤 에이전트도 기본적으로 합리적이지는 않습니다. 합리성은 목표, 관찰, 권한, 평가, 그리고 적절한 정지 정책에 따라 달라집니다.

자주 묻는 질문

AI에서 합리적 에이전트란 무엇인가요?
정의된 성과 척도를 최대화할 것으로 예상되는 실행 가능한 행동을 선택합니다. LLM 워크플로에서는 도구 호출, 명확화 요청, 수정, 에스컬레이션, 또는 중지가 이에 해당할 수 있습니다. 합리성은 성공을 보장한다는 뜻이 아니라 정당화 가능한 선택을 의미합니다.
합리적 에이전트의 주요 구성 요소는 무엇인가요?
핵심 구성 요소는 성과 척도와 관측(observation)입니다. 시스템에는 가능한 행동과 함께 선택 과정도 필요합니다. PEAS는 성과 척도(Performance measure), 환경(Environment), 행동유발기(Actuators), 센서(Sensors)를 설명합니다. 최근 설계에는 권한과 중지 규칙도 추가됩니다.
AI에서 합리적 에이전트의 예시는 무엇인가요?
AI 리서치 에이전트는 사용자 브리프와 수집된 자료를 관측합니다. 검색, 파일 검토, 초안 작성, 또는 명확화 요청을 할 수 있습니다. 이 선택이 예산 내에서 근거 품질이나 작업 커버리지를 개선해야 할 때 합리적이라고 할 수 있습니다.
합리적 에이전트의 다섯 가지 유형은 무엇인가요?
일반적인 아키텍처는 단순 반사(simple reflex), 모델 기반 반사(model-based reflex), 목표 기반(goal-based), 유틸리티 기반(utility-based), 학습(learning) 에이전트입니다. 최근의 LLM 에이전트는 이러한 유형을 여러 개 결합하는 경우가 많습니다.
합리적 에이전트는 항상 정확한가요?
아닙니다. 불완전한 근거나 도구 오류로 인해 합리적인 선택 후에도 결과가 좋지 않을 수 있습니다. 에이전트가 무엇을 알고 있었는지, 무엇을 할 수 있었는지, 그리고 왜 그 행동을 선택했는지를 평가해야 합니다.
합리적 에이전트와 지능형 에이전트의 차이는 무엇인가요?
지능형 에이전트는 광범위한 능력 범주입니다. 합리적 에이전트는 성과 척도에 따라 행동을 선택합니다. 유창함만으로는 합리성이 증명되지 않습니다.
LLM도 합리적 에이전트가 될 수 있나요?
LLM은 합리적 에이전트 시스템 내에서 추론할 수 있습니다. 시스템에는 목표, 관측, 행동, 제약 조건, 평가, 중지 규칙도 필요합니다. 도구 접근 권한만으로는 그 선택이 합리적이라고 할 수 없습니다.
다음도 마음에 드실 수 있습니다
AI의 지식 기반 에이전트: 아키텍처와 활용 사례
AI의 지식 기반 에이전트: 아키텍처와 활용 사례
2026-08-14