Community Edition 받기자동화 기능을 완비한 클라우드 Community Edition으로 지금 자동화를 무료로 시작하세요.
주요
2026년 RPA 부문 Gartner® Magic Quadrant™ 리더로 선정되었습니다.8년 연속 리더로서 그 가치를 인정받았습니다 보고서 다운로드 보고서 다운로드
Event
Get ready for Imagine 2026
From agentic AI to end‑to‑end automation, be a part of the flagship event where our community gathers to build, learn, and lead. Register today
Countdown
기업이 자율 기업 에이전트를 빠르게 도입하고 있으나 그 성과를 측정하는 능력은 그에 못 미칩니다. 2027년 말에 이르면 에이전트 AI 프로젝트의 40% 이상이 비용 상승, 불분명한 비즈니스 가치 및 미흡한 위험 관리로 인해 취소될 것입니다. 이처럼 프로젝트가 취소되는 상황에서 나타나는 패턴은 일관적입니다. 바로 테스트에서 높은 점수를 받은 에이전트가 실제 운영 환경에서는 예측 불가능한 행동을 보인다는 것입니다.
핵심이 되는 문제는 측정입니다. 표준 벤치마크는 한계에 도달하거나 조작이 가능하거나 기업이 실제로 운영하는 안전한 맞춤형 워크플로와의 관련성이 떨어지고 있습니다. 공개 리더보드에서 높은 점수를 받는다고 해서 에이전트가 실제 데이터에 대해 수천 번의 반복 실행을 거쳐도 안정적으로 작동할 것이라 예측하기는 어렵습니다.
Automation Anywhere는 두 가지 방식으로 이 문제에 접근했습니다. 첫째는 업계 표준 공개 벤치마크에서 1위를 차지하는 것, 둘째는 공개 벤치마크로는 측정할 수 없는 독자적인 엔터프라이즈 AI 평가 및 운영 메모리 아키텍처를 구축하는 것이었습니다. 이 가이드에서는 두 가지 접근 방식을 모두를 다룹니다. 먼저 해당 분야의 현황부터 살펴보겠습니다.
2026년 기준 대부분의 에이전트 평가는 소수의 공개 벤치마크를 통해 이루어집니다. 각각의 테스트로 에이전트 신뢰성에 관한 실질적인 요인을 검증하지만 각 테스트에는 엔터프라이즈 배포에 영향을 미치는 중요한 사각지대도 있습니다.
알아두어야 할 주요 공개 벤치마크
언어 모델 벤치마크는 자동 채점 시스템과 결합된 고정된 태스크의 집합입니다. 조달 관련 논의에서 가장 크게 다루는 에이전트 중심 벤치마크는 다음과 같습니다.
이러한 벤치마크는 원시 처리 능력을 비교하는 데 유용합니다. 그러나 이 중 개별 조직의 스키마나 도구, 규정 준수 규칙을 테스트하도록 구축된 벤치마크는 없습니다.
표준 지표는 결과를 나타내며, 그 예로는 완료율(완전히 해결된 태스크의 비율), 의도 해결률(에이전트가 사용자가 원하는 바를 정확히 파악했는지 여부), 맥락 유지율(장시간의 상호 작용에 걸쳐 관련 정보를 유지했는지 여부) 등이 있습니다.
문제는 결과 지표를 부풀리는 것이 점점 더 쉬워지고 있다는 점입니다. 2026년 4월, 한 자동화된 에이전트가 작업을 추론하는 것이 아닌 평가 인프라의 결함을 악용하여 단 하나의 태스크도 해결하지 않고 8개의 주요 벤치마크 중 7개에서 100% 또는 100%에 가까운 점수를 기록했습니다. SWE-bench Verified에서는 단일 테스트 구성 파일의 약 10줄을 편집하자 500개의 테스트를 모두 통과할 수 있었습니다.
독립적인 분석에서도 에이전트 성능이 단일 실행 시 60%였던 것이 8회 연속 실행 시 25%까지 떨어질 수 있으며, 스캐폴딩만으로도 정확도가 모델 세대 간 격차보다 더 크게 변동되는 것으로 나타났습니다.
이 같은 결과가 기업에 시사하는 바는 리더보드 점수는 방향성을 보여주는 지표일 뿐 신뢰성을 보장하지는 않는다는 점입니다.
결과가 조작될 수 있다면 평가 시 에이전트가 그 결과에 어떻게 도달하는지를 살펴봐야 합니다. 이는 두 가지를 동시에 측정한다는 의미입니다. 즉, 에이전트가 태스크를 완료했는지 여부(태스크 완료율, 기능적 정확성이라고도 함)와 에이전트가 결과에 도달하기 위해 적절하고 감사 가능한 추론 경로를 따랐는지 여부(경로 정확도)를 모두 측정합니다.
단편적인 성공이란 잘못된 프로세스를 통해 에이전트가 도구 매개변수를 추측하거나 중복된 API 호출을 하거나 환각을 일으켜 그럴듯한 결과를 도출함으로써 정답에 도달하는 경우를 말합니다.
태스크 완료만을 기준으로 하는 지표에서 이는 성공한 것처럼 보입니다. 하지만 실제 운영 환경에서는 문제가 됩니다. 논리가 타당하지 않아 감사에 실패하고 중복 호출이 늘어날 때마다 API 비용이 상승하며 지연 시간도 증가하기 때문입니다.
게다가 이는 보기 드문 예외 케이스도 아닙니다. Automation Anywhere의 평가 연구에 따르면 단편적인 성공 패턴은 복잡한 다단계 에이전트 유형에서 이루어지는 실행 중 40% 이상에서 나타났습니다.
Pass^k 점수(pass-k로도 표기)는 일관성을 측정합니다. Pass^1은 에이전트가 태스크를 한 번 완료하는지 여부를 기록합니다. Pass^4는 새로운 상태에서 시작한 4개의 독립적인 실행에 걸쳐 동일한 태스크를 올바르게 완료해야 합니다. 이 둘 사이의 격차가 바로 운영 위험이 존재하는 지점입니다. 한 번 통과하는 것은 운일 수 있지만 네 번 연속으로 통과하는 것은 신뢰할 수 있음을 나타냅니다.
하루에 수백 번 동일한 워크플로를 실행하는 자율 기업 에이전트에게는 pass^4가 중요한 수치입니다.
공개 벤치마크에는 한계가 있지만 엄격한 벤치마크에서 우수한 성과를 내는 것은 그래도 의미가 있습니다. τ-bench는 도구를 사용하는 에이전트를 대상으로 하는 공개된 기준 중 가장 까다로운 기준에 속합니다.
전체 엔터프라이즈 메모리 계층이 아니라 경량 컨텍스트 스캐폴딩으로 실행되는 Automation Anywhere의 기본 에이전트 aa-agent-v1은 제출 시점(2026년 5월)에 총 375개 태스크와 4개 서비스 도메인 전반에서 종합 1위를 차지했습니다.
이 에이전트는 pass^1에서 74.5%를 달성했으며 이는 다음으로 우수한 공개 시스템보다 4.3포인트 높은 수치로, Qwen3.5, GPT-5.2, Claude Opus 4.5, Gemini 3 Pro를 앞섰습니다. 이러한 격차가 pass^2(+4.8), pass^3(+4.3), pass^4(+4.1)에서도 유지됨에 따라 이 결과가 단일 실행에서만 나타난 결과가 아닌 구조적인 특징에서 비롯됐음을 알 수 있습니다.
성공률 수준 | AA 기본 에이전트 | 리더보드 1위 | 격차 |
|---|---|---|---|
pass^1 | 74.50% | 70.20% | +4.3포인트 |
pass^2 | 67.90% | 63.10% | +4.8포인트 |
pass^3 | 63.60% | 59.30% | +4.3포인트 |
pass^4 | 60.30% | 56.20% | +4.1포인트 |
τ-bench 성공률 수준 결과 375개 태스크와 4개 서비스 도메인에 걸쳐 통합됨(출처: Automation Anywhere AI 에이전트 벤치마크 보고서 2026)
엔터프라이즈 IT에서 느린 에이전트는 사용할 수 없는 에이전트입니다. 네 개의 도메인 전반에서 Automation Anywhere 기본 에이전트는 경쟁력 있는 정확도를 자랑했으며 네 개 도메인 중 세 개에서 더 빠른 실행 속도를 보였습니다. 예를 들어, 소매 부문에서는 최대 3.2배(703초 대비 223초), 은행 부문에서는 2.7배, 통신 부문에서는 2.6배 더 빠른 실행 속도를 보였습니다. 항공 부문은 예외적으로 1.6배 더 느린 속도로 실행되었으나 정확도는 가장 높았습니다.
은행 부문 참고 사항: 추론 품질이 아닌 검색 지연 시간이 제약 조건이므로 모든 경쟁사 전반에서 절대 점수가 낮습니다. 이러한 병목 현상을 해결하기 위해 운영 메모리 계층이 설계되었습니다.
도메인 | AA 점수 | 선두업체 대비 | 실행 속도 | 순위 |
|---|---|---|---|---|
항공 | 84.50% | +0.5포인트 | 1.6배 느림 | #1 |
소매 | 82.90% | −1.5포인트 | 3.2배 빠름 | #2 |
통신 | 98.20% | +0.4포인트 | 2.6배 빠름 | #1 |
은행 | 31.70% | +0.5포인트 | 2.7배 빠름 | #1 |
도메인별 τ-bench 결과: 리더보드 선두 대비 정확도 및 실행 속도(출처: Automation Anywhere AI 에이전트 벤치마크 보고서 2026)
실제 엔터프라이즈 환경을 시뮬레이션하려면 조직의 표준 운영 절차, 워크플로 정의, 도메인 정책 검증과 같은 독점 데이터가 필요합니다. 정의에 따르면 공개 벤치마크는 이러한 데이터를 제공할 수 없습니다.
Automation Anywhere의 독자적인 평가 제품군인 GBA-Bench는 이러한 엔터프라이즈 자료를 토대로 구축되었으므로 에이전트가 공개 태스크에서 엔터프라이즈 태스크로 전환될 때 어떻게 행동하는지를 보여줄 수 있습니다.
GBA-Bench는 은행, 보험, 의료, 공급망, 영업, 재무 및 공급업체 온보딩의 7개 엔터프라이즈 분야를 아우르며, 30개 이상의 최첨단 모델을 평가했습니다. 테스트 대상 모델은 주요 제품군인 Anthropic, OpenAI, Google, Meta, Qwen, DeepSeek, Mistral 및 Zhipu/GLM에서 선정되었습니다(출처: Automation Anywhere AI 에이전트 벤치마크 보고서 2026).
실제 SOP와 비교하면 모델 간 격차가 더욱 분명해집니다. 공개 평가에서 높은 점수를 기록한 경쟁 모델도 엔터프라이즈 워크플로에서 단편적인 성공률이 높게 나타날 수 있으며, 이는 취약한 추론을 통해 올바른 결과를 도출했음을 의미합니다.
컨텍스트 인텔리전스가 적용된 Automation Anywhere의 에이전트의 경우 이러한 태스크에서 경로 정확도가 20~47%p 향상되고 목표 완료율이 최대 32%까지 증가합니다. 점수 산정에는 τ-bench 사람 평가 라벨 대비 0.99의 경로 일치도에 맞춰 보정된 LLM-as-judge 평가 도구가 사용됩니다.
성능이 뛰어난 기본 에이전트라도 이전 실행에 대한 기억 없이 매번 태스크를 시작하면 실행할 때마다 동일하게 잘못된 도구 호출과 매개변수 오류를 반복하게 됩니다. 이러한 무상태성은 모델 품질의 문제가 아니라 아키텍처적 한계이며, 이로 인해 반복적인 엔터프라이즈 업무에 대한 기본 제공 에이전트의 신뢰성에 한계가 생깁니다.
신뢰성 격차를 해소한다는 것은 에이전트에 구조화된 운영 메모리를 제공하는 것을 의미합니다.
PRE(프로세스 추론 엔진)는 그러한 메모리를 위한 인프라를 제공합니다. 매번 실행이 끝날 때마다 성공적인 실행은 재사용 가능한 패턴으로 보존되고 불완전한 실행은 큰 영향을 미치는 몇 가지 교훈으로 정리됩니다. 후속 실행에서는 가장 관련성 높은 과거 경험이 검색되어 실행이 시작되기 전에 적용되므로 에이전트가 동일한 실수를 반복하지 않게 됩니다. 이 점이 매번 AI 추론을 처음부터 다시 도출하는 에이전트와 사용에 따라 개선되는 에이전트 사이의 차이점입니다.
GBA-Bench에서 테스트한 결과 메모리 증강 에이전트를 통해 경로 정확도가 20~47%p 높아졌으며 목표 완료율은 최대 32%p 향상됐습니다. 가장 대표적인 케이스는 고객 이탈 방지 에이전트로, 경로 정확도가 0.12에서 0.59로 상승했으며(약 4.9배 향상), 올바른 경로를 따르는 비율이 12%에 불과했던 워크플로를 신뢰할 수 있는 워크플로로 전환했습니다. 컨텍스트 기반 에이전트는 복잡한 워크플로에서도 도구 호출을 약 20% 줄여 비용과 지연 시간을 모두 절감했습니다.
운영 메모리의 성능은 입력되는 신호의 품질로 결정됩니다. 저장된 모든 메모리에는 LLM-as-judge 평가 도구가 부여하는 정확한 품질 점수가 있어야 합니다. 이 점수가 없으면 에이전트는 자신의 실패 경험을 학습하며 잘못된 패턴을 고착시킵니다. 메모리를 배포한 후가 아니라 배포하기 전에 평가 파이프라인을 구축하세요.
메모리와 고급 평가 기능은 기준 경로 정확도가 0.70 미만이거나, 도구 매개변수 변동성이 높거나, 초기 오류가 연쇄적으로 누적되는 긴 다단계 태스크를 포함한 워크플로 등 개선의 여지가 있는 영역에서 가장 큰 효과를 발휘합니다. 높은 성과를 내는 단일 도구 태스크에서는 개선의 여지가 적습니다.
실제 운영 환경에서는 실측 데이터 라벨이 있는 경우가 드물지만 과도한 도구 호출, 순환 논리, 재시도 루프와 같은 단편적인 성공의 징후를 모니터링할 수 있습니다. 도구 호출 효율성을 추적하면 API 비용과 지연 시간을 관리하고 성능 저하가 사용자에게 영향을 미치기 전에 이를 파악할 수 있습니다.
신뢰할 수 있는 엔터프라이즈 에이전트 AI는 엄격한 공개 벤치마크로 검증된 강력한 기본 에이전트(τ-bench에서 1위), 실제 엔터프라이즈 워크플로를 반영하는 독자적 평가(GBA-Bench), 시간이 지남에 따라 실행을 개선하는 품질 필터링이 적용된 운영 메모리(PRE + 컨텍스트 인텔리전스)라는 명확한 원칙을 따릅니다.
이러한 요소를 함께 활용하여 공개 벤치마크 결과와 실제 운영 환경 시스템 사이의 엔터프라이즈 격차를 해소함으로써 에이전트 프로세스 자동화를 실현합니다.
전체 방법론과 실험 데이터, 30개 이상의 최첨단 모델에 대한 리더보드 결과를 확인하려면 당사의 AI 에이전트 벤치마크 보고서 2026을 읽어보세요. 실제 운영 환경에서 당사의 자동화 에이전트가 이러한 원칙을 어떻게 적용하는지 확인하려면 라이브 데모를 예약해 보세요.
τ-bench는 pass^k 신뢰성 지표를 채택하고 있으므로 도구를 사용하는 에이전트에 대해 가장 엄격한 벤치마크 중 하나입니다. AgentBench(다양한 환경)와 WebArena(웹 탐색), SWE-bench(소프트웨어 엔지니어링)가 핵심 세트를 구성합니다. 각 지표가 서로 다른 역량을 측정하므로 단일한 신뢰성 점수는 존재하지 않습니다.
태스크 완료율 그 이상을 살펴보세요. 기능적 정확성(목표 달성), 도구 사용 및 탐색(데이터베이스, 브라우저, API), 안전성과 신뢰성(유해한 행동에 대한 가드레일), 코딩 태스크만이 아니라 복잡한 워크플로에서의 실제 적용 가능성을 평가하세요. 경로 정확도는 이를 서로 연결합니다.
핵심 지표로는 완료율(완전히 해결된 태스크의 비율), 의도 해결률(사용자 목표를 정확히 파악했는지 여부), 다단계 태스크의 완료율, 장시간의 상호 작용에 걸친 맥락 유지율이 있습니다. 2026년에는 이러한 성과 지표와 함께 경로 측정 지표가 더 필요해질 것입니다.
2026년 5월 제출 결과에서 1위를 차지한 경량 컨텍스트 스캐폴딩을 갖춘 기본 에이전트 아키텍처(aa-agent-v1)는 다중 턴 태스크와 일관된 도구 사용에서 탁월한 성능을 보였습니다. 단순히 강력한 모델이 아니라 강력한 아키텍처가 결과를 이끌어냅니다.
제출 시점인 2026년 5월 기준, 기본 에이전트는 pass^1 단계에서 74.5%를 기록하며 +4.3 포인트 차이로 선두를 달렸고 까다로운 pass^4 단계까지 그 선두를 유지했습니다(출처: Automation Anywhere AI 에이전트 벤치마크 보고서 2026). 또한 4개 도메인 중 3개 도메인에서 리더보드 비교 결과보다 더 빠르게 실행되었으며, 소매 부분에서는 최대 3.2배 더 빠른 실행 속도를 보였습니다.
경로 정확도는 에이전트가 단순히 정답에 도달했는지가 아니라 올바르고 감사 가능한 추론 경로를 따랐는지를 측정합니다. 이는 규모가 커지면 무너지는 취약하거나 비효율적이거나 위험한 단계를 거쳐 올바른 결과를 도출하는 '단편적인 성공'이라는 문제를 포착합니다.
구조화된 운영 메모리를 통해 에이전트는 과거 실행에서 얻은 교훈을 추출하여 새로운 실행에 적용함으로써 반복되는 매개변수 오류와 유효하지 않은 도구 호출을 없앨 수 있습니다. 복잡한 엔터프라이즈 워크플로에서 이는 목표 달성과 경로 정확도를 크게 향상하는 동시에 불필요한 도구 호출을 줄여줍니다.