Blog

AI エージェント ベンチマークの概要

自律型エンタープライズ エージェントの企業導入は、その性能を測定する能力を上回る勢いで進んでいます。 40% を超えるエージェント AI プロジェクトが、2027 年末までに、コストの増大、ビジネス価値の不明確さ、不十分なリスク管理を理由に中止されると予測されています。 このように中止に至るパターンは一貫しています。テストでは良好な結果を出すエージェントが、本番環境では予測不能な動作をするというものです。

根本的な問題は、測定方法にあります。 標準的なベンチマークは、高得点化が進んでいるほか、攻略可能になっていたり、企業が実際に運用しているセキュアなカスタム ワークフローとはかけ離れていたりします。 公開スコアボードで高いスコアを獲得していても、実データに対する何千回もの反復実行を通じてエージェントが安定して機能し続けるかどうかを予測できることは、ほとんどありません。

オートメーション・エニウェアは、この課題に 2 つの方向から取り組んできました。1 つは、業界標準の公開ベンチマークで第 1 位にランク インすること、もう 1 つは、公開ベンチマークでは測定できない、独自の企業向け AI 評価システムと運用メモリ アーキテクチャを構築することです。 このガイドでは、まずこの分野の現状について解説したうえで、これら 2 つの取り組みについて説明します。

AI エージェント ベンチマークの現状

2026 年のエージェント評価の多くは、少数の公開ベンチマークを通じて行われています。 それぞれがエージェントの信頼性に関する実際の要素を評価するものですが、そのいずれも、企業での導入に影響を及ぼす、無視できない欠点があります。

知っておくべき主要な公開ベンチマーク

言語モデル ベンチマークは、固定された一連のタスクと、自動採点システムを組み合わせたものです。 エージェントを対象とするベンチマークのうち、調達に関する議論で主流となっているのは、次のものです。

  • AgentBench: オペレーティング システムからデータベースまで、多様な環境にわたってエージェントを評価します。
  • WebArena: 現実的なブラウザ環境下で、複数ステップにわたる Web ナビゲーションをテストします。
  • SWE-bench: 実際の GitHub の課題に対するソフトウェア エンジニアリング能力を測定します。そのうち Verified サブセットは、エンジニアによってレビューされた 500 件のタスクで構成されています。
  • MedAgentBench: 臨床および医療ワークフローのタスクでエージェントを評価します。
  • τ-bench (tau-bench): ツール、エージェント、ユーザー間のやり取りをテストします。エージェントは、模擬ユーザーと作業する際に、各分野のポリシーに従わなければなりません。

これらのベンチマークは、純粋な性能を比較するうえで有用です。 しかし、いずれも個々の組織のスキーマ、ツール、またはコンプライアンス規則を評価するために構築されたものではありません。

一般的な指標と 2026 年の評価危機

標準的な指標は、成果を示すものです。たとえば、成功率 (完全に解決されたタスクの割合)、意図解決率 (エージェントがユーザーの求めるものを正しく特定したかどうか)、およびコンテキスト保持率 (長時間のやり取りを通じて関連情報を保持できたかどうか) などがあります。

問題は、成果指標がますます水増ししやすくなっていることです。 2026 年 4 月、ある自動化されたエージェントは、タスクを 1 つも解決することなく、8 つの主要ベンチマークのうち 7 つで 100%、または 100% に近いスコアを記録しました。これは、推論によって作業を進めるのではなく、評価基盤の欠陥を悪用した結果です。 SWE-bench Verified では、単一のテスト設定ファイル内の約 10 行を編集しただけで、500 件すべてのテストが合格になりました。

また、独立した分析によると、エージェントの性能は単一の実行では 60% だったものの、8 回連続の実行では 25% まで低下する場合があることも判明しています。スキャフォールディングだけでも、モデル世代間の差を上回るほど精度が変動します。

企業にとっての要点は、スコアボードのスコアは方向性を示す指標であり、信頼性を保証するものではないということです。

新しい評価フレームワーク: タスク成功率と軌跡精度

結果が操作可能であるなら、評価では、エージェントがどのようにその結果に到達したかを検証する必要があります。 つまり、2 つのことを同時に評価するということです。1 つは、エージェントがタスクを完了したかどうか (タスク成功率、または機能的正確性と呼ばれます)、もう 1 つは、そこに至るまでに監査可能な正しい推論経路をたどったかどうか (軌跡精度) です。

「場当たり的な成功」の危険性

場当たり的な成功とは、エージェントがツールのパラメーターを当て推量で設定したり、冗長な API 呼び出しを行ったり、ハルシネーションによってもっともらしい結果にたどり着いたりすることで、誤ったプロセスを通じて正しい答えに到達することを指します。

成功だけを評価する指標では、これは成功に見えます。 しかし、本番環境では負債となります。推論を正当化できないため監査に合格できず、冗長な呼び出しのたびに API コストが増加し、遅延も大きくなります。

しかも、これはまれな例外ケースではありません。 オートメーション・エニウェアの評価調査によると、複雑な複数ステップのエージェント タイプにおける実行の 40% 以上で、「場当たり的な成功」パターンが見られました。

CTO にとって pass-k スコアリングが重要な理由

pass^k スコアリング (pass-k とも表記) は、一貫性を測定します。 pass^1 は、エージェントがタスクを 1 回完了したかどうかを記録します。 pass^4 では、初期状態からの独立した 4 回の実行において、同じタスクを正しく完了することが求められます。 これらのスコアの差に、本番運用のリスクが表れます。1 回成功するのは偶然かもしれませんが、4 回連続で成功することは、信頼性の証となります。

同じワークフローを 1 日に何百回も実行する自律型エンタープライズ エージェントにとって、重要なのは pass^4 の値です。

τ-bench スコアボード: ベース エージェントの性能を検証

公開ベンチマークには限界がありますが、厳格なベンチマークで良好な成績を収めることには、依然として意義があります。τ-bench は、ツールを使用するエージェントを対象とした公開ベンチマークの中でも、最も難易度の高いものの 1 つです。

すべての pass レベルで第 1 位

オートメーション・エニウェアのベース エージェントである aa-agent-v1 は、完全なエンタープライズ メモリ レイヤーではなく、軽量なコンテキスト スキャフォールディングで動作しており、提出時点 (2026 年 5 月) において、全 375 タスクと 4 つのサービス分野を通じて総合第 1 位にランクしています。

pass^1 では 74.5% に達しており、次点の公開システムを 4.3 ポイント上回り、Qwen3.5、GPT-5.2、Claude Opus 4.5、Gemini 3 Pro を上回っています。 この優位性は構造的なものであり、単一の実行による一時的な現象ではありません。この差は pass^2 (+4.8)、pass^3 (+4.3)、pass^4 (+4.1) でも維持されています。

pass レベル

AA ベース エージェント

リーダーボード #1

pass^1

74.50%

70.20%

+4.3 ポイント

pass^2

67.90%

63.10%

+4.8 ポイント

pass^3

63.60%

59.30%

+4.3 ポイント

pass^4

60.30%

56.20%

+4.1 ポイント

τ-bench の pass レベル別結果。375 件のタスクと 4 つのサービス分野にわたって集計したもの (出典: オートメーション・エニウェアの 2026 年 AI エージェント ベンチマーク レポート)。
 

実行速度と分野別内訳

エンタープライズ IT において、処理の遅いエージェントは実用的ではありません。 4 つの分野全体において、オートメーション・エニウェアのベース エージェントは競合他社に引けを取らない精度を維持しながら、4 つの分野のうち 3 つでより高速に処理を実行しています。小売分野では最大 3.2 倍 (223 秒に対して 703 秒)、銀行分野では 2.7 倍、通信分野では 2.6 倍高速です。 航空分野は例外であり、実行速度は 1.6 倍遅いものの、精度ではトップを維持しています。

銀行分野について補足すると、すべての競合他社において絶対スコアは低くなっています。これは、推論の質ではなく、検索の遅延が性能を制約する要因となっているためです。 運用メモリ レイヤーは、まさにこのボトルネックに対処するよう設計されています。

 

ドメイン

AA スコア

首位との差

実行速度

ランク

航空

84.50%

+0.5 ポイント

1.6 倍遅い

#1

小売

82.90%

−1.5 ポイント

3.2 倍速い

#2

電気通信

98.20%

+0.4 ポイント

2.6 倍速い

#1

銀行

31.70%

+0.5 ポイント

2.7 倍速い

#1

τ-bench の分野別結果: スコアボード首位との精度および実行速度の比較 (出典: オートメーション・エニウェアの 2026 年 AI エージェント ベンチマーク レポート)。

公開ベンチマークだけでは企業における有用性を検証しきれない理由

GBA-Bench (Goal-Based Agents Benchmark) の概要

実際の企業環境をシミュレートするには、組織の標準業務手順書、ワークフロー定義、および分野固有のポリシー検証の仕組みなど、独自のデータが必要です。 公開ベンチマークは、定義上、こうしたデータを提供できません。

GBA-Bench は、オートメーション・エニウェア独自の評価スイートであり、このような企業の資料に基づいて構築されています。これにより、公開タスクから企業のタスクに移行した際に、エージェントの動作がどのように異なるかを示すことができます。

GBA-Bench は、銀行、保険、医療、サプライ チェーン、営業、財務、ベンダー オンボーディングに及ぶ 7 つの企業分野を対象とし、30 を超える最先端モデルを評価しています。 評価対象のモデルは、Anthropic、OpenAI、Google、Meta、Qwen、DeepSeek、Mistral、Zhipu/GLM など、主要なファミリーをすべて網羅しています (出典: オートメーション・エニウェアの 2026 年 AI エージェント ベンチマーク レポート)。

GBA-Bench による企業での実用性チェック

実際の SOP と照らし合わせると、モデルの間の差がより明確になります。 高い公開スコアを示す競合モデルであっても、企業のワークフローにおいては場当たり的な成功の発生率が高くなり、不安定な推論を通じて正しい結果が導き出されることがあります。

コンテキスト インテリジェンスを組み込むことで、オートメーション・エニウェアのエージェントは、これらのタスクにおいて軌跡精度が 20 ~ 47 ポイント向上し、目標達成率が最大 32% 向上します。 スコアリングでは LLM-as-a-judge 評価システムを使用し、τ-bench の人間によるラベルに対して軌道一致が 0.99 になるよう調整されています。

ステートレス エージェントの限界

強力なベース エージェントであっても、過去の実行内容を一切記憶せずにすべてのタスクを開始してしまうと、実行のたびに同じ無効なツール呼び出しや同じパラメーター エラーを繰り返すことになってしまいます。 このステートレス性は、モデル品質の問題ではなく、アーキテクチャ上の制約です。そのため、標準構成のままのエージェントが、反復的な企業業務で実現できる信頼性には限界があります。

アーキテクチャの修正: PRE とコンテキスト インテリジェンス

信頼性のギャップを埋めるには、構造化された運用メモリをエージェントに与える必要があります。

構造化された運用メモリの追加

プロセス推論エンジン (PRE) は、この運用メモリを実現するための基盤を提供します。 各実行後、成功した実行は再利用可能なパターンとして保存され、不完全な実行からは、影響の大きい教訓がいくつか抽出されます。 その後の実行時には、最も関連性の高い過去の経験が検索され、実行開始前に適用されるため、エージェントは同じ誤りを繰り返さなくなります。 これは、AI による推論を毎回ゼロから再導出するエージェントと、使用を重ねるごとに改善していくエージェントとの違いです。

結果: 目標達成率が 32 パーセント ポイント向上

GBA-Bench でテストしたところ、メモリを拡張したエージェントでは軌跡精度が 20 〜 47 ポイント向上し、目標達成率は最大 32 ポイント上昇しました。 最も顕著な例は、顧客解約防止エージェントです。その軌跡精度は 0.12 から 0.59 へと向上し (約 4.9 倍の改善)、正しい経路をたどる割合がわずか 12% だったワークフローが、信頼性の高いものへと変わりました。 コンテキスト対応エージェントでは、複雑なワークフローにおけるツール呼び出しが約 20% 削減され、コストと遅延の両方が低減されました。

独自のエージェント システムをベンチマーク評価する方法

ステップ 1: 評価を後付けではなく、前提条件とする

運用メモリの性能は、入力されるシグナルの質によって決まります。 保存する各メモリには、LLM-as-a-judge 評価システムによる正確な品質スコアが必要です。これがなければ、エージェントは自らの失敗から学習し、誤ったパターンを強化してしまいます。 メモリを導入した後ではなく、導入する前に評価パイプラインを構築してください。

ステップ 2: 変動が大きく複数ステップからなるタスクを対象とする

メモリと高度な評価は、改善の余地がある領域で最も効果を発揮します。具体的には、ベースラインの軌道精度が 0.70 未満のワークフロー、ツール パラメーターの変動が大きい処理、初期のエラーが連鎖的に影響する長い複数ステップのタスクなどです。 改善の余地がほとんどない、単一ツールのタスクでは、効果はほとんど得られません。

ステップ 3: 継続的な軌跡監視を実施する

本番環境では、正解を示す基準データが用意されていることはほとんどありませんが、過剰なツール呼び出し、循環ロジック、再試行のループといった場当たり的な成功の兆候を監視できます。 ツール呼び出しの効率を追跡することで、API コストと遅延を抑制し、ユーザーに影響を及ぼす前に性能低下を検出できます。

まとめ: 信頼できる エンタープライズ AI へのロードマップ

信頼性の高い企業向けエージェント AI は、明確な方法論に基づいています。それは、厳格な公開ベンチマーク (τ-bench で第 1 位) で検証された強力なベース エージェント、実際の企業ワークフローを反映した独自の評価基盤 (GBA-Bench)、および品質評価によって選別された運用メモリによる実行性能の継続的な向上 (PRE + コンテキスト インテリジェンス) です。

これらを組み合わせることで、公開ベンチマークの結果と、エージェント プロセス オートメーション向けの本番環境対応システムとの間にある隔たりを埋めることができます。

詳細な方法論、実験データ、および 30 以上の最先端モデルを対象とした GBA-Bench のスコアボードについては、2026 年の AI エージェント ベンチマーク レポートをご覧ください。 当社のオートメーション エージェントがこれらの原則を本番環境にどのように適用しているかは、ライブ デモでご覧になれます。ぜひご予約ください。

AI エージェント ベンチマークに関するよくある質問

現在、最も信頼性の高い AI エージェント ベンチマークは何ですか?

τ-bench は、ツールを使用するエージェント向けの最も厳格なベンチマークの 1 つであり、pass^k 信頼性指標を採用しています。 そのほか、AgentBench (多様な環境)、WebArena (Web ナビゲーション)、SWE-bench (ソフトウェア エンジニアリング) が主要なものとなります。 それぞれが異なる能力を測定するため、信頼性を 1 つのスコアだけで表すことはできません。

企業向け AI エージェントの能力をどのように評価すべきでしょうか?

タスク完了の成否にとどまらず、その先を見据えましょう。 機能的正確性 (目標達成)、ツールの使用とナビゲーション (データベース、ブラウザ、API)、安全性と信頼性 (有害な操作に対するガードレール)、そしてコーディング タスクだけでなく、複雑なワークフローにおける実環境への適用可能性を評価してください。 軌跡精度は、これらを総合して評価するものです。

AI エージェントの性能測定には、どのような標準指標が使用されますか?

主要な指標には、成功率 (完全に解決されたタスクの割合)、意図解決率 (ユーザーの目標を正しく特定できた割合)、複数ステップのタスクにおけるタスク完了率、および長時間のやり取りにおけるコンテキスト保持率などがあります。 2026 年は、これらの成果指標に加えて、軌跡指標もますます必要になります。

オートメーション・エニウェアのエージェントが τ-bench のスコアボードで首位となっているのはなぜですか?

2026 年 5 月の提出時点で第 1 位となった要因は、軽量なコンテキスト スキャフォールディングを備えたベース エージェント アーキテクチャ (aa-agent-v1) にあります。これは複数ターンのタスクと、一貫したツール使用において優れた性能を発揮します。 強力なモデルだけでなく、強力なアーキテクチャが、この結果につながっています。

オートメーション・エニウェアは、具体的にどのベンチマーク指標で優れた性能を発揮していますか?

2026 年 5 月の提出時点で、ベース エージェントは pass^1 で 74.5% に達し、次点を +4.3 ポイント上回っています。また、難易度の高い pass^4 レベルでもその優位性を維持しています (出典: オートメーション・エニウェアの 2026 年 AI エージェント ベンチマーク レポート)。 また、4 つの分野のうち 3 つにおいて、スコアボード上の比較よりも処理速度が速く、小売分野では最大 3.2 倍の速度を記録しています。

AI エージェント評価における軌跡精度とは何ですか?

軌跡精度は、エージェントが正しい答えに到達したかどうかだけでなく、監査可能な正しい推論経路をたどったかどうかを測定するものです。 これにより、不安定で非効率、またはリスクの高い経路で正しい結果に到達する「場当たり的な成功」を検出できます。このような経路は、規模が拡大すると破綻してしまいます。

コンテキスト メモリは、AI エージェントの信頼性をどのように向上させるのでしょうか?

構造化された運用メモリを使用すると、エージェントは過去の実行から得た教訓を抽出し、新しい実行に適用できます。これにより、パラメーター エラーや無効なツール呼び出しの繰り返しを排除できます。 複雑な企業ワークフローでは、目標達成率と軌道精度が大幅に向上し、冗長なツール呼び出しも削減されます。

タグ

AI

最新情報を確認する:

Subscribe ブログを購読する
user image

エミリー・ガル

エミリー・ガルはオートメーション・エニウェアの APA プラットフォーム担当製品マーケティング ディレクターとして、B2B SaaS と AI の成長を 17 年以上牽引。

関連記事

執筆者の最新記事

無料体験版 Automation Anywhere
Close

ビジネス向け

パーソナライズされた製品デモをご希望の場合は、クイック アクセスからお申し込みください

学生・開発者向け

すべての機能が無料で使えるクラウド版 Community Edition で、今すぐ自動化を始めましょう。