第 1 章 評価とは何か1.2
評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット
AI エージェントの評価を組み立てる六つの要素(課題・試行・記録・最終状態・採点器・評価セット)の定義と、設計で決めること、他の評価ツールでの呼び名を整理します。
要点
AI エージェントの評価とは、エージェントに課題を与え、その結果と過程を決めた基準で採点して、期待どおりに動くかを確かめる活動です。評価は、課題(入力と成功の条件)、試行(課題への 1 回の実行)、記録(試行の全過程)、最終状態(試行の後に環境に残った結果)、採点器(点をつける論理)、評価セット(課題の集まり)の六つの要素で組み立てます。単発の応答の評価と違い、ツールの呼び出しや外部の状態の変化を含む複数手順の振る舞いを対象にするため、採点は応答の文章ではなく最終状態を基本にします。要素をそろえる順序は、実際に起きた失敗から少数の課題を集め、手で実行して記録を読むことから始めます。
このページで分かること
- AI エージェントの評価が、単発の応答の評価と何が違うか
- 六つの要素(課題・試行・記録・最終状態・採点器・評価セット)の定義と、要素ごとに設計で決めること
- 他の評価ツールでの呼び名と、要素をそろえる順序、よくある詰まり
AI エージェントの評価とは、エージェントに課題を与え、その結果と過程を決めた基準で採点して、期待どおりに動くかを確かめる活動です。この節では、評価を組み立てる六つの要素を定義し、要素ごとに設計で決めることを示します。評価の対象(エージェントとワークフローの区別)は前の節 1.1 を前提にします。
単発の応答の評価との違い
LLM の評価は、1 つの入力に対する 1 つの応答を採点する形で始まりました。エージェントでは次の 3 点が加わります(Anthropic「Demystifying evals for AI agents」)。
- 複数の手順でツールを呼び、外部の状態(ファイル、データベース、予約)を変えます。採点の対象は応答の文章ではなく、最後に残った状態です。
- 同じ課題でも実行のたびに経路と結果が変わります。1 回の結果では判断できず、複数回の試行が要ります。
- 途中の誤りが後の手順に重なります。最後の状態だけでは、どこで崩れたかが分かりません。
評価の対象は、モデル単体ではなく、モデルとそれを動かす仕組み(ハーネス)を合わせた全体です。
六つの要素の定義
| 要素 | 意味 | 設計で決めること |
|---|---|---|
| 課題 | 入力と成功の条件を定めた 1 つの試験 | 何を入力し、何ができれば成功か |
| 試行 | 課題への 1 回の実行 | 何回繰り返すか |
| 記録 | 試行の全過程(出力、ツール呼び出し、途中の結果) | 何を残し、誰が読むか |
| 最終状態 | 試行の後に環境に残った結果 | 何を見て合否を決めるか |
| 採点器 | 性能のある側面に点をつける論理 | コード・モデル・人のどれで採点するか |
| 評価セット | ある能力や振る舞いを測る課題の集まり | 何を測るための集まりか |
言葉は Anthropic「Demystifying evals for AI agents」に合わせています。
課題と評価セット
課題は、入力と成功の条件の組です。成功の条件は、最終状態で判定できる形で書きます。評価セットは、測りたい能力や振る舞いごとに課題をまとめたもので、何を測るための集まりかを名前と付帯情報で分かるようにします。課題と評価セットの中身は節 1.4 で扱います。
試行と記録
同じ課題でも結果が変わるため、1 つの課題を複数回試行し、各試行の記録を残します。記録には出力だけでなく、ツール呼び出しの順序と引数、途中の結果を含めます。記録は、失敗がエージェントの責任か、課題や環境の不備かを分けるときに読みます。
最終状態と採点器
採点は最終状態(課題が達成されたか)を基本にします。途中経路(ツールを呼んだ順序と途中の判断)を採点すると、正しい別の解き方を不合格にしがちなので、禁止した操作をしていないか、取り消せない操作の前に確認したか、といった「してはいけないこと」の確認に限って使います。
採点器には、コードによる判定(最終状態の検証、ツール呼び出しの確認)、モデルによる判定(ルーブリックに沿った採点)、人による判定の 3 つがあります。機械的に合否を決められる課題はコードで採点し、文章の質や判断の妥当性のように決められない課題はモデルで採点して、人の判断と合っているかを定期に確かめます(OpenAI「Evaluation best practices」)。
他の評価ツールでの呼び名
六つの要素は、評価ツールの用語と次のように対応します。
| 本書の要素 | Inspect(UK AI Security Institute) | LangSmith(LangChain) |
|---|---|---|
| 課題・評価セット | データセット | データセット(入力と任意の参照出力の例の集まり) |
| 試行・記録 | ソルバー(1 回のモデル呼び出しから完全なエージェントまで)の実行とログ | 実験(ある版の出力・点数・トレースの記録) |
| 採点器 | スコアラー | 評価器(人・コード・LLM 採点・判定モデル・対比較) |
Inspect はデータセット・ソルバー・スコアラーの組を Task と呼び、LangSmith はデータセット・評価器・実験の三つで評価を説明します。呼び名が違っても、課題を与え、実行し、採点するという組み立ては同じです。
要素をそろえる順序
- 実際に起きた失敗から課題を集めます。件数は数十件で足ります(Anthropic「Demystifying evals for AI agents」は 20〜50 件を目安としています)。
- 課題ごとに、入力と成功の条件を書きます。成功の条件は、最終状態で判定できる形にします。
- 手で実行し、記録を読みます。失敗がエージェントの責任か、課題や環境の不備かを分けます。
- 自動の採点は、手で読んだ判断と合うことを確かめてから導入します。
よくある詰まりは、課題を数百件そろえてから始めようとして着手が遅れること、手順の一致を採点して正しい別解を落とすこと、合格率だけを見て記録を読まないことです。