AI エージェントの評価
AI エージェントが期待どおりに動くかを、測り、確かめ、守り続けるための本。評価の言葉、設計、データ、採点、指標、回帰試験、本番の監視を章立てで扱います。
要点
AI エージェントの評価の領域では、エージェントが期待どおりに動くかを測って確かめる方法を、1 冊の本の形で扱います。第 1 章で評価の対象と言葉(エージェントとワークフローの違い、評価の六つの要素、能力評価と回帰評価、評価データセットとルーブリック)を定め、以降の章で評価の設計、評価データ、採点、指標と統計、回帰試験と CI、本番の監視へ進みます。根拠は、公開された技術文書、評価ツールの公式文書、査読前の研究論文、NIST AI RMF や AISI のガイドなど公開された指針に置きます。章は書けた節から順に公開し、準備中の節は目次に出しません。
このページで分かること
- この本で扱う主題と対象の読者、章の読み方
- 最初に読むページ(第 1 章の節)
- 記事の根拠にする文書と、この本で扱わないこと
目次
- 第 1 章 評価とは何か — 評価の対象と言葉を定める(4 節)
- 第 2 章 評価の設計 — 何を、どの粒度で測るかを決める(執筆中)
- 第 3 章 評価データ — データの作り方と育て方(執筆中)
- 第 4 章 採点 — 採点器の種類と信頼の確かめ方(執筆中)
- 第 5 章 指標と統計 — 数字の読み方(執筆中)
- 第 6 章 回帰試験と CI — 壊さないための仕組み(執筆中)
- 第 7 章 本番の監視と失敗の分析 — 本番で何を見て、どう直すか(執筆中)
- 第 8 章 ガードレールとリリース判断 — 守りと「出してよいか」の判断(執筆中)
- 第 9 章 ハーネスとループエンジニアリング — 評価を回し続ける仕組み(執筆中)
この本で扱うこと
AI エージェント(モデルがツールを呼び、複数の手順で仕事を進める仕組み)が期待どおりに動くかを、測って確かめる方法を扱います。対象は、エージェントの開発者、品質保証の担当、プロダクトの責任者、運用とリスク管理の担当です。
- 評価の対象と言葉(エージェントとワークフロー、評価の六つの要素、能力評価と回帰評価)
- 評価データ(課題と期待する結果)の作り方と保守
- 採点の方法(採点器の種類、ルーブリック、LLM による採点とその限界)
- 指標と統計(成功率、ばらつきの扱い、比較の仕方、費用と時間)
- 回帰試験と CI への組み込み、本番の監視と失敗の分析
- ガードレール、リリース判断、ハーネスとループエンジニアリングの位置づけ
最初に読むページ
第 1 章は、以降の章で使う言葉を定める章です。評価を一から組み立てるときは、次の順に読みます。
| 順 | ページ | 分かること |
|---|---|---|
| 1 | エージェントとワークフローの違い | 経路を誰が決めるかで評価の仕方がどう変わるか |
| 2 | 評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット | 評価を組み立てる要素の定義と、要素をそろえる順序 |
| 3 | 能力評価と回帰評価 | 二つの目的と、開発の段階ごとの使い分け |
| 4 | 評価データセットとルーブリック | 何を用意するかと、データと採点の基準の関係 |
章の導入ページ「評価とは何か」に、章の目的と節の読み方をまとめています。
根拠にする文書
各ページは、原文を確かめた範囲だけを書き、出典をページの末尾に示します。根拠は、評価の言葉と設計に関する公開された技術文書、評価ツール(Inspect、LangSmith、promptfoo、DeepEval など)の公式文書、評価の統計と LLM による採点に関する研究論文、NIST AI RMF 1.0 と生成 AI プロファイル(AI 600-1)、AISI「AI セーフティに関する評価観点ガイド」などの公開された指針に置きます。
この本で扱わないこと
特定の製品やモデルの性能の比較、実在の数値や事例、評価ツールの設定の手順は扱いません。セキュリティの検査(レッドチーミングの手法など)は、評価との接点にとどめ、詳細はセキュリティの領域に譲ります。