AIナレッジセンター by UNIQUEX

AI エージェントの評価

AI エージェントが期待どおりに動くかを、測り、確かめ、守り続けるための本。評価の言葉、設計、データ、採点、指標、回帰試験、本番の監視を章立てで扱います。

要点

AI エージェントの評価の領域では、エージェントが期待どおりに動くかを測って確かめる方法を、1 冊の本の形で扱います。第 1 章で評価の対象と言葉(エージェントとワークフローの違い、評価の六つの要素、能力評価と回帰評価、評価データセットとルーブリック)を定め、以降の章で評価の設計、評価データ、採点、指標と統計、回帰試験と CI、本番の監視へ進みます。根拠は、公開された技術文書、評価ツールの公式文書、査読前の研究論文、NIST AI RMF や AISI のガイドなど公開された指針に置きます。章は書けた節から順に公開し、準備中の節は目次に出しません。

このページで分かること

  • この本で扱う主題と対象の読者、章の読み方
  • 最初に読むページ(第 1 章の節)
  • 記事の根拠にする文書と、この本で扱わないこと

目次

  1. 第 1 章 評価とは何か — 評価の対象と言葉を定める(4 節)
  2. 第 2 章 評価の設計 — 何を、どの粒度で測るかを決める(執筆中)
  3. 第 3 章 評価データ — データの作り方と育て方(執筆中)
  4. 第 4 章 採点 — 採点器の種類と信頼の確かめ方(執筆中)
  5. 第 5 章 指標と統計 — 数字の読み方(執筆中)
  6. 第 6 章 回帰試験と CI — 壊さないための仕組み(執筆中)
  7. 第 7 章 本番の監視と失敗の分析 — 本番で何を見て、どう直すか(執筆中)
  8. 第 8 章 ガードレールとリリース判断 — 守りと「出してよいか」の判断(執筆中)
  9. 第 9 章 ハーネスとループエンジニアリング — 評価を回し続ける仕組み(執筆中)

この本で扱うこと

AI エージェント(モデルがツールを呼び、複数の手順で仕事を進める仕組み)が期待どおりに動くかを、測って確かめる方法を扱います。対象は、エージェントの開発者、品質保証の担当、プロダクトの責任者、運用とリスク管理の担当です。

  • 評価の対象と言葉(エージェントとワークフロー、評価の六つの要素、能力評価と回帰評価)
  • 評価データ(課題と期待する結果)の作り方と保守
  • 採点の方法(採点器の種類、ルーブリック、LLM による採点とその限界)
  • 指標と統計(成功率、ばらつきの扱い、比較の仕方、費用と時間)
  • 回帰試験と CI への組み込み、本番の監視と失敗の分析
  • ガードレール、リリース判断、ハーネスとループエンジニアリングの位置づけ

最初に読むページ

第 1 章は、以降の章で使う言葉を定める章です。評価を一から組み立てるときは、次の順に読みます。

順ページ分かること
1エージェントとワークフローの違い経路を誰が決めるかで評価の仕方がどう変わるか
2評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット評価を組み立てる要素の定義と、要素をそろえる順序
3能力評価と回帰評価二つの目的と、開発の段階ごとの使い分け
4評価データセットとルーブリック何を用意するかと、データと採点の基準の関係

章の導入ページ「評価とは何か」に、章の目的と節の読み方をまとめています。

根拠にする文書

各ページは、原文を確かめた範囲だけを書き、出典をページの末尾に示します。根拠は、評価の言葉と設計に関する公開された技術文書、評価ツール(Inspect、LangSmith、promptfoo、DeepEval など)の公式文書、評価の統計と LLM による採点に関する研究論文、NIST AI RMF 1.0 と生成 AI プロファイル(AI 600-1)、AISI「AI セーフティに関する評価観点ガイド」などの公開された指針に置きます。

この本で扱わないこと

特定の製品やモデルの性能の比較、実在の数値や事例、評価ツールの設定の手順は扱いません。セキュリティの検査(レッドチーミングの手法など)は、評価との接点にとどめ、詳細はセキュリティの領域に譲ります。

このページの見出し