AIナレッジセンター by UNIQUEX

第 1 章 評価とは何か1.3

能力評価と回帰評価

能力評価はできるようになってほしいことを測り、回帰評価は以前できていたことが崩れていないかを測ります。二つの目的、開発の段階との対応、課題の移し方を整理します。

要点

能力評価とは、エージェントにできるようになってほしいことを測る評価で、合格率が低い状態から始めてよく、改善の目標になります。回帰評価とは、以前できていたことが崩れていないかを測る評価で、合格率がほぼ全件であることを前提にし、変更のたびに回します。開発中は能力評価を、リリース前は回帰評価を中心に回し、本番では監視と利用者からの報告を課題に戻します。安定して合格するようになった課題は、能力評価から回帰評価へ移します。

このページで分かること

  • 能力評価と回帰評価の定義と、目的・合格率の想定・回す時期の違い
  • 開発中・リリース前・本番の各段階で、どちらの評価を何のために回すか
  • 課題を能力評価から回帰評価へ移す考え方と、組織のリスク管理の枠組みとの関係

評価は、目的によって能力評価と回帰評価の二つに分かれます。この節では、二つの目的と、開発の段階ごとにどちらを何のために回すかを整理します。課題・試行・採点器・評価セットの言葉は節 1.2 のとおりに使います。

二つの目的

能力評価とは、できるようになってほしいことを測る評価です。回帰評価とは、以前できていたことが崩れていないかを測る評価です。区別は Anthropic「Demystifying evals for AI agents」に合わせています。

観点能力評価回帰評価
目的改善の目標を示す後退を捕まえる
合格率の想定低い状態から始めてよいほぼ全件の合格を前提にする
課題の出所まだ解けない課題、新しく求める振る舞い安定して解けるようになった課題、過去の失敗
回す時期開発中、改善の前後変更のたび、リリース前
結果の使い方どこを伸ばすかを決める出してよいかを決める

二つを同じ評価セットに混ぜると、合格率が改善の目標なのか合否の基準なのか分からなくなります。評価セットは目的ごとに分け、名前で区別します。

開発の段階との対応

段階中心となる評価何のために回すか
開発中能力評価改善の方向を決め、変更の効果を測る
リリース前回帰評価以前できていたことが崩れていないかを確かめる
本番監視と利用者からの報告評価セットに無い失敗を見つけ、課題に戻す

リリース前に整えたデータで行う評価(ベンチマーク、回帰試験、バックテスト)と、参照出力なしで本番の通信を監視する評価は、別の活動として区別します(LangChain「LangSmith: Evaluation concepts」)。変更のたびに評価を回し、失敗が見つかるたびに評価セットを増やす運用が、二つの評価を育てる基本です(OpenAI「Evaluation best practices」)。

課題の移し方

  1. 能力評価の課題のうち、安定して合格するようになったものを回帰評価に移します。
  2. 回帰評価の合格率がほぼ全件であることを確かめ、落ちた課題は記録を読んで原因を分けます。
  3. 本番の監視と利用者からの報告で見つかった失敗は、課題にして能力評価に足します。
  4. 能力評価の課題が尽きたら、次に求める振る舞いから新しい課題を作ります。

よくある詰まりは、能力評価の合格率を合否の基準に使って出せる版を止めてしまうこと、回帰評価に課題を移さず、以前の失敗が再発しても気づけないことです。

組織のリスク管理との関係

組織としてのリスク管理には NIST AI RMF 1.0 と生成 AI プロファイル(NIST AI 600-1)があり、国内では AISI「AI セーフティに関する評価観点ガイド」が AI エージェントの広がりを踏まえて第 1.20 版で評価観点を更新しています。本書では、これらを「何を測るべきか」の観点の一覧として参照し、能力評価と回帰評価の課題を選ぶときの手がかりにします。

次に読む節

1.4 評価データセットとルーブリック

このページの見出し