AIナレッジセンター by UNIQUEX

第 1 章 評価とは何か · 導入

評価とは何か

AI エージェントの評価の対象と言葉を定める章です。エージェントとワークフローの区別、評価の六つの要素、能力評価と回帰評価、評価データセットとルーブリックを扱います。

要点

この章では、AI エージェントの評価の対象と言葉を定めます。評価の対象を、経路を人が決めるワークフローと LLM が決めるエージェントに分け、評価を組み立てる六つの要素(課題・試行・記録・最終状態・採点器・評価セット)を定義します。評価の目的を能力評価と回帰評価に分け、評価データセットとルーブリックが何を決めるかを示します。以降の章は、この章の言葉を前提に、評価の設計、データ、採点、指標、回帰試験、本番の監視へ進みます。

このページで分かること

  • 評価の対象(エージェントとワークフロー)と、評価を組み立てる六つの要素
  • 評価の二つの目的(能力評価と回帰評価)と、データセットとルーブリックの役割
  • この章の節の読み方と、この章で扱わないこと

この章の節

前提となる章: なし

  1. 1.1 エージェントとワークフローの違い — 経路を誰が決めるかで評価の仕方が変わる
  2. 1.2 評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット — 評価を構成する要素の定義
  3. 1.3 能力評価と回帰評価 — 二つの目的と使い分け
  4. 1.4 評価データセットとルーブリック — データと基準の定義と関係

この章の目的

AI エージェントの評価を進めるには、何を評価の対象とし、評価を何で組み立て、何のために測るかについて、関わる人が同じ言葉を持つ必要があります。この章は、その言葉を定める章です。対象の区別(エージェントとワークフロー)、評価の構成要素(課題・試行・記録・最終状態・採点器・評価セット)、評価の目的(能力評価と回帰評価)、用意するもの(評価データセットとルーブリック)の四つを順に扱います。

前提となる章

前提となる章はありません。LLM をツールと組み合わせた仕組みを作ったか、作ろうとしている開発者、品質保証の担当、プロダクトの責任者が、最初に読む章として書いています。

節の読み方

節は知識が積み上がる順に並んでいます。節 1.1 で評価の対象を定め、節 1.2 でその対象を測るための要素を定義します。節 1.3 は、同じ要素を目的によって能力評価と回帰評価に分けて使うことを示し、節 1.4 は、要素のうち課題の集まり(評価データセット)と採点の基準(ルーブリック)を詳しく定めます。言葉の定義だけが要るときは節 1.2 だけを読み、評価を一から組み立てるときは 1.1 から順に読みます。各節の末尾に次に読む節を示しています。

この章で扱わないこと

この章は定義と位置づけにとどめ、実務の方法は後の章で扱います。最終状態と途中経路のどちらを測るかの決め方は第 2 章(評価の設計)、評価データの作り方と保守は第 3 章(評価データ)、採点器の種類と LLM による採点の限界は第 4 章(採点)、合格率のばらつきと比較の仕方は第 5 章(指標と統計)、CI への組み込みは第 6 章(回帰試験と CI)、本番の監視と失敗の分析は第 7 章で扱います。

次に読む節

1.1 エージェントとワークフローの違い

このページの見出し