AIナレッジセンター by UNIQUEX

第 1 章 評価とは何か1.4

評価データセットとルーブリック

評価データセットは課題(入力と成功の条件)の集まり、ルーブリックは採点の観点と水準を定めた基準です。構成要素、両者の関係、実務での扱いを整理します。

要点

評価データセットとは、エージェントに与える課題(入力と成功の条件)の集まりです。ルーブリックとは、出力や振る舞いを採点するための観点と水準を文章で定めた基準です。前者は何を試すかを、後者はどう判定するかを決めます。成功の条件を最終状態で機械的に判定できる課題はコードで採点でき、文章の質や判断の妥当性のように機械的に決められない課題にルーブリックとモデルまたは人の採点を当てます。どちらも少数から始め、実際の失敗を足し、人の判断と採点が合っているかを定期に確かめます。

このページで分かること

  • 評価データセットの構成要素(入力、前提の状態、成功の条件、参考の答え、付帯情報)と課題の出所
  • ルーブリックの形と、モデルに採点させるときの書き方
  • 両者の関係と、実務での扱い(始め方、偏りの防ぎ方、版の管理)

評価データセットとは、エージェントに与える課題(入力と成功の条件)の集まりであり、ルーブリックとは、その出力や振る舞いを採点するための観点と水準を文章で定めた基準です。前者は「何を試すか」、後者は「どう判定するか」を決めます。課題・採点器・評価セットの言葉は節 1.2 のとおりに使います。

評価データセットの構成要素

要素内容無いと起きること
入力利用者の依頼、会話の履歴、与える文書再現できない
前提の状態実行前の環境(ファイル、データ、権限)試行の間で状態が混ざり、結果が相関する
成功の条件何ができれば合格か。最終状態で判定できる形が望ましい採点が曖昧になる
参考の答え期待する出力や状態の例(任意)比較による採点ができない
付帯情報種類、難度、出所、作成日偏りと飽和に気づけない

参考の答え(参照出力)が任意である点は、評価ツールの定義でも同じです(LangChain「LangSmith: Evaluation concepts」)。課題の出所には、実際に起きた失敗、本番の記録、専門家が作る課題、合成した課題があります。典型の場合、端の場合、意図的に崩した場合をそろえます(OpenAI「Evaluation best practices」)。

ルーブリックの形

ルーブリックは、観点ごとに、合格と不合格の境界、または段階ごとの水準を文章で書いたものです。採点器(コード、モデル、人)がこれを当てて点をつけます。モデルに採点させるときは、観点を明確に分け、各水準の例を添え、判定の前に理由を書かせ、回答の長さに引きずられないようにします(OpenAI「Evaluation best practices」)。観点と水準を様式として与え、理由を書かせてから採点させる形は、人の評価との一致を高める方法として研究でも示されています(Liu ら 2023、G-Eval)。合否の 2 値は出してよいかの判断に、重み付きの点は改善の方向を見るのに向きます。

データセットとルーブリックの関係

データセットの 1 課題に、採点器が 1 つ以上つきます。成功の条件を最終状態で機械的に判定できる課題はコードで採点でき、ルーブリックは要りません。文章の質や判断の妥当性のように機械的に決められない課題に、ルーブリックとモデルまたは人の採点を当てます。ルーブリックで採点する課題は、人の判断と採点が合っているかを定期に確かめ、合わなければルーブリックを直します(Anthropic「Demystifying evals for AI agents」)。

実務での扱い

  1. 課題は少数から始め、実際の失敗を足していきます。
  2. 成功の条件は、課題を作った人以外が読んで同じ判定ができるまで書き直します。曖昧な課題と、エージェントの責任でなく解けない課題は外します。
  3. 「起こるべき場面」だけでなく「起こってはいけない場面」の課題も入れ、片側だけの最適化を防ぎます。
  4. データセットとルーブリックは版を付けて管理します。合格率が全件近くに張り付いた課題は回帰評価に移し、能力評価には新しい課題を足します(二つの評価の区別は節 1.3)。

よくある詰まりは、成功の条件を「手順どおりに動いたか」で書いて正しい別解を落とすこと、ルーブリックを採点器に渡したまま、人の判断との一致を誰も確かめていないことの 2 つです。

このページの見出し