---
title: "評価データセットとルーブリック"
description: "評価データセットは課題（入力と成功の条件）の集まり、ルーブリックは採点の観点と水準を定めた基準です。構成要素、両者の関係、実務での扱いを整理します。"
canonical: https://knowledge.uniquex.co.jp/agent-evaluation/eval-dataset-and-rubric
type: "用語"
author: "UNIQUEX 編集部"
reviewer: "松下清隆（株式会社UNIQUEX 代表取締役）"
published: 2026-10-08
updated: 2026-10-08
verified: 2026-10-08
---

# 評価データセットとルーブリック

> 評価データセットとは、エージェントに与える課題（入力と成功の条件）の集まりです。ルーブリックとは、出力や振る舞いを採点するための観点と水準を文章で定めた基準です。前者は何を試すかを、後者はどう判定するかを決めます。成功の条件を最終状態で機械的に判定できる課題はコードで採点でき、文章の質や判断の妥当性のように機械的に決められない課題にルーブリックとモデルまたは人の採点を当てます。どちらも少数から始め、実際の失敗を足し、人の判断と採点が合っているかを定期に確かめます。



評価データセットとは、エージェントに与える課題（入力と成功の条件）の集まりであり、ルーブリックとは、その出力や振る舞いを採点するための観点と水準を文章で定めた基準です。前者は「何を試すか」、後者は「どう判定するか」を決めます。課題・採点器・評価セットの言葉は節 1.2 のとおりに使います。

## 評価データセットの構成要素 [#評価データセットの構成要素]

| 要素    | 内容                         | 無いと起きること            |
| ----- | -------------------------- | ------------------- |
| 入力    | 利用者の依頼、会話の履歴、与える文書         | 再現できない              |
| 前提の状態 | 実行前の環境（ファイル、データ、権限）        | 試行の間で状態が混ざり、結果が相関する |
| 成功の条件 | 何ができれば合格か。最終状態で判定できる形が望ましい | 採点が曖昧になる            |
| 参考の答え | 期待する出力や状態の例（任意）            | 比較による採点ができない        |
| 付帯情報  | 種類、難度、出所、作成日               | 偏りと飽和に気づけない         |

参考の答え（参照出力）が任意である点は、評価ツールの定義でも同じです（LangChain「LangSmith: Evaluation concepts」）。課題の出所には、実際に起きた失敗、本番の記録、専門家が作る課題、合成した課題があります。典型の場合、端の場合、意図的に崩した場合をそろえます（OpenAI「Evaluation best practices」）。

## ルーブリックの形 [#ルーブリックの形]

ルーブリックは、観点ごとに、合格と不合格の境界、または段階ごとの水準を文章で書いたものです。採点器（コード、モデル、人）がこれを当てて点をつけます。モデルに採点させるときは、観点を明確に分け、各水準の例を添え、判定の前に理由を書かせ、回答の長さに引きずられないようにします（OpenAI「Evaluation best practices」）。観点と水準を様式として与え、理由を書かせてから採点させる形は、人の評価との一致を高める方法として研究でも示されています（Liu ら 2023、G-Eval）。合否の 2 値は出してよいかの判断に、重み付きの点は改善の方向を見るのに向きます。

## データセットとルーブリックの関係 [#データセットとルーブリックの関係]

データセットの 1 課題に、採点器が 1 つ以上つきます。成功の条件を最終状態で機械的に判定できる課題はコードで採点でき、ルーブリックは要りません。文章の質や判断の妥当性のように機械的に決められない課題に、ルーブリックとモデルまたは人の採点を当てます。ルーブリックで採点する課題は、人の判断と採点が合っているかを定期に確かめ、合わなければルーブリックを直します（Anthropic「Demystifying evals for AI agents」）。

## 実務での扱い [#実務での扱い]

1. 課題は少数から始め、実際の失敗を足していきます。
2. 成功の条件は、課題を作った人以外が読んで同じ判定ができるまで書き直します。曖昧な課題と、エージェントの責任でなく解けない課題は外します。
3. 「起こるべき場面」だけでなく「起こってはいけない場面」の課題も入れ、片側だけの最適化を防ぎます。
4. データセットとルーブリックは版を付けて管理します。合格率が全件近くに張り付いた課題は回帰評価に移し、能力評価には新しい課題を足します（二つの評価の区別は節 1.3）。

よくある詰まりは、成功の条件を「手順どおりに動いたか」で書いて正しい別解を落とすこと、ルーブリックを採点器に渡したまま、人の判断との一致を誰も確かめていないことの 2 つです。


## 参考文献

- Anthropic. Demystifying evals for AI agents (2026). Anthropic、2026 年 1 月 9 日公開. https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents（参照日 2026-10-08）
- OpenAI. Evaluation best practices. OpenAI、版の表記なし（2026 年 10 月 8 日時点の公開版）. https://developers.openai.com/api/docs/guides/evaluation-best-practices（参照日 2026-10-08）
- LangChain. LangSmith: Evaluation concepts. LangChain、日付・版の表示なし（2026 年 10 月 8 日時点の公開版）. https://docs.langchain.com/langsmith/evaluation-concepts（参照日 2026-10-08）
- Liu, Iter, Xu ほか. G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (2023). arXiv、2023 年 5 月 23 日（最終版）. https://arxiv.org/abs/2303.16634（参照日 2026-10-08）
