---
title: "AI エージェントの評価"
description: "AI エージェントが期待どおりに動くかを、測り、確かめ、守り続けるための本。評価の言葉、設計、データ、採点、指標、回帰試験、本番の監視を章立てで扱います。"
canonical: https://knowledge.uniquex.co.jp/agent-evaluation
type: "序章"
author: "UNIQUEX 編集部"
reviewer: "松下清隆（株式会社UNIQUEX 代表取締役）"
published: 2026-10-08
updated: 2026-10-08
verified: 2026-10-08
---

# AI エージェントの評価

> AI エージェントの評価の領域では、エージェントが期待どおりに動くかを測って確かめる方法を、1 冊の本の形で扱います。第 1 章で評価の対象と言葉（エージェントとワークフローの違い、評価の六つの要素、能力評価と回帰評価、評価データセットとルーブリック）を定め、以降の章で評価の設計、評価データ、採点、指標と統計、回帰試験と CI、本番の監視へ進みます。根拠は、公開された技術文書、評価ツールの公式文書、査読前の研究論文、NIST AI RMF や AISI のガイドなど公開された指針に置きます。章は書けた節から順に公開し、準備中の節は目次に出しません。



## この本で扱うこと [#この本で扱うこと]

AI エージェント（モデルがツールを呼び、複数の手順で仕事を進める仕組み）が期待どおりに動くかを、測って確かめる方法を扱います。対象は、エージェントの開発者、品質保証の担当、プロダクトの責任者、運用とリスク管理の担当です。

* 評価の対象と言葉（エージェントとワークフロー、評価の六つの要素、能力評価と回帰評価）
* 評価データ（課題と期待する結果）の作り方と保守
* 採点の方法（採点器の種類、ルーブリック、LLM による採点とその限界）
* 指標と統計（成功率、ばらつきの扱い、比較の仕方、費用と時間）
* 回帰試験と CI への組み込み、本番の監視と失敗の分析
* ガードレール、リリース判断、ハーネスとループエンジニアリングの位置づけ

## 最初に読むページ [#最初に読むページ]

第 1 章は、以降の章で使う言葉を定める章です。評価を一から組み立てるときは、次の順に読みます。

| 順 | ページ                                                                    | 分かること                    |
| - | ---------------------------------------------------------------------- | ------------------------ |
| 1 | [エージェントとワークフローの違い](/agent-evaluation/agent-vs-workflow)                | 経路を誰が決めるかで評価の仕方がどう変わるか   |
| 2 | [評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット](/agent-evaluation/getting-started) | 評価を組み立てる要素の定義と、要素をそろえる順序 |
| 3 | [能力評価と回帰評価](/agent-evaluation/capability-and-regression-evals)         | 二つの目的と、開発の段階ごとの使い分け      |
| 4 | [評価データセットとルーブリック](/agent-evaluation/eval-dataset-and-rubric)           | 何を用意するかと、データと採点の基準の関係    |

章の導入ページ「[評価とは何か](/agent-evaluation/what-is-evaluation)」に、章の目的と節の読み方をまとめています。

## 根拠にする文書 [#根拠にする文書]

各ページは、原文を確かめた範囲だけを書き、出典をページの末尾に示します。根拠は、評価の言葉と設計に関する公開された技術文書、評価ツール（Inspect、LangSmith、promptfoo、DeepEval など）の公式文書、評価の統計と LLM による採点に関する研究論文、NIST AI RMF 1.0 と生成 AI プロファイル（AI 600-1）、AISI「AI セーフティに関する評価観点ガイド」などの公開された指針に置きます。

## この本で扱わないこと [#この本で扱わないこと]

特定の製品やモデルの性能の比較、実在の数値や事例、評価ツールの設定の手順は扱いません。セキュリティの検査（レッドチーミングの手法など）は、評価との接点にとどめ、詳細はセキュリティの領域に譲ります。


## 参考文献

- NIST. AI Risk Management Framework (2023). NIST、AI RMF 1.0（2023 年 1 月 26 日公開）. https://www.nist.gov/itl/ai-risk-management-framework（参照日 2026-10-08）
