---
title: "能力評価と回帰評価"
description: "能力評価はできるようになってほしいことを測り、回帰評価は以前できていたことが崩れていないかを測ります。二つの目的、開発の段階との対応、課題の移し方を整理します。"
canonical: https://knowledge.uniquex.co.jp/agent-evaluation/capability-and-regression-evals
type: "解説"
author: "UNIQUEX 編集部"
reviewer: "松下清隆（株式会社UNIQUEX 代表取締役）"
published: 2026-10-08
updated: 2026-10-08
verified: 2026-10-08
---

# 能力評価と回帰評価

> 能力評価とは、エージェントにできるようになってほしいことを測る評価で、合格率が低い状態から始めてよく、改善の目標になります。回帰評価とは、以前できていたことが崩れていないかを測る評価で、合格率がほぼ全件であることを前提にし、変更のたびに回します。開発中は能力評価を、リリース前は回帰評価を中心に回し、本番では監視と利用者からの報告を課題に戻します。安定して合格するようになった課題は、能力評価から回帰評価へ移します。



評価は、目的によって能力評価と回帰評価の二つに分かれます。この節では、二つの目的と、開発の段階ごとにどちらを何のために回すかを整理します。課題・試行・採点器・評価セットの言葉は節 1.2 のとおりに使います。

## 二つの目的 [#二つの目的]

能力評価とは、できるようになってほしいことを測る評価です。回帰評価とは、以前できていたことが崩れていないかを測る評価です。区別は Anthropic「Demystifying evals for AI agents」に合わせています。

| 観点     | 能力評価                | 回帰評価                  |
| ------ | ------------------- | --------------------- |
| 目的     | 改善の目標を示す            | 後退を捕まえる               |
| 合格率の想定 | 低い状態から始めてよい         | ほぼ全件の合格を前提にする         |
| 課題の出所  | まだ解けない課題、新しく求める振る舞い | 安定して解けるようになった課題、過去の失敗 |
| 回す時期   | 開発中、改善の前後           | 変更のたび、リリース前           |
| 結果の使い方 | どこを伸ばすかを決める         | 出してよいかを決める            |

二つを同じ評価セットに混ぜると、合格率が改善の目標なのか合否の基準なのか分からなくなります。評価セットは目的ごとに分け、名前で区別します。

## 開発の段階との対応 [#開発の段階との対応]

| 段階    | 中心となる評価     | 何のために回すか               |
| ----- | ----------- | ---------------------- |
| 開発中   | 能力評価        | 改善の方向を決め、変更の効果を測る      |
| リリース前 | 回帰評価        | 以前できていたことが崩れていないかを確かめる |
| 本番    | 監視と利用者からの報告 | 評価セットに無い失敗を見つけ、課題に戻す   |

リリース前に整えたデータで行う評価（ベンチマーク、回帰試験、バックテスト）と、参照出力なしで本番の通信を監視する評価は、別の活動として区別します（LangChain「LangSmith: Evaluation concepts」）。変更のたびに評価を回し、失敗が見つかるたびに評価セットを増やす運用が、二つの評価を育てる基本です（OpenAI「Evaluation best practices」）。

## 課題の移し方 [#課題の移し方]

1. 能力評価の課題のうち、安定して合格するようになったものを回帰評価に移します。
2. 回帰評価の合格率がほぼ全件であることを確かめ、落ちた課題は記録を読んで原因を分けます。
3. 本番の監視と利用者からの報告で見つかった失敗は、課題にして能力評価に足します。
4. 能力評価の課題が尽きたら、次に求める振る舞いから新しい課題を作ります。

よくある詰まりは、能力評価の合格率を合否の基準に使って出せる版を止めてしまうこと、回帰評価に課題を移さず、以前の失敗が再発しても気づけないことです。

## 組織のリスク管理との関係 [#組織のリスク管理との関係]

組織としてのリスク管理には NIST AI RMF 1.0 と生成 AI プロファイル（NIST AI 600-1）があり、国内では AISI「AI セーフティに関する評価観点ガイド」が AI エージェントの広がりを踏まえて第 1.20 版で評価観点を更新しています。本書では、これらを「何を測るべきか」の観点の一覧として参照し、能力評価と回帰評価の課題を選ぶときの手がかりにします。


## 参考文献

- Anthropic. Demystifying evals for AI agents (2026). Anthropic、2026 年 1 月 9 日公開. https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents（参照日 2026-10-08）
- LangChain. LangSmith: Evaluation concepts. LangChain、日付・版の表示なし（2026 年 10 月 8 日時点の公開版）. https://docs.langchain.com/langsmith/evaluation-concepts（参照日 2026-10-08）
- OpenAI. Evaluation best practices. OpenAI、版の表記なし（2026 年 10 月 8 日時点の公開版）. https://developers.openai.com/api/docs/guides/evaluation-best-practices（参照日 2026-10-08）
- NIST. AI Risk Management Framework (2023). NIST、AI RMF 1.0（2023 年 1 月 26 日公開）、生成 AI プロファイル NIST AI 600-1（2024 年 7 月 26 日公開）. https://www.nist.gov/itl/ai-risk-management-framework（参照日 2026-10-08）
- AI セーフティ・インスティテュート（AISI）. AI セーフティに関する評価観点ガイド (2026). AI セーフティ・インスティテュート（AISI）、第 1.20 版（2026 年 7 月 7 日公開）. https://aisi.go.jp/output/output_framework/guide_to_evaluation_perspective_on_ai_safety/（参照日 2026-10-08）
