AIナレッジセンター by UNIQUEX

第 1 章 評価とは何か1.1

エージェントとワークフローの違い

ワークフローは人が書いた経路で LLM とツールを動かし、エージェントは LLM が経路を決める仕組みです。違い、型、選び方、評価の仕方の変化を整理します。

要点

ワークフローとは、LLM とツールをあらかじめ決めたコードの経路で組み合わせる仕組みです。エージェントとは、LLM が自らの処理の進め方とツールの使い方を実行時に決める仕組みです。手順を事前に書ける課題はワークフローに、入力が多様で途中の結果に応じて進め方を変える必要がある課題はエージェントに向きます。評価は、ワークフローでは段階ごとに切り出して採点でき、エージェントでは最終状態と記録を合わせて複数回の試行で採点します。

このページで分かること

  • ワークフローとエージェントの定義と、経路・手順の数・向く課題・誤りの出方の違い
  • ワークフローの五つの型と、どちらを選ぶかの判断の分岐
  • 構成の違いが評価の仕方をどう変えるか

ワークフローとは、LLM とツールをあらかじめ決めたコードの経路で組み合わせる仕組みであり、エージェントとは、LLM が自らの処理の進め方とツールの使い方を実行時に決める仕組みです(Anthropic「Building effective agents」)。両者を合わせてエージェント型のシステムと呼びます。この節は、評価の対象を定めるために両者を区別します。

ワークフローとエージェントの違い

観点ワークフローエージェント
経路を決めるもの人が書いたコードLLM の判断
手順の数設計時に決まる実行時に決まり、実行ごとに変わる
向く課題手順を定義でき、予測しやすさが要る課題手順を事前に決められず、柔軟さが要る課題
費用と遅延見積もりやすい増えやすい
誤りの出方段階ごとに切り分けられる途中の誤りが後の手順に重なる

ワークフローの五つの型

型仕組み
プロンプトの連鎖課題を順番の手順に分け、前の出力を次の入力にする。間にコードの検査を置ける
振り分け入力を分類し、専用の処理へ送る
並列化独立した部分課題を同時に処理する、または同じ課題を複数回解いて集約する
指揮者と作業者中央の LLM が課題を分解して作業者の LLM に委ね、結果を統合する。分解は入力に応じて決まる
評価と改善1 つの LLM が生成し、別の LLM が評価して差し戻す繰り返し

五つの型は Anthropic「Building effective agents」の分類です。指揮者と作業者の型は、部分課題を実行時に決める点でエージェントに近く、境界は連続的です。

選択の基準

判断の分岐は「手順を事前に書けるか」です。書けるならワークフローにし、書けないほど入力が多様で、途中の結果に応じて進め方を変える必要があるときにエージェントを選びます。多くの用途は 1 回の LLM 呼び出しに検索と例示を足した形で足ります。自律性を上げるほど費用と誤りの重なりが増えるため、本番の前に隔離した環境で十分に試し、ガードレールを置くことが前提になります(Anthropic「Building effective agents」)。

構成の違いと評価の仕方

ワークフローは、段階ごとに LLM の呼び出しを切り出して個別に評価できます(OpenAI「Evaluation best practices」)。各段階の入力と期待する出力を固定できるので、採点はコードで済むことが多く、崩れた段階も特定できます。

エージェントは、経路が実行ごとに変わるので、段階を固定した評価が成り立ちません。最終状態と記録を合わせて採点し、同じ課題を複数回試行してばらつきを見ます(Anthropic「Demystifying evals for AI agents」)。ツールを正しく選んだか、引数を正しく渡したかの確認が加わり、複数のエージェントが受け渡す構成では受け渡しの正しさも対象になります(OpenAI「Evaluation best practices」)。

実務では両者が混在するので、構成図の上で「経路がコードで決まる部分」と「LLM が決める部分」を塗り分け、前者は段階ごとに、後者は最終状態と記録で採点する、という切り分けから始めます。よくある詰まりは、LLM が決める部分に手順の一致を求める採点を当てて、正しい別解を落とすことです。最終状態・記録・採点器といった言葉の定義は、次の節で扱います。

次に読む節

1.2 評価の六つの要素: 課題・試行・記録・最終状態・採点器・評価セット

このページの見出し