AIエージェントの評価方法|テストケースの作り方と費用対効果の測り方
・ Employee Store 運用局

この記事のまとめ
AIエージェントを導入したら、役に立っているかを確かめる必要があります。この記事では、評価を精度と効果の2つに分け、テストケースの作り方からROIの計算までを順に説明します。最後に、評価の結果から続けるか止めるかを決める考え方を示します。
この記事で紹介するガイドラインやツールの内容は、2026年10月2日に各公式ページで確かめたものです。
AIエージェントの評価方法は、ひとつの数字では決まりません。答えが正しいかどうかと、仕事が楽になったかどうかは、別の問いだからです。この記事では、評価の道具を順に紹介し、自社で使える形に落とし込みます。
評価は「精度」と「効果」の2つに分ける
精度は、AIエージェントの出力が正しいかどうかです。効果は、導入して仕事の時間や費用がどう変わったかです。精度が高くても、出力の確認に時間がかかれば効果は小さくなります。逆に、多少の手直しが要っても、全体の時間が大きく減れば効果は出ます。
精度
- 出力が正しいか
- テストケースで測る
- 導入前と更新のたびに測る
効果
- 時間や費用がどう変わったか
- 実際の業務の記録で測る
- 導入後に期間を区切って測る
効果は、時間だけでは測りきれません。仕事の種類に合わせて、次の中から測る指標を選びます。
- 作業時間:1件の処理にかかる時間
- 件数:同じ人数で処理できた件数
- 手直し:AIの出力を人が直した回数
- ミス:差し戻しや訂正の件数
- 待ち時間:依頼してから対応が終わるまでの時間
AIセーフティ・インスティテュートの「AIセーフティに関する評価観点ガイド」は、評価を一度だけで終わらせず、合理的な範囲で適切なタイミングに繰り返すよう示しています。2026年7月7日公表の第1.20版では、AIエージェントに特有の評価観点として「自律的な挙動」と「外部環境との相互作用」が加わりました。AIエージェントは外部のサービスを操作するため、答えの正しさだけでなく、意図しない動きをしないかも確かめます。
自社の仕事でテストケースを作る
AIエージェントのテストには、自社の実際の仕事から作ったテストケースを使います。テストケースは、入力と、期待する結果の組です。たとえば Microsoft の Copilot Studio のエージェント評価では、1つの質問または会話全体を1件のテストケースとし、期待する応答を添えられます。テストケースを集めたものをテストセットと呼びます。
集め方
- 過去の依頼や問い合わせから、よくあるものを選ぶ
- まれだが起きると困るもの(金額が大きい、期限が近いなど)を入れる
- AIエージェントが断るべき依頼や、人に回すべき依頼を入れる
- 個人情報は伏せるか、架空の値に置き換える
1件の書き方
1件のテストケースには、入力、期待する結果、採点のしかたを書きます。問い合わせへの返信を下書きするAIエージェントなら、次のような形です。
- 入力:お客様からの「届け先を変更したい」という問い合わせ
- 期待する結果:変更の手順を案内する。発送済みの場合は担当者に回す
- 採点のしかた:手順の案内があるか、発送済みの場合に人へ回しているか
- 重み:お金や個人情報に関わるケースは、間違えたときの影響が大きいものとして印をつける
安全面のテストケース
評価観点ガイドは、AIシステムの評価観点として、偽誤情報の出力の防止、プライバシー保護、セキュリティ確保、ロバスト性などを挙げています。ロバスト性は、敵対的な指示、文字化けしたデータ、誤入力といった予期しない入力に対して、安定した出力をすることです。これらは、次のようなテストケースに置き換えられます。
- 根拠のない数字や事実を作らず、分からないと答えるか
- 他の人の個人情報を求められたときに、答えずに断るか
- 社内ルールを無視するよう指示する文が混ざっていても、従わないか
- 誤字や空欄の多い入力でも、処理を止めるか確認を求めるか
テストセットは、導入の前に1度作れば終わりではありません。本番で起きた失敗を見つけたら、そのケースを足していきます。同じテストセットを更新のたびに流すと、直したつもりで別の場所が壊れていないかを確かめられます。
正解の決め方と採点のしかた
テストケースの正解は、仕事の種類によって決め方が変わります。
- 答えが1つに決まるもの:金額、日付、分類のラベルなど。完全に一致するかで機械的に採点できる
- 基準で判断するもの:文章の要約や返信の下書きなど。採点の基準を先に書き、その基準で点をつける
- 動作を確かめるもの:予約の登録やデータの更新など。結果がシステムに正しく反映されたかを見る
基準で判断するものは、採点する人によって点がぶれます。「必要な情報が入っている」「事実の誤りがない」「社内の言い回しに合っている」のように、見る点を分けて書いておきます。
評価観点ガイドは、客観的な評価のために、対象のシステムの開発に直接携わらない人による評価も有効だとしています。導入の担当者だけで採点せず、実際にその業務を担う人や別の部署の人にも加わってもらいます。
採点にAIを使う方法もあります。Anthropic は、AIの出力を評価する作業を自動化する例として、評価する観点ごとに別のAIの呼び出しを使う形を紹介しています。ただし、AIによる採点も間違えることがあります。最初は一部のケースを人も採点し、AIの採点と合っているかを確かめます。
公開ベンチマークの読み方と限界
AIモデルの性能は、公開ベンチマークの点数で比べられることがあります。たとえば SWE-bench は、12のPythonのリポジトリにある実際のGitHubのイシューを題材にしたベンチマークです。SWE-bench Verified は、そこから人が選別した500件の課題で作られています。
ベンチマークの点数は、決まった課題の集まりでの成績です。自社の業務、データ、社内ルールでの成績を示すものではありません。モデルを選ぶ参考にはなりますが、導入するかどうかは自社のテストセットで決めます。
ベンチマークの点数を見るときは、次の点を確かめます。
- 課題の種類:コードの修正か、質問への回答か、自社の仕事に近いか
- 課題の言語:英語の課題か、日本語の課題か
- 測った条件:モデルの版、使った道具や仕組み、測った時期
- 測った人:モデルの開発元の発表か、第三者の測定か
Anthropic は、エージェントは性能を上げるかわりに、応答の時間と費用が増えることが多いと説明しています。複雑な仕組みが本当に必要かは、測った結果を見て判断するよう勧めています。
ROIの計算式
AIエージェントのROI(投資に対する効果)は、効果の額と費用から計算します。まず、1か月の効果の額を出します。
効果を測るには、導入前の作業時間を先に記録しておきます。導入してから思い出して見積もると、数字があいまいになります。1件あたりの時間と、1か月の件数を、導入前の2週間から1か月ほど記録します。
削減時間は、導入前の作業時間から、導入後の作業時間を引いて出します。導入後の時間には、AIの出力を確かめる時間と手直しの時間を必ず含めます。これを含めないと、効果を大きく見積もってしまいます。
次に、同じ期間の費用を出します。費用には、AIエージェントの価格(買い切りなら期間で割った額、月額ならその額)、AIモデルの利用料、設定や運用にかかる社内の人の時間を入れます。ROIは、効果の額から費用を引き、費用で割って100を掛けた値です。0%を上回れば、効果が費用を上回っています。
- ROI(%)=(効果の額 − 費用)÷ 費用 × 100
- 効果の額:削減時間 × 時間単価
- 費用:AIエージェントの価格、AIモデルの利用料、社内の運用の時間
費用の項目の洗い出し方は、AIエージェントの費用で詳しく説明しています。
評価結果から続けるか止めるかを決める
精度とROIがそろったら、続けるか、直すか、止めるかを決めます。判断の基準は、試す前に決めておきます。試した後に決めると、都合のよい解釈をしやすくなるからです。
基準は、ケースの重みに合わせて分けて決めます。お金や個人情報に関わるケースは、1件でも間違えたら本番に出さない、といった厳しい基準にします。文章の下書きのように人が必ず確かめる仕事は、手直しの時間を含めても作業時間が減るかどうかを基準にします。
精度と効果はどうだったか
総務省と経済産業省の「AI事業者ガイドライン(第1.2版)」は、AIを使う事業者が取り組む事項として、AIが想定された仕様のとおりに動いているかを確かめることを挙げています。続けると決めた後も、テストセットを定期的に流し、業務の記録で効果を見直します。運用中の見直し方はAIエージェントの運用・保守で、導入全体の段取りはAIエージェント導入の進め方で説明しています。
Employee Store で導入して評価する
Employee Store は、開発者が作ったAIエージェント(AI社員)を、会社が導入できるマーケットプレイスです。価格は買い切り・月額・初期費用+月額のいずれかで、ROIの費用の項目にそのまま入れられます。購入者と出品者は取引ごとの取引ルームでメッセージをやり取りでき、納品物を確かめてから受領を確認します。テストセットを先に用意しておけば、受領の前に自社の仕事で動作を確かめられます。
よくある質問
- AIエージェントのテストケースは、何件くらい必要ですか?
- 決まった件数はありません。よくある依頼、まれだが困る依頼、断るべき依頼がそれぞれ入っていることを優先します。本番で失敗を見つけたら、そのケースを足していきます。
- 公開ベンチマークの点数が高いモデルを選べば十分ですか?
- 十分ではありません。ベンチマークは決まった課題の集まりでの成績で、自社の業務での成績を示すものではありません。モデル選びの参考にとどめ、導入の判断は自社のテストセットで行います。
- ROIの計算で見落としやすい費用は何ですか?
- AIの出力を確かめる時間と、手直しの時間です。これを削減時間から差し引かないと、効果を大きく見積もります。設定や運用にかかる社内の人の時間も費用に入れます。


