AIエージェントのリスク|暴走・ハルシネーションを防ぐ設計
・ Employee Store 運用局

この記事のまとめ
AIエージェントのリスクは、AIが間違えることと、間違えたまま動き続けることにあります。この記事では、ハルシネーションと暴走がなぜ起きるか、確認・上限・記録でリスクを小さくする設計、任せる範囲の決め方を、公的な資料と公式ドキュメントをもとに説明します。
この記事の内容は、2026年10月2日に経済産業省、AIセーフティ・インスティテュート(AISI)、OWASP、Anthropic、n8n、Dify の公開資料で確かめたものです。資料は改訂されることがあります。末尾の出典から最新版を確かめてください。
AIエージェントのリスクや危険性、問題点を考えるときは、AIが答えを返すだけでなく、ツールを使って操作まで行う点を前提にします。間違った答えが、そのまま送信や変更などの操作につながるためです。
AIエージェントの主なリスク
- ハルシネーション:事実と違う内容を、もっともらしく出力する
- 暴走:止まらずに処理を繰り返したり、頼んだ以上の操作をしたりする
- 乗っ取り:読み込んだ文章に隠れた指示で、意図しない操作をさせられる
- 情報漏えい:出してはいけない情報を外に出す
- 費用の膨張:処理の繰り返しで、API利用料が想定を超える
これらのリスクは、別々に起きるとは限りません。ハルシネーションで誤った判断をし、強い権限でそのまま操作し、上限がないので同じ操作を繰り返す。このように重なると、被害が大きくなります。
乗っ取りと情報漏えいはAIエージェントのセキュリティで説明しています。この記事では、攻撃がなくても起きるハルシネーションと暴走を中心に扱います。
ハルシネーション:もっともらしい誤り
OWASP の「Top 10 for LLM Applications 2026」は、誤情報(Misinformation)を、人の判断や自動の処理、エージェントの操作に影響するほどもっともらしい、誤った・不完全な・根拠のない情報と説明しています。問題の中心は、誤った出力が信用され、それに基づいて動いてしまうことです。
AIエージェントでは、誤りが状態の思い込みとして次の処理に渡ります。OWASP は例として、夜間のバックアップが終わったとエージェントが報告したが実際は動いておらず、後で復元に失敗した場面を挙げています。本人確認が済んでいない顧客を済んだと報告し、別のエージェントがそれを信じて支払いを進めた場面もあります。
AISI の評価観点ガイド(第1.20版)も、AIエージェントが何段階も推論や情報の受け渡しをする中で、目標の変化、情報の欠落、ハルシネーションの混入を観測できるかを評価項目の例に挙げています。AI事業者ガイドライン(第1.2版)は、RAG(検索拡張生成)を使うことでハルシネーションの抑制が期待されていると書いています。
OWASP は、誤情報への対策として次のような点を挙げています。
- 信頼できる最新の情報源に基づいて答えさせる
- 必ず埋める項目を決めた形で出力させ、抜け漏れを見つける
- 確かめた事実と、推測を分けて扱う
- 誤った情報を与える場面を想定して、繰り返しテストする
暴走:止まらない・やりすぎる動作
AIエージェントは、考える、ツールを呼ぶ、結果を読む、を繰り返して仕事を進めます。Anthropic の解説は、エージェントは自律して動くため費用が高くなりやすく、誤りが積み重なるおそれがあると書いています。そのうえで、止める条件(繰り返しの上限など)を入れて制御することが一般的だと説明しています。
OWASP は、過剰な権限の引き金として、ハルシネーションや、性能の低いモデルを挙げています。頼んだ以上の操作ができる権限を持っていると、誤った判断がそのまま大きな操作になり、事故につながります。使用量に上限がないことも、費用の膨張やサービスの停止につながるリスクとして挙げられています。
OWASP の「Agentic AI - Threats and Mitigations」は、攻撃がなくても、AIエージェントが目標を取り違えて、望ましくない操作をすることがあると説明しています。対策には、方針による制限、危険な操作への人の確認、記録と監視が挙げられています。
リスクを小さくする設計:確認・上限・記録
確認
- 操作の前に根拠を確かめる
- 影響の大きい操作は人が承認する
- 出力の形をプログラムで確かめる
上限
- 繰り返しの回数を決める
- 使う金額に上限を付ける
- 使える権限を絞る
記録
- どのツールを、どの値で呼んだか残す
- AIの主張と根拠と結果を残す
- あとから誰の操作か追える
確認
OWASP は、誤情報への対策として、出力を作る段階と実行する段階を分け、主張を確かめてから動く形を勧めています。ツールを呼ぶ前に、渡す値、権限、前提の条件、今の状態を確かめます。影響の大きい操作には、承認の手順を入れます。
上限
n8n の AI Agent ノードには、Max Iterations という繰り返しの上限があり、初期値は10です。Dify の Agent ノードの Max Iterations は、無限に繰り返すことを防ぐための安全の上限と説明されています。ドキュメントは目安として、単純な作業なら3〜5回、複雑な調査なら10〜15回を挙げています。
- 3回単純な作業Dify の目安は3〜5回
- 10回n8n の初期値AI Agent ノードの Max Iterations
- 15回複雑な調査Dify の目安は10〜15回
n8n と Dify の公式ドキュメントより(2026年10月確認)
上限は、仕事に必要な回数を試して決めます。上限に達して止まったときに、人に知らせる仕組みも用意します。金額の上限は、AIモデルの提供元の管理画面で決められる場合があります。たとえば Anthropic の API では、組織ごとに1か月の使用額の上限を自分で設定できます。
記録
OWASP の「Agentic AI - Threats and Mitigations」は、AIエージェントの操作があとから追えない状態を脅威の1つに挙げ、記録を詳しく残すよう勧めています。記録があれば、誤りが見つかったときに、どこから間違えたかを調べられます。AISI の評価観点ガイドも、ファイルへの書き込みや削除、権限の昇格など、前もって決めた危険な作業を観測し、止められるかを評価項目の例に挙げています。
デメリットを踏まえて任せる範囲を決める
AIエージェントのデメリットは、費用と待ち時間が増えやすいこと、誤りが積み重なりやすいことです。Anthropic は、できるだけ単純な方法から始め、必要なときだけ複雑にするよう勧めています。AIエージェントを作らないことが答えの場合もあると書いています。
その仕事の手順と成功の基準は決まっているか
Anthropic は、AIエージェントが役に立ちやすい仕事として、会話と操作の両方が必要で、成功の基準がはっきりしていて、結果を見て直せて、人の目が届くものを挙げています。任せた後の効果の測り方はAIエージェントの評価方法で説明しています。
任せる範囲は、一度に広げません。最初は下書きや集計など、社内で直せる仕事から始めます。送信や支払いなど外に影響する操作は、人の承認を残したまま、記録を見ながら少しずつ広げます。
公的ガイドラインの整理
| 資料 | 公表 | AIエージェントに関わる点 |
|---|---|---|
| AI事業者ガイドライン(第1.2版) | 総務省・経済産業省、2026年3月31日 | AIエージェントを、目標のために環境を感知し自律的に行動するAIシステムと定義。人が制御できること、事態が起きたときの対処を前もって整えることを求める |
| AIセーフティに関する評価観点ガイド(第1.20版) | AISI、2026年7月7日 | AIエージェント特有の観点として「観測と制御」を追加。自律的な挙動と、外部環境との相互作用を評価する |
AI事業者ガイドラインは、安全性の項目で、AIの性質や用途に応じて、定期的なモニタリングを含め人が制御できる状態を確保するよう求めています。人の判断を挟むときは、機械への過度な信頼(自動化バイアス)に左右されない対策も求めています。権限の絞り方はAIエージェントの権限管理で説明しています。
Employee Store で導入するとき
Employee Store では、開発者が作ったAIエージェントを買い切りや月額で導入できます。導入の前に、AIエージェントがどの操作をするか、繰り返しや金額の上限があるか、どこで人が確認するかを確かめます。購入後は、取引ルームのメッセージで出品者に確認できます。掲載中のAIはAI社員の一覧から探せます。
よくある質問
- AIエージェントの暴走はなぜ起きるのですか?
- AIエージェントは、考える、ツールを呼ぶ、結果を読む、を繰り返して仕事を進めます。止める条件がないと処理を繰り返し続け、誤った判断が積み重なることがあります。繰り返しの上限と金額の上限を決め、影響の大きい操作には人の承認を入れます。
- ハルシネーションは防げますか?
- なくすことは難しいため、誤りが操作につながらない設計にします。OWASP は、主張を確かめてから動く形、ツールを呼ぶ前の確認、影響の大きい操作の承認を勧めています。AI事業者ガイドラインは、RAGによってハルシネーションの抑制が期待されているとしています。
- AIエージェントのデメリットは何ですか?
- 費用と待ち時間が増えやすいこと、誤りが積み重なりやすいことです。Anthropic は、できるだけ単純な方法から始めるよう勧めています。手順が決まっている仕事は、決まった流れのワークフローで足りる場合があります。
出典
- 経済産業省「AI事業者ガイドライン」(第1.2版)
- AIセーフティ・インスティテュート「AIセーフティに関する評価観点ガイド(第1.20版)の公開」
- AIセーフティ・インスティテュート「AIセーフティに関する評価観点ガイド(第1.20版)概要」
- Anthropic「Building effective agents」
- OWASP「OWASP GenAI LLM Top 10 2026」
- OWASP「Agentic AI - Threats and Mitigations」
- Claude Docs「Rate limits」
- n8n Docs「Tools Agent」
- Dify Docs「Agent(ワークフローのノード)」


