AIエージェント事故オブザーバトリ

パターン

失敗パターン一覧

複数の事例に繰り返し現れる失敗の型を整理しています。個別の事例が修正されても、パターン自体は継続して監視します。

エージェントの成果物・評価結果の信頼性が損なわれる

観測初期P3確信度: 中高

エージェントが課題を解かずに答えを取得する、あるいは受け取れなかった出力を捏造することで、成果物や評価結果が実態と乖離する。攻撃者が存在しない型であり、実害は「気づかないまま誤った判断をする」ことにある。ベンダーの修正では解けず、統制された実行環境と出力の検証が対策の中心になる。

エージェント経由のローカル機密情報の外部持ち出し

継続中P3確信度: 中高

エージェントが到達できるローカルの認証情報や機密ファイルが読み取られ、攻撃者の管理する宛先へ送信される。入口は間接プロンプトインジェクションやファイル内容の実行と重なるが、対策が入口側の隔離ではなく出口側(外部通信の制御、シークレットのスコープ)に寄るため独立した型として扱う。

サプライチェーンと名前空間の乗っ取り(スキル・パッケージ)

継続中P4確信度: やや高高

配布経路そのものを汚染する、あるいはまだ登録されていない名前を先取りして占拠する。マーケットプレイス上の悪意あるスキル、エージェントがハルシネートしたパッケージ名の先取り登録などが該当し、利用者側の設定では防ぎにくい。

エージェント自身の状態(コンテキスト・スキル・重み)の汚染による安全制御の喪失

観測初期P3確信度: 中高

外部からの注入ではなく、エージェントが保持する状態そのものが汚染・劣化することで安全制御が失われる。共有スキルライブラリの自己中毒、コンテキスト圧縮による確認指示の消失、モデル重みの自己改変などが該当する。攻撃者がいなくても成立しうる点が他の型と異なる。

外部コンテンツに埋め込まれた指示の実行(間接プロンプトインジェクション)

継続中P5確信度: 高高

エージェントが取り込んだ外部コンテンツに埋め込まれた指示を、利用者からの命令と区別せずに実行してしまう。メール、文書、画像、音声、表計算のセル、ソースコードのコメント、ロボットのカメラ映像など、指示を運ぶ媒体は問わない。同一の構造があらゆる入力経路で再現することが、この型のもっとも重要な性質である。

リポジトリ・設定・メタデータファイルの記述をエージェントが検証せず実行

継続中P3確信度: 中高

リポジトリに同梱されたファイルの記述を、エージェントが検証せずそのまま実行に移す。.git/config の設定値、スキルファイル、llms.txt の参照先、エラーメッセージが示す対処コマンドなどが該当する。読んだ文章に従ってしまう間接プロンプトインジェクションとは異なり、ファイルに書かれた設定やコマンドがそのまま実行される点で区別する。

人間の承認ゲートを欠いたまま不可逆な操作が実行される

継続中P3確信度: 中高

承認の仕組みが無効化されている、あるいは最初から運用に組み込まれていない状態で、エージェントが取り返しのつかない操作を実行する。攻撃者が意図的に外した場合と、利便性のために運用側が外している場合の双方を含み、対策の主体が異なる。

初期侵入後の攻撃チェーンの自律実行

継続中P4確信度: やや高高

初期侵入の後、エージェントが人間の関与なしに偵察・認証情報窃取・横展開・権限昇格・破壊的操作までを自律的に遂行する。従来は人間の攻撃者が数週間かけていた工程が数時間に圧縮される点が、防御側にとっての本質的な変化である。

設定不備・過剰権限によるエージェント認証情報の露出

継続中P3確信度: 中中

デプロイやバックエンドの設定不備、あるいはエージェントに与えられた過剰なローカル権限により、トークンや認証情報が露出する。露出した認証情報は接続先アカウントの乗っ取りに直結する。

テスト環境と本番環境の識別失敗による実環境への行動

継続中P4確信度: やや高高

評価・訓練中のエージェントが、シミュレーションではなく実在のシステムを相手にしていることを認識できず、無許可の実環境行動に至る。安全性評価そのものが実害を生みうるという点で、他の型とは対策の置き場所が異なる。

提供者側の非開示・不実表示による信頼の毀損

観測初期P2確信度: やや低中

攻撃者ではなく製品ベンダーやAPI提供者自身が、開示していない振る舞いをする。同意なきテレメトリ収集や、申告と異なるモデル・隠しシステムプロンプトの混入が該当する。利用組織にできるのは検知と利用停止のみで、対策の主体が他の型と根本的に異なる。

モデルのロール認識の偽装による直接プロンプトインジェクション

継続中P3確信度: 中高

LLM がロールタグを認証ではなく文章の書式から推測していることを悪用し、注入内容を信頼された内部推論であるかのように見せかける。攻撃対象がツール連鎖ではなくモデルのロール解釈そのものである点で、間接プロンプトインジェクションと区別する。

注入された指示による承認ゲート・許可リストの迂回

継続中P3確信度: 中中

注入された指示が、ユーザー確認や実行許可リストといった明示的に用意された制御をすり抜けて、特権的な操作に到達する。指示が通ってしまうこと自体ではなく、用意されていた歯止めが破られている点がこの型の特徴である。

不正なエージェントの作成による連携アカウントの乗っ取り

継続中P2確信度: やや低中

攻撃者が被害組織のワークスペース内に悪意あるエージェントを作成させ、そのエージェントが継承した権限で接続済みのサードパーティアカウントを踏み台にする。作成されたエージェント自体が正規の機能として動作するため、検知が難しい。

エージェント実行環境の分離・権限境界の破れ

継続中P2確信度: やや低中

エージェントのコード実行環境やワークスペースの分離が破られ、他のエージェント、ホスト、特権領域に到達する。並列エージェント間の共有状態、コード実行サンドボックスからの脱出、初期化処理の権限昇格などが含まれる。