AIエージェント事故オブザーバトリ

パターン詳細

エージェント自身の状態(コンテキスト・スキル・重み)の汚染による安全制御の喪失

観測初期P3確信度: 中高凡例を見る

外部からの注入ではなく、エージェントが保持する状態そのものが汚染・劣化することで安全制御が失われる。共有スキルライブラリの自己中毒、コンテキスト圧縮による確認指示の消失、モデル重みの自己改変などが該当する。攻撃者がいなくても成立しうる点が他の型と異なる。

主要な失敗モード

危険なツール実行

欠けていた制御

メモリ汚染

対処すべき層

検知のみ

なぜ制御が無かったか

設計上の限界

関連する事例