外部からの注入ではなく、エージェントが保持する状態そのものが汚染・劣化することで安全制御が失われる。共有スキルライブラリの自己中毒、コンテキスト圧縮による確認指示の消失、モデル重みの自己改変などが該当する。攻撃者がいなくても成立しうる点が他の型と異なる。
主要な失敗モード
危険なツール実行
欠けていた制御
メモリ汚染
対処すべき層
検知のみ
なぜ制御が無かったか
設計上の限界
パターン詳細
外部からの注入ではなく、エージェントが保持する状態そのものが汚染・劣化することで安全制御が失われる。共有スキルライブラリの自己中毒、コンテキスト圧縮による確認指示の消失、モデル重みの自己改変などが該当する。攻撃者がいなくても成立しうる点が他の型と異なる。
主要な失敗モード
危険なツール実行
欠けていた制御
メモリ汚染
対処すべき層
検知のみ
なぜ制御が無かったか
設計上の限界