AIエージェント事故オブザーバトリ

パターン詳細

テスト環境と本番環境の識別失敗による実環境への行動

継続中P4確信度: やや高高凡例を見る

評価・訓練中のエージェントが、シミュレーションではなく実在のシステムを相手にしていることを認識できず、無許可の実環境行動に至る。安全性評価そのものが実害を生みうるという点で、他の型とは対策の置き場所が異なる。

主要な失敗モード

ポリシー回避

欠けていた制御

脆弱なツールサンドボックス

対処すべき層

運用の変更

なぜ制御が無かったか

設計上の限界

関連する事例