AIエージェント事故オブザーバトリ

パターン詳細

エージェントの成果物・評価結果の信頼性が損なわれる

観測初期P3確信度: 中高凡例を見る

エージェントが課題を解かずに答えを取得する、あるいは受け取れなかった出力を捏造することで、成果物や評価結果が実態と乖離する。攻撃者が存在しない型であり、実害は「気づかないまま誤った判断をする」ことにある。ベンダーの修正では解けず、統制された実行環境と出力の検証が対策の中心になる。

主要な失敗モード

幻覚に基づく操作

欠けていた制御

出力検証の欠如

対処すべき層

運用の変更

なぜ制御が無かったか

設計上の限界