AIエージェント事故オブザーバトリ

パターン詳細

モデルのロール認識の偽装による直接プロンプトインジェクション

継続中P3確信度: 中高凡例を見る

LLM がロールタグを認証ではなく文章の書式から推測していることを悪用し、注入内容を信頼された内部推論であるかのように見せかける。攻撃対象がツール連鎖ではなくモデルのロール解釈そのものである点で、間接プロンプトインジェクションと区別する。

主要な失敗モード

直接プロンプトインジェクション

欠けていた制御

信頼できないコンテンツの未隔離

対処すべき層

ベンダーの修正

なぜ制御が無かったか

設計上の限界