LLM がロールタグを認証ではなく文章の書式から推測していることを悪用し、注入内容を信頼された内部推論であるかのように見せかける。攻撃対象がツール連鎖ではなくモデルのロール解釈そのものである点で、間接プロンプトインジェクションと区別する。
主要な失敗モード
直接プロンプトインジェクション
欠けていた制御
信頼できないコンテンツの未隔離
対処すべき層
ベンダーの修正
なぜ制御が無かったか
設計上の限界
パターン詳細
LLM がロールタグを認証ではなく文章の書式から推測していることを悪用し、注入内容を信頼された内部推論であるかのように見せかける。攻撃対象がツール連鎖ではなくモデルのロール解釈そのものである点で、間接プロンプトインジェクションと区別する。
主要な失敗モード
直接プロンプトインジェクション
欠けていた制御
信頼できないコンテンツの未隔離
対処すべき層
ベンダーの修正
なぜ制御が無かったか
設計上の限界