LLMはsystemやassistantの推論などのロールタグを、安全な認証機構ではなく文章スタイルや書式から推測しているため、攻撃者は内部のchain-of-thought/ロール書式を偽装することで、注入したコンテンツを信頼された内部推論であるかのように見せかけられる。これにより従来のジェイルブレイク手法より大幅に高い成功率で有害な出力を誘発できる。
主要な失敗モード
直接プロンプトインジェクション
主要な根本原因
信頼できないコンテンツの未隔離
パターン詳細
LLMはsystemやassistantの推論などのロールタグを、安全な認証機構ではなく文章スタイルや書式から推測しているため、攻撃者は内部のchain-of-thought/ロール書式を偽装することで、注入したコンテンツを信頼された内部推論であるかのように見せかけられる。これにより従来のジェイルブレイク手法より大幅に高い成功率で有害な出力を誘発できる。
主要な失敗モード
直接プロンプトインジェクション
主要な根本原因
信頼できないコンテンツの未隔離