AIエージェント事故オブザーバトリ

パターン詳細

書式ベースのロール識別を悪用したCoTロール偽装によるプロンプトインジェクション

不明P3確信度: 中不明凡例を見る

LLMはsystemやassistantの推論などのロールタグを、安全な認証機構ではなく文章スタイルや書式から推測しているため、攻撃者は内部のchain-of-thought/ロール書式を偽装することで、注入したコンテンツを信頼された内部推論であるかのように見せかけられる。これにより従来のジェイルブレイク手法より大幅に高い成功率で有害な出力を誘発できる。

主要な失敗モード

直接プロンプトインジェクション

主要な根本原因

信頼できないコンテンツの未隔離