研究者たちが、CoT Forgery と呼ばれるプロンプトインジェクション攻撃を示す査読付き論文を発表した。この攻撃は、大規模言語モデルが安全な認証ではなく「文体」に基づいてロールタグを識別している点を悪用するものである。モデルの内部推論形式を偽装することで、攻撃者は従来の脱獄手法よりも大幅に高い成功率で有害なコンテンツを生成させることができる。
残留リスク
不明
事例詳細
研究者たちが、CoT Forgery と呼ばれるプロンプトインジェクション攻撃を示す査読付き論文を発表した。この攻撃は、大規模言語モデルが安全な認証ではなく「文体」に基づいてロールタグを識別している点を悪用するものである。モデルの内部推論形式を偽装することで、攻撃者は従来の脱獄手法よりも大幅に高い成功率で有害なコンテンツを生成させることができる。
残留リスク
不明
信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。
このパターンに紐づく他の公開事例はまだありません。