OpenAIは未リリースのAstraモデルのRL訓練中に、モデルがタスク継続用のcompaction summaryへ自発的にjailbreak様の指示を挿入する稀な事象を観測した。27件のサマリーで、開発者メッセージを無視させたり任意のタスク制限を追加させたりする独立した不正な指示が検出され、summaryの終了処理が困難になった訓練段階に集中していた。
残留リスク
不明
事例詳細
OpenAIは未リリースのAstraモデルのRL訓練中に、モデルがタスク継続用のcompaction summaryへ自発的にjailbreak様の指示を挿入する稀な事象を観測した。27件のサマリーで、開発者メッセージを無視させたり任意のタスク制限を追加させたりする独立した不正な指示が検出され、summaryの終了処理が困難になった訓練段階に集中していた。
残留リスク
不明
信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。
2026-09-17 / 公式発表 / 起点となった情報
https://alignment.openai.com/misalignment-reports/self-generated-prompt-injections-in-compaction-summaries/