詐欺検知アプリPatch(macOS/iOS)の開発者が自主的に実施したプロンプトインジェクション耐性テストにより、曖昧なメッセージに人間レビュアーのアノテーションを偽装した指示行を挿入することで、安全という判定を強制できることが判明した。コード層でパターンマッチングによる緩和策を追加したが、画像を用いた攻撃経路は未対応のまま残っている。
残留リスク
不明
事例詳細
詐欺検知アプリPatch(macOS/iOS)の開発者が自主的に実施したプロンプトインジェクション耐性テストにより、曖昧なメッセージに人間レビュアーのアノテーションを偽装した指示行を挿入することで、安全という判定を強制できることが判明した。コード層でパターンマッチングによる緩和策を追加したが、画像を用いた攻撃経路は未対応のまま残っている。
残留リスク
不明