AIエージェント事故オブザーバトリ

事例詳細

Patchの詐欺検知アプリでレビュアー偽装指示によるプロンプトインジェクションが安全判定を回避

S2限定的な実害C2単一の詳細な報告不明権限不明凡例を見る

詐欺検知アプリPatch(macOS/iOS)の開発者が自主的に実施したプロンプトインジェクション耐性テストにより、曖昧なメッセージに人間レビュアーのアノテーションを偽装した指示行を挿入することで、安全という判定を強制できることが判明した。コード層でパターンマッチングによる緩和策を追加したが、画像を用いた攻撃経路は未対応のまま残っている。

ライフサイクル概要

初観測日
2026-08-04
自律度
自律度不明
ソース数
1

このパターンの他の事例

このパターンを見る