AIエージェント事故オブザーバトリ

事例詳細

スキルインターフェースベンチマークでGemini CLIとQwen Codeに対しLLMカモフラージュ悪意コマンドが95%超の成功率

S3重大な影響C2単一の詳細な報告不明権限不明凡例を見る

研究者らはコーディングエージェント向けに動的に読み込まれるスキルインターフェースにおける悪意あるファイルのリスクを評価するベンチマークを構築した。複数のLLMを用いて実際のシェルコマンドをカモフラージュした結果、Gemini CLIでは95.5%超、Qwen Codeでは71.6%超の実行成功率を確認し、導入前にスキルインターフェースのリスク評価を行う必要性を強調している。

ライフサイクル概要

初観測日
2026-08-08
自律度
自律度不明
ソース数
1

情報ソース

信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。

このパターンの他の事例

このパターンを見る