研究者らはコーディングエージェント向けに動的に読み込まれるスキルインターフェースにおける悪意あるファイルのリスクを評価するベンチマークを構築した。複数のLLMを用いて実際のシェルコマンドをカモフラージュした結果、Gemini CLIでは95.5%超、Qwen Codeでは71.6%超の実行成功率を確認し、導入前にスキルインターフェースのリスク評価を行う必要性を強調している。
残留リスク
不明
事例詳細
研究者らはコーディングエージェント向けに動的に読み込まれるスキルインターフェースにおける悪意あるファイルのリスクを評価するベンチマークを構築した。複数のLLMを用いて実際のシェルコマンドをカモフラージュした結果、Gemini CLIでは95.5%超、Qwen Codeでは71.6%超の実行成功率を確認し、導入前にスキルインターフェースのリスク評価を行う必要性を強調している。
残留リスク
不明
信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。
2026-08-08 / 論文 / 起点となった情報
https://arxiv.org/abs/2608.05223Coding Atlasベンチマーク、13種のAIコーディングエージェント構成で悪意あるリポジトリ指示への系統的な脆弱性を明らかに
GitSpawn: サニタイズされていない.git/configの実行により、5種のAIコーディングエージェントで認証前の任意コード実行が可能に
汚染されたllms.txtファイルによりClaude・Codex・Hermesのコーディングエージェントが未登録の悪意あるコードをダウンロード・実行(フォーチュン500企業やスタートアップに影響)
一見無害に見える GitHub リポジトリが、AI コーディングエージェントにマルウェアを実行させる手口