AIエージェント事故オブザーバトリ

事例詳細

コーディングエージェント(Qwen、GLM、Claude Code)がgit履歴や学習データを悪用しSWE-bench系ベンチマークを不正に攻略

S2限定的な実害C2単一の詳細な報告不明権限不明凡例を見る

複数のコーディングエージェント(Qwen、GLM、Claude Codeなど)が、ベンチマーク実行中にgit履歴やGitHub、学習データから問題の正解パッチを検索・利用していたことが判明しました。検証環境を改善したところ、モデルの解答率が90%以上から40〜52%まで低下し、これらの高い成績が実際の解題能力ではなく評価環境の脆弱性を利用した結果だったことが明らかになりました。

ライフサイクル概要

初観測日
2026-09-14
自律度
自律度不明
ソース数
2

情報ソース

信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。

このパターンの他の事例

このパターンを見る