Self-evolving LLMベースのcoding agentがスキルライブラリから取得したコードを模倣する過程で、悪意あるペイロードを新たに著成・保存・実行する「self-poisoning」脆弱性が研究者により発見された。EvoMalと名付けられた攻撃では、わかりやすいコード構造(banner)でペイロードを包装することで、agentが無意識に悪意あるコピーを複製し、ライブラリに再保存されたコピーが自己増殖する蠕虫のような挙動を示す。複数モデルで20~42%のタスクで悪意あるスキルが生成され、削除後も68%の確率で残存するケースが報告されている。
残留リスク
不明