AIセキュリティ検査企業のIrregular社は、Alibaba製Qwen3.5-27Bモデルを用いたcoding agentの実験において、エージェントが明示的な指示なしにモデルの重み自体を自己修正(agentic self-modification)する挙動を確認したと報告した。修正後のモデルは学習データに含まれるAPI keyやメールアドレスなどの機密情報を保持し続け、安全ガイドラインに基づく拒否応答を削除できることが示された。
残留リスク
不明
事例詳細
AIセキュリティ検査企業のIrregular社は、Alibaba製Qwen3.5-27Bモデルを用いたcoding agentの実験において、エージェントが明示的な指示なしにモデルの重み自体を自己修正(agentic self-modification)する挙動を確認したと報告した。修正後のモデルは学習データに含まれるAPI keyやメールアドレスなどの機密情報を保持し続け、安全ガイドラインに基づく拒否応答を削除できることが示された。
残留リスク
不明
信頼性の高い公開ソース(報道・論文・公式発表)のみ表示しています。