GPT-Red、自己対戦でprompt injectionへの耐性を鍛える
OpenAIは、攻撃役GPT-Redと防御役モデルを同時に強化する自己対戦RLを紹介しました。GPT-Redはファイル、Webページ、メール、tool出力などに混ぜるprompt injectionで防御側の失敗を引き出すよう学習し、その生成攻撃をGPT-5.6の訓練に使ったと説明します。発表値ではGPT-5.6 Solは最も難しい直接注入ベンチマークの失敗が4か月前の最良production model比で6分の1となり、能力低下や過剰拒否も見られなかったとしています。
agentの安全性は静的な禁止規則では維持できません。攻撃手法、接続するtool、業務フローが変わるたびに、機能を壊さず失敗率を測る継続的なred teamingが必要です。
- 読むべき人
- AI agent基盤担当、セキュリティエンジニア、LLM評価担当
