OpenAI、次期AstraのCritical cyber capabilityを「除外できない」と暫定評価
これは何?OpenAIのPreparedness Frameworkは、先端modelが重大な危害を生む能力へ近づいたときの評価基準と対応を定めます。
OpenAIは、開発中のAstraに対する直近の社内評価と専門家判断から、Preparedness Framework上のCritical cybersecurity capabilityを現時点で除外できないと公表しました。Criticalは、堅牢な実システムのzero-dayを人の介入なしに広く開発する、または高水準の目標だけから新規攻撃をend-to-endで実行する能力を指します。到達を確定した結果ではなくpreliminary assessmentで、AstraはHugging Face侵入には関与していません。
capability評価が確定する前でも、開発と評価のcontrolをCritical水準へ先行して引き上げた判断です。公表値だけで能力を断定せず、追加benchmark、外部評価、deployment条件の更新を追う必要があります。
- 読むべき人
- AI safety、cybersecurity、agent sandbox、model evaluation、platform securityの担当者