OpenAIはSWE-Bench Proの約3割に破損taskがあると監査した
OpenAIはSWE-Bench Proの731件公開splitを監査し、agent pipelineでは200件、人間のannotation campaignでは249件を破損taskとして特定しました。主な問題は、promptにない実装詳細をhidden testが要求する、要求が不足している、test coverageが低い、promptとtestが矛盾するという4分類です。coding agentの進歩を測るevalは、model結果だけでなく、task自体が能力差を正しく測っているかを継続監査する必要があります。
AI coding benchmarkの数字は、task品質が崩れるとdeployment判断や研究優先度を誤らせます。evalを運用資産として扱い、prompt、hidden test、reference patch、failure traceを定期的に監査する設計が必要です。
- 重要度
- high
- 読むべき人
- AI evaluation担当、coding agent基盤担当、developer productivity team