OpenAI、コーディング評価基準「SWE-bench Verified」の使用を終了 汚染問題を指摘し「SWE-bench Pro」を推奨
tech/ai news
ワンポイントOpenAIがSWE-bench Verified評価を停止、SWE-bench Proへ移行
この記事は OpenAI News の一次情報をもとにAIが再構成したものです。 原文を読む →
OpenAIは、AIのコーディング能力を測る代表的なベンチマーク「SWE-bench Verified」による評価を今後行わないと発表しました。データ汚染やテスト自体の欠陥により、最先端モデルの実力を正しく測定できなくなっているためです。代替として「SWE-bench Pro」の利用を推奨しています。
全文を読むには有料プランへの登録が必要です。
プランを見る →