
OpenAI が実施した新しい調査により、人気のあるコード評価ツール SWE-Bench Pro に問題があることが明らかになりました。これにより、人工知能モデルのテストにおける同ツールの信頼性と精度に関して疑問が生じています。
分析結果は SWE-Bench Pro の学術および産業用途での利用に影響を与える可能性があります。というのも、その欠陥は AI モデルのパフォーマンス評価の不正確さを招く恐れがあるからです。
編集部コメント
なぜ重要か
これらの結果は SWE-Bench Pro への信頼に影響を与え、その見直しや置き換えにつながる可能性があります。ただし、具体的な影響については現時点では不明であり、さらなる調査が必要です。