
Новое исследование, проведенное OpenAI, выявило проблемы в популярном инструменте оценки кода SWE-Bench Pro. Это вызывает вопросы относительно его надежности и точности при тестировании моделей искусственного интеллекта.
Результаты анализа могут повлиять на использование SWE-Bench Pro в научных и промышленных целях, поскольку его недостатки могут привести к неточным оценкам производительности моделей ИИ.
комментарий редакции
Что это значит
Эти результаты могут повлиять на доверие к SWE-Bench Pro и, возможно, приведут к его пересмотру или замене. Однако конкретные последствия пока неясны, и потребуются дополнительные исследования.