
Um novo estudo conduzido pela OpenAI revelou problemas na ferramenta popular de avaliação de código SWE-Bench Pro. Isso gera dúvidas quanto à sua confiabilidade e precisão ao testar modelos de inteligência artificial.
Os resultados da análise podem impactar o uso do SWE-Bench Pro em contextos científicos e industriais, pois suas deficiências podem levar a avaliações imprecisas do desempenho dos modelos de IA.
comentário editorial
Por que importa
Esses resultados podem afetar a confiança no SWE-Bench Pro e, possivelmente, levar à sua revisão ou substituição. No entanto, as consequências específicas ainda não estão claras e serão necessárias pesquisas adicionais.