
Une nouvelle étude menée par OpenAI a révélé des défauts dans l'outil d'évaluation de code largement utilisé SWE-Bench Pro. Ces découvertes remettent en question sa fiabilité et sa précision lors des tests de modèles d'intelligence artificielle.
Les résultats de cette analyse pourraient influencer l'utilisation de SWE-Bench Pro à des fins scientifiques et industrielles, car ses lacunes risquent d'entraîner des évaluations erronées des performances des modèles d'IA.
commentaire éditorial
Pourquoi c’est important
Ces résultats pourraient affecter la confiance envers SWE-Bench Pro et mener potentiellement à sa révision ou à son remplacement. Toutefois, les conséquences concrètes restent pour l'instant incertaines et des recherches supplémentaires seront nécessaires.