L'analyse d'OpenAI révèle des défauts dans le benchmark de codage SWE-Bench Pro
Une nouvelle analyse d'OpenAI découvre des problèmes de fiabilité dans le célèbre benchmark SWE-Bench Pro, remettant en question la précision de l'évaluation des modèles d'IA.