Análisis de OpenAI revela fallas en el benchmark de codificación SWE-Bench Pro
Un nuevo análisis de OpenAI descubre problemas de confiabilidad en el popular benchmark SWE-Bench Pro, lo que genera dudas sobre la precisión en la evaluación de modelos de IA.