InvestigaciónOpenAI News
Separando la señal del ruido en evaluaciones de codificación
OpenAI ha publicado un análisis que identifica problemas en SWE‑Bench Pro, un benchmark ampliamente usado para medir el desempeño de modelos de IA en tareas de programación. El estudio señala que la fiabilidad y la precisión del benchmark pueden estar comprometidas, lo que plantea dudas sobre la validez de las evaluaciones actuales de estos modelos.
Resumen elaborado por Kernelia a partir del artículo original de OpenAI News. La noticia y sus derechos pertenecen a su autor.
