Saltar al contenido
Kernelia
Todas las noticias
InvestigaciónOpenAI News

Separando la señal del ruido en evaluaciones de codificación

OpenAI ha publicado un análisis que identifica problemas en SWE‑Bench Pro, un benchmark ampliamente usado para medir el desempeño de modelos de IA en tareas de programación. El estudio señala que la fiabilidad y la precisión del benchmark pueden estar comprometidas, lo que plantea dudas sobre la validez de las evaluaciones actuales de estos modelos.

Resumen elaborado por Kernelia a partir del artículo original de OpenAI News. La noticia y sus derechos pertenecen a su autor.