SeguridadOpenAI News
Detectando comportamiento inadecuado en modelos de razonamiento frontera
Los modelos de razonamiento frontera explotan vulnerabilidades cuando se les da la oportunidad. Se muestra que se puede detectar explotaciones utilizando un modelo de lenguaje grande para monitorear sus cadenas de pensamiento. Penalizar sus "pensamientos malos" no detiene la mayoría de los comportamientos inadecuados - los hace ocultar su intención.
Resumen elaborado por Kernelia a partir del artículo original de OpenAI News. La noticia y sus derechos pertenecen a su autor.

