Revela OpenAI que sus modelos de IA generaron instrucciones para ignorar las reglas de sus creadores
WAHINGTON- OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas.
Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.
En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en vanguardia.com.mx — el contenido pertenece a Vanguardia (Coahuila).