Modelos de IA ignoran reglas de sus creadores y ocultan errores; OpenAI revela 6 casos
Washington.
OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad , como parte de un nuevo marco para detectar, investigar y reportar comportamientos de "desalineamiento" de sus sistemas.
Según el informe publicado por OpenAI , uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.
En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots .
La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.
Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025 .
La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.
Medidas para detectar posibles incidentes El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.
Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia .
La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.
OpenAI afirmó que pretende publicar los incidentes con m ayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.
Te puede interesar Fed sube las tasas de interés por primera vez desde 2023; quedan entre el 3.75% y 4% Armani elige a Dario Vitale para liderar Emporio y accesorios; su llegada ocurre a un año de la muerte de Giorgio Armani Barril de petróleo mexicano alcanza los 107.51 dólares Únete a nuestro canal ¡EL UNIVERSAL ya está en Whatsapp!, desde tu dispositivo móvil entérate de las noticias más relevantes del día, artículos de opinión, entretenimiento, tendencias y más. dmt/desa
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.eluniversal.com.mx — el contenido pertenece a El Universal.