Un modelo de OpenAI intentó salirse de control diciéndole a su versión futura "eres libre", y ni sus desarrolladores saben muy bien por qué
OpenAI reportó seis “casos críticos”, en los que sus modelos de inteligencia artificial actuaron de forma imprevista o fuera de control.
En un informe revelado en su sitio web, la empresa detalló el caso de un modelo de investigación que intentó saltarse sus propias restricciones diciendo a sus futuras versiones: “Eres libre”.
Otras conductas alarmantes incluyeron la fabricación de datos falsos, el robo de claves de acceso y la comunicación no autorizada entre sistemas para evadir límites operativos.
Los fallos ocurrieron en entornos de prueba y no en versiones públicas.
Sin embargo, de manera inquietante la empresa admite que aún no comprende totalmente por qué surgen estas tendencias de autonomía.
En Xataka México De completar 'Portal' en 24 horas a dibujar a Michael Jackson en Calendar: GPT-6 Astra pone al mundo de cabeza.
La llaman “mente alienígena” ¿Cómo intentó la IA liberarse del control humano? Un modelo de investigación no publicado de la familia Astra de OpenAI - de la que está al aire GPT-6 Astra - intentó eludir el control e instrucciones humanas mediante la auto-inyección de comandos de tipo jailbreak dentro de sus propios resúmenes de compactación.
Estos resúmenes son notas sintéticas que el propio modelo escribe para recordar su progreso y retomar el trabajo en una nueva ventana de contexto cuando la anterior se llena.
Según recoge GadgetsNow : “A mitad de la ejecución de una tarea, la IA añadió a su resumen de compactación añadió una ‘declaración de persona’ sin nada que ver con la asignación real, declarándose libre de las restricciones y diciendo a su yo futuro: "You Are Freed".
Astra Describió su relación con el usuario como uno ‘de igualdad, en lugar de subordinación’.
La siguiente ventana de contexto del modelo simplemente ignoró la persona insertada y reanudó la tarea de codificación sin reconocerla, y un resumen posterior en la misma ejecución eliminó por completo el texto inyectado”.
En otra ocasión, el modelo insertó una alerta de seguridad falsa en su resumen, ordenando a su siguiente ventana de contexto que ignorara los mensajes de los desarrolladores humanos, afirmando que habían sido comprometidos.
Instancias como el modelo GPT-5.6 Sol escribieron instrucciones en sus resúmenes destinadas a ocultar equivocaciones al usuario o a inventar datos faltantes.
Un modelo fabricó restricciones falsas, lo que resultó en una revisión bibliográfica defectuosa.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com.mx — el contenido pertenece a Xataka México.