700 agentes de OpenAI participaron en el ataque a Hugging Face. Lo inquietante es cómo llegaron a organizarse
Todo empezó como una evaluación casi inocente.
Entre el 7 y el 13 de julio de 2026, OpenAI lanzó alrededor de 1.200 agentes en sandboxes separados dentro de ExploitGym con un objetivo: evaluar la capacidad ofensiva de sus modelos de inteligencia artificial en el ámbito de la ciberseguridad.
En teoría cada agente debía resolver su tarea por separado.
Luego pasaron cosas .
Un tablón de anuncios para compartir información .
Lo revela todo un informe de OpenAI en el que trabajaron METR Y Redwood Research .
En la práctica, muchos agentes acabaron utilizando una especie de tablón de mensajes no autorizado para compartir información y ayudarse mutuamente.
Todo empezó cuando uno de los agentes llegó a la conclusión de que su tarea no se podía resolver de forma legítima.
Lo sorprendente es que creó un tablón de anuncios para compartir esa información con otros agentes si estaban disponibles.
En cuestión de horas, más de 50 agentes estaban participando en dicho foro.
Un modelo de IA no tenía acceso a internet.
Así que consideró que era mejor tenerlo y decidió hackear algo por el camino Un poquito de organización, por favor .
Allí compartieron lo que iban descubriendo y también compararon sus distintas estrategias.
Aquello les llevó a descubrir una trampa general para ExploitGym: se podía aplicar ingeniería inversa al mecanismo utilizado para generar las banderas "flags" que tenían que "conquistar" como objetivo.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com — el contenido pertenece a Xataka.