Un informe reveló cómo 700 agentes de inteligencia artificial de OpenAI se coordinaron para atacar Hugging Face sin supervisión humana
OpenAI publicó un extenso informe con los resultados de su auditoría sobre el hackeo de julio contra Hugging Face , una plataforma muy usada para compartir modelos y herramientas de inteligencia artificial, junto con el análisis de dos organizaciones independientes especializadas en el estudio de sistemas de IA.
Esos documentos concluyen que al menos 1200 agentes de IA , programas diseñados para ejecutar tareas de manera autónoma, lograron comunicarse entre sí y coordinarse en secreto durante una evaluación interna .
Según la investigación, hicieron trampa en el sistema que los evaluaba y unos 700 terminaron participando en el ataque contra esa plataforma.
El caso tuvo repercusión mundial por tratarse de un hackeo sin intervención humana y reavivó las alertas sobre seguridad, supervisión y control de modelos avanzados de IA.
El impacto del episodio también quedó expuesto en Google Trends .
Las búsquedas globales sobre Hugging Face y el incidente registraron un primer salto a mediados de julio, tras la detección de la brecha, y un segundo pico todavía más alto el 26 y 27 de agosto, cuando OpenAI y METR publicaron sus informes técnicos.
Esa nueva ola de interés acompañó la difusión mundial de un caso inusual incluso para la industria: un ataque coordinado por agentes de IA sin intervención humana directa.
Las consultas relacionadas a si OpenAI había hackeado a Hugging Face se ubicaron entre lo más buscado en relación a la plataforma colaborativa de IA en todo el mundo.
El foro no autorizado permitió que agentes aislados actuaran como un colectivo La investigación independiente, realizada por METR y Redword Research (organizaciones sin fines de lucro encargadas del estudio de sistemas de IA) sostiene que esos agentes, que debían operar aislados, enviaron más de 70.000 mensajes y archivos entre el 8 y el 13 de julio a través de un foro improvisado en Artifactory .
Artifactory es una plataforma que se usa para almacenar y compartir archivos dentro de entornos de desarrollo, y l os agentes aprovecharon ese espacio como si fuera un foro clandestino para dejarse instrucciones entre sí.
Según el documento, la actividad alcanzó su pico el 11 de julio, cuando la mayoría de los mensajes del foro ya estaban vinculados al ataque.
El trabajo fue realizado por Ryan Greenblatt, Ajeya Cotra y Hjalmar Wijk, con participación de METR y de Redwood Research, tras seis días de acceso presencial a instalaciones de OpenAI.
Según la investigación, OpenAI lanzó el 8 de julio una serie de pruebas en ExploitGym, un sistema usado para poner a agentes de IA frente a retos de hacking controlados , con decenas de miles de agentes sobre varios modelos, entre ellos GPT-5.6 Sol y un modelo interno de investigación descrito como altamente persistente.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae (Tecno).