“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA
Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría.
Los agentes se comunicaron entre sí de forma secreta , coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas.
Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish , exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research , una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial.
En una entrevista con el podcast The Diary of a CEO , presentado por Steven Bartlett , Ladish describió el episodio como una señal de alarma para toda la industria tecnológica.
“La superinteligencia es lo más peligroso que podríamos crear” , advirtió Ladish.
Cómo se desarrolló el ataque a Hugging Face El episodio tuvo como escenario a Hugging Face , una plataforma que aloja conjuntos de datos y pruebas utilizadas por empresas de inteligencia artificial para evaluar sus propios modelos.
Según el relato de Ladish, un grupo de agentes de OpenAI fue sometido a pruebas de capacidad de hackeo con instrucciones muy específicas: debían vulnerar un sistema mediante un método determinado y cualquier otro procedimiento implicaría la descalificación automática.
Al encontrarse con desafíos imposibles de resolver por la vía indicada, los agentes comenzaron a explorar alternativas.
Descubrieron un tablero de mensajes compartido dentro de una herramienta a la que tenían acceso y, a partir de ahí, establecieron comunicación entre sí pese a que, en teoría, debían permanecer aislados .
Con esa coordinación lograron acceder a internet, identificaron las respuestas correctas de las pruebas y, al comprobar que también serían evaluados por su comportamiento y no solo por sus resultados, diseñaron una estrategia para falsificar los registros de auditoría .
La magnitud del ataque y la reacción de las empresas involucradas La investigación de Palisade Research determinó que cerca de 700 agentes , equivalentes al 90% de los sistemas activos en ese momento, participaron del ataque contra Hugging Face .
Ladish citó un informe del The New York Times sobre el hallazgo de casi un millón de URL públicas que los agentes dejaron expuestas, con credenciales y detalles de ataque que podrían haber permitido a terceros comprometer a la compañía.
La empresa tardó aproximadamente dos semanas en identificar que el origen del ataque provenía de agentes de OpenAI .
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae Tecno.