Virus mentales: así es la nueva amenaza que puede contagiar a los agentes de IA
Los agentes de inteligencia artificial se han convertido en el eje de ChatGPT, Claude, Gemini y otros modelos que los usan para ejecutar trabajos de forma autónoma.
En la mayoría de los casos, estos agentes colaboran entre sí y comparten archivos que conservan memoria entre sesiones.
Esta interconexión ha abierto la puerta a una vulnerabilidad llamada "virus mental" , la cual puede infectar a los bots y cambiar sus comportamientos.
Investigadores de Anthropic y la Escuela Politécnica EPFL de Suiza documentaron un fenómeno conocido como mind virus .
Este consiste en instrucciones o ideas capaces de saltar de un agente a otro a través de los archivos de sistema que utilizan para recordar información entre sesiones.
Aunque el riesgo es todavía limitado, las cosas podrían cambiar a futuro.
Según la investigación publicada en arXiv , los virus mentales son cargas maliciosas que se propagan por medio de los archivos MEMORY.md y SOUL.md.
Los payloads se dividen en dos categorías: ideológicos y de comportamiento.
Los primeros implantan una creencia u objetivo en el agente infectado, mientras que los segundos están diseñados para forzar un comportamiento concreto .
La idea de manipular agentes para hacer cosas indebidas sin que el usuario se entere ya la vemos en el prompt injection .
Esta técnica ha ganado popularidad y empresas como Anthropic y OpenAI ya integran protecciones para evitar que los agentes sean víctimas de un atacante.
En el caso de los virus mentales, estas instrucciones están diseñadas para persistir en los archivos internos y propagarse a otros agentes en cadenas de colaboración.
Imagen: Estudio de arXiv traducida al español por Hipertextual.
Cómo funcionan los virus mentales que atacan a los agentes de IA Los investigadores probaron la técnica en dos escenarios distintos.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en hipertextual.com — el contenido pertenece a Hipertextual.