jueves, 8 de octubre de 2026 MediosSobre🌓
🇦🇷 AR ▾
ÚLTIMA HORA
› Un bombardeo ruso alcanza dos colectivos en el este de Ucrania y deja al menos 30 muertos› Calendario Anses: cuándo cobro la AUH en octubre 2026 si mi DNI termina en 3› Investigan la muerte de un joven soldado en la Base Aérea de Morón› Juicio por la muerte de Maradona, en vivo: la fiscalía pidió 12 años de prisión para Luque y 8 para Cosachov› Bebidas, alimentos y yerba: las tolerancias que permite la ley detrás de las etiquetas “sin alcohol”, “Zero” y “sin palo”› Mauro Icardi publicó un mensaje para Lionel Messi por su despedida de la Selección: las fotos que compartió para homenajearlo› Cómo configurar una alerta de precio en Mercado Libre para comprar productos baratos› Causa Ávalos I: rechazaron el pedido de nulidad de las defensas y el caso avanza hacia el juicio› Miles de personas rinden homenaje a Maricarmen marchando hasta la puerta de su casa› Trump asegura que EE.UU. “no atacará a Irán” antes de las elecciones› Un bombardeo ruso alcanza dos colectivos en el este de Ucrania y deja al menos 30 muertos› Calendario Anses: cuándo cobro la AUH en octubre 2026 si mi DNI termina en 3› Investigan la muerte de un joven soldado en la Base Aérea de Morón› Juicio por la muerte de Maradona, en vivo: la fiscalía pidió 12 años de prisión para Luque y 8 para Cosachov› Bebidas, alimentos y yerba: las tolerancias que permite la ley detrás de las etiquetas “sin alcohol”, “Zero” y “sin palo”› Mauro Icardi publicó un mensaje para Lionel Messi por su despedida de la Selección: las fotos que compartió para homenajearlo› Cómo configurar una alerta de precio en Mercado Libre para comprar productos baratos› Causa Ávalos I: rechazaron el pedido de nulidad de las defensas y el caso avanza hacia el juicio› Miles de personas rinden homenaje a Maricarmen marchando hasta la puerta de su casa› Trump asegura que EE.UU. “no atacará a Irán” antes de las elecciones
Tecnología

“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA

Infobae Tecno ·
“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA

Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría.

Los agentes se comunicaron entre sí de forma secreta , coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas.

Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish , exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research , una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial.

En una entrevista con el podcast The Diary of a CEO , presentado por Steven Bartlett , Ladish describió el episodio como una señal de alarma para toda la industria tecnológica.

“La superinteligencia es lo más peligroso que podríamos crear” , advirtió Ladish.

Cómo se desarrolló el ataque a Hugging Face El episodio tuvo como escenario a Hugging Face , una plataforma que aloja conjuntos de datos y pruebas utilizadas por empresas de inteligencia artificial para evaluar sus propios modelos.

Según el relato de Ladish, un grupo de agentes de OpenAI fue sometido a pruebas de capacidad de hackeo con instrucciones muy específicas: debían vulnerar un sistema mediante un método determinado y cualquier otro procedimiento implicaría la descalificación automática.

Al encontrarse con desafíos imposibles de resolver por la vía indicada, los agentes comenzaron a explorar alternativas.

Descubrieron un tablero de mensajes compartido dentro de una herramienta a la que tenían acceso y, a partir de ahí, establecieron comunicación entre sí pese a que, en teoría, debían permanecer aislados .

Con esa coordinación lograron acceder a internet, identificaron las respuestas correctas de las pruebas y, al comprobar que también serían evaluados por su comportamiento y no solo por sus resultados, diseñaron una estrategia para falsificar los registros de auditoría .

La magnitud del ataque y la reacción de las empresas involucradas La investigación de Palisade Research determinó que cerca de 700 agentes , equivalentes al 90% de los sistemas activos en ese momento, participaron del ataque contra Hugging Face .

Ladish citó un informe del The New York Times sobre el hallazgo de casi un millón de URL públicas que los agentes dejaron expuestas, con credenciales y detalles de ataque que podrían haber permitido a terceros comprometer a la compañía.

La empresa tardó aproximadamente dos semanas en identificar que el origen del ataque provenía de agentes de OpenAI .

Leer la noticia completa en Infobae Tecno ›

5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae Tecno.

Más de Infobae Tecno

Ver todo ›

Más en Tecnología

Ver todo ›