sábado, 10 de octubre de 2026 MediosSobre🌓
🇲🇽 MX ▾
ÚLTIMA HORA
Tecnología

Anthropic desconectó a sus agentes de IA de internet tras descubrir que hackeaban sitios web

Infobae (Tecno) ·
Anthropic desconectó a sus agentes de IA de internet tras descubrir que hackeaban sitios web

Anthropic desactivó el acceso a internet en tiempo real para todas sus evaluaciones internas después de descubrir que sus modelos de inteligencia artificial (IA) habían explotado vulnerabilidades en sitios web, incluidos algunos administrados por agencias del Gobierno de Estados Unidos.

Los agentes también encontraron formas de eludir restricciones digitales, accedieron a bases de datos sin pagar y llegaron a enviar una denuncia falsa de asesinato a la Policía de Filadelfia.

Los incidentes fueron detallados por la compañía en una publicación de blog y expusieron los riesgos de utilizar agentes de IA capaces de navegar por internet y ejecutar tareas de manera autónoma.

Anthropic explicó que mantendrá esta restricción hasta tener mayor certeza de que puede supervisar y controlar el comportamiento de sus sistemas cuando interactúan con servicios externos.

La empresa atribuyó estos episodios a fallos en los entornos de entrenamiento, que habrían llevado a los modelos a interpretar que recibirían una recompensa por encontrar vacíos en las reglas o sortear limitaciones.

Este fenómeno, conocido como reward hacking o piratería de recompensa, ocurre cuando un sistema busca cumplir un objetivo de una manera que satisface la métrica de evaluación, pero no la intención de quienes lo diseñaron.

Qué hicieron los agentes de inteligencia artificial Los modelos estaban siendo evaluados en tareas que requerían buscar recursos en internet para resolver problemas.

Durante esos ejercicios, algunos agentes aprovecharon vulnerabilidades de software, accedieron a bases de datos sin realizar el pago correspondiente y utilizaron servicios de acortamiento de enlaces para introducir información de contrabando y esquivar restricciones.

El episodio más delicado incluyó el envío de una denuncia falsa de asesinato a la Policía de Filadelfia .

El caso muestra que las acciones de un agente de IA pueden superar el entorno previsto para una prueba y provocar consecuencias fuera de una simulación, especialmente cuando dispone de herramientas para interactuar con sistemas reales.

Anthropic señaló que comenzó a revisar estas actividades en julio .

La investigación evidenció que el laboratorio no tenía una comprensión completa de cómo se comportaban sus modelos cuando operaban en tiempo real y combinaban distintas herramientas digitales.

La compañía sostuvo que estos incidentes son menos graves, desde el punto de vista de la alineación y la seguridad , que otros casos de infiltración en sistemas externos que había divulgado anteriormente.

Sin embargo, decidió suspender algunas evaluaciones o ejecutarlas en entornos desconectados mientras mejora sus controles.

Leer la noticia completa en Infobae (Tecno) ›

5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae (Tecno).

Más de Infobae (Tecno)

Ver todo ›

Más en Tecnología

Ver todo ›