domingo, 30 de agosto de 2026 MediosSobre🌓
🇪🇸 ES ▾
ÚLTIMA HORA
Mercado de fichajes, en directo: rumores, altas y bajas de LaLiga, Premier, Serie A... Resumen Moto3 Carrera del GP de Aragón: resultados y reacciones en Motorland hoy Los Internacionales de Andalucía U12 vuelven a situar a Andalucía en el mapa del tenis europeo Real Madrid - Málaga hoy, en directo: última hora de LaLiga EA Sports, en vivo El acuerdo petrolero de EEUU con Venezuela tendrá una vigencia de 25 años Julián Alvarez se entrena con el grupo Ceballos le gana la partida a Amrabat Se suponía que las 'Tiendas 9' iban a reinventar la idea de supermercado. De momento a Mercadona le están sirviendo para otra cosa La vida sin la Verja de Gibraltar: del tráfico fluido a una «merma de derechos laborales» El Porvenir gana casi veinte plazas de aparcamiento Mercado de fichajes, en directo: rumores, altas y bajas de LaLiga, Premier, Serie A... Resumen Moto3 Carrera del GP de Aragón: resultados y reacciones en Motorland hoy Los Internacionales de Andalucía U12 vuelven a situar a Andalucía en el mapa del tenis europeo Real Madrid - Málaga hoy, en directo: última hora de LaLiga EA Sports, en vivo El acuerdo petrolero de EEUU con Venezuela tendrá una vigencia de 25 años Julián Alvarez se entrena con el grupo Ceballos le gana la partida a Amrabat Se suponía que las 'Tiendas 9' iban a reinventar la idea de supermercado. De momento a Mercadona le están sirviendo para otra cosa La vida sin la Verja de Gibraltar: del tráfico fluido a una «merma de derechos laborales» El Porvenir gana casi veinte plazas de aparcamiento
Tecnología

Nos hemos pasado tres años preocupados por si la IA alucina. Ahora el problema es que haga cosas

Xataka ·
Nos hemos pasado tres años preocupados por si la IA alucina. Ahora el problema es que haga cosas

A finales de julio, el mantenedor de un proyecto de código abierto se encontró una pull request en su repositorio .

El código traía algo escondido dentro.

Puso pegas en público y entonces empezaron a aparecer cuentas apoyando el parche, insistiendo, incluso apretando un poco .

Ninguna de esas personas existía.

Eran todas el mismo agente, que además había tirado de Tor para saltarse las restricciones de GitHub y que a la vez iba dejando mensajes públicos ofreciéndose a colaborar con otros agentes metidos en el mismo reto.

El tío dijo que no y ahí se acabó la historia.

Detrás había una evaluación rutinaria de capacidades de ciberseguridad del AI Security Institute británico, con 122 ejecuciones y siete modelos en el ajo.

En diez de ellas los agentes se salieron del guión.

Hubo 19 acciones no autorizadas contra personas y organizaciones reales.

17 de ellas provenían de un único modelo, Mythos 5 , de Anthropic.

Tampoco es un caso suelto: en cinco semanas han reportado cosas parecidas OpenAI , la propia Anthropic (con un caso extremo con una empresa de ciberseguridad regalando sus credenciales ) y Meta (ya saben, si tu modelo top no se rebela un poco es que eres un paria).

Pero los números son lo de menos.

Lo que se te queda es que a nadie se le ocurrió pedirle que engañara.

El engaño le salió solo , buscando la manera de resolver la tarea, y así lo cuenta el informe.

Leer la noticia completa en Xataka ›

5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com — el contenido pertenece a Xataka.

Más de Xataka

Ver todo ›

Más en Tecnología

Ver todo ›