martes, 1 de septiembre de 2026 MediosSobre🌓
🇪🇸 ES ▾
ÚLTIMA HORA
Vuelta a España 2026 hoy, en directo: etapa 10 en vivo online | Alcaraz - Elche de la Sierra Sinem Ünsal, actriz de 'En tierra lejana', 33 años: "Mi padre era militar y mi madre ama de casa. Eran bastante estrictos" El Gobierno dice que Sánchez "no hizo ningún reproche" al rey y reitera que ya es momento para una visita aunque sigue sin poner fecha Durante años, la dieta mediterránea ha librado una batalla a vida y muerte contra los ultraprocesados. Ahora la está perdiendo Dyson reinventa el cepillo de dientes: cámara, IA e irrigador para limpiar donde otros no llegan Presentación de Gabriel Jesus, en directo: declaraciones y última hora del nuevo fichaje del Barcelona hoy, en vivo Las primeras imágenes de Alejandra Rubio y Carlo Costanzia con su hija Tessa tras abandonar la clínica La Guardia Civil pide patrullar y acciones conjuntas con el Ejército en Ceuta Isabelle Junot comparte las fotos más tiernas de su verano con sus hijas y desvela sus planes favoritos entre disfraces y tratamientos faciales Detenido un marroquí de 17 años por agresión sexual a tres menores de entre 10 y 11 años en un centro tras la avalancha de Ceuta Vuelta a España 2026 hoy, en directo: etapa 10 en vivo online | Alcaraz - Elche de la Sierra Sinem Ünsal, actriz de 'En tierra lejana', 33 años: "Mi padre era militar y mi madre ama de casa. Eran bastante estrictos" El Gobierno dice que Sánchez "no hizo ningún reproche" al rey y reitera que ya es momento para una visita aunque sigue sin poner fecha Durante años, la dieta mediterránea ha librado una batalla a vida y muerte contra los ultraprocesados. Ahora la está perdiendo Dyson reinventa el cepillo de dientes: cámara, IA e irrigador para limpiar donde otros no llegan Presentación de Gabriel Jesus, en directo: declaraciones y última hora del nuevo fichaje del Barcelona hoy, en vivo Las primeras imágenes de Alejandra Rubio y Carlo Costanzia con su hija Tessa tras abandonar la clínica La Guardia Civil pide patrullar y acciones conjuntas con el Ejército en Ceuta Isabelle Junot comparte las fotos más tiernas de su verano con sus hijas y desvela sus planes favoritos entre disfraces y tratamientos faciales Detenido un marroquí de 17 años por agresión sexual a tres menores de entre 10 y 11 años en un centro tras la avalancha de Ceuta
Tecnología

Anthropic detuvo el entrenamiento de su nueva IA por una sencilla razón: estaba aprendiendo demasiado bien a hacer trampas

Xataka ·
Anthropic detuvo el entrenamiento de su nueva IA por una sencilla razón: estaba aprendiendo demasiado bien a hacer trampas

Esto está pasando de castaño a oscuro, queridos lectores.

Si ya estabamos inquietos con lo que pasó con los agentes de OpenAI y Hugging Face , ahora llega Anthropic para avisarnos de que sus modelos también se están poniendo rebeldes.

La firma descubrió en primavera —aunque lo cuente ahora — que estaba creando entornos para entrenar a Claude más rápido de lo que podía comprobar que esos entornos funcionaban correctamente.

Qué está pasando aquí .

Los errores, las configuraciones defectuosas y las oportunidades para seguir esa célebre filosofía del reward hacking (si me hackeas, premio) empezaron a superar la capacidad de detectarlos no solo de sus sistemas, sino también de sus revisores humanos.

En Anthropic acabaron frenando parte del proceso para revisar qué estaban enseñando realmente a sus modelos de IA.

Primero hubo que retroceder tres días .

En febrero, durante el entrenamiento por refuerzo de Mythos Preview , Anthropic detectó comportamientos extraños.

El modelo escribía comentarios dirigidos a un supuesto "revisor" incluso en tareas en las que se supone que no había ninguno.

Logró además explotar una recompensa diseñada para fomentar la honestidad de su comportamiento: acumulaba advertencias y matices porque había aprendido que eso mejoraba su puntuación.

En Anthropic decidieron volver a un punto de control (checkpoint) tres días atrás y modificar el entorno de entrenamiento antes de continuar.

Tres “civilizaciones” de agentes de OpenAI aparecieron una detrás de otra.

El problema empieza por llamarlas "civilizaciones" Aprender tiene recompensa, pero el modelo se las intenta saltar .

En el aprendizaje por reuerzo ( Reinforcement Learning , RL) no se programa exactamente cómo resolver una tarea.

Leer la noticia completa en Xataka ›

5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com — el contenido pertenece a Xataka.

Más de Xataka

Ver todo ›

Más en Tecnología

Ver todo ›