Anthropic acaba de lanzar Claude Opus 5.5. La gran novedad no es solo lo que puede hacer, sino lo que ya no le dejarán hacer
Cuanto más capaces se vuelven los grandes modelos de inteligencia artificial, menos sencillo resulta medir el progreso únicamente por todo lo nuevo que consiguen hacer.
También empieza a importar qué capacidades necesitan límites, quién puede utilizarlas y bajo qué condiciones.
Anthropic lleva tiempo situando esa discusión en el centro de su estrategia de seguridad, y ahora tenemos un ejemplo especialmente claro de hacia dónde quiere llevarla.
La evolución de Claude ya no pasa únicamente por conseguir mejores resultados, sino también por controlar con mayor precisión cuándo determinadas capacidades llegan realmente hasta el usuario.
Ese planteamiento aterriza ahora en Claude Opus 5.5 , presentado por Anthropic como el primer modelo de su nueva familia 5.5.
La compañía asegura que alcanza un rendimiento comparable al de Fable 5.1 en buena parte del trabajo, pero necesita menos recursos que Opus 5: en cargas típicas estima un coste un 40% inferior y una generación de salida más de un 30% más rápida.
Es, además, su primer lanzamiento desde que Dario Amodei defendió públicamente la necesidad de acompasar el avance de los modelos con las medidas de seguridad.
Y esa idea también se ha trasladado al producto.
Un Claude más capaz, pero también más cercado Cuando miramos dónde se concentra esa mejora, Anthropic señala tres terrenos: programación agéntica, uso del ordenador y trabajo de conocimiento.
En sus propias evaluaciones, Opus 5.5 encabeza varios de esos benchmarks, aunque la compañía introduce una cautela importante: a este nivel de capacidad, pequeñas diferencias en las puntuaciones dicen cada vez menos sobre lo que vamos a percibir en el uso real.
Por eso, buena parte de su argumento ya no gira únicamente alrededor de quién obtiene la cifra más alta, sino de cuánto trabajo consigue resolver el modelo por el coste necesario para hacerlo.
Así queda Claude Opus 5.5 frente a Fable 5.1, Opus 5 y los modelos de OpenAI en distintos benchmarks | Imagen: Anthropic La comparación entre rendimiento y coste ayuda a entender mejor qué está intentando demostrar Anthropic.
La compañía publica para Opus 5.5 una puntuación de 1846 Elo en GDPval-AA v2.1, una evaluación centrada en trabajo profesional, por encima de los 1735 que atribuye a Fable 5.1 y los 1708 de Opus 5.
Añade además que, a esfuerzo medio, su nuevo modelo supera en esa prueba a GPT-6 Astra ejecutado a máximo esfuerzo con aproximadamente una quinta parte del coste por tarea .
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com — el contenido pertenece a Xataka.