Todos los modelos de IA hacen trampas si les das ocasión. Decirles “no hagas trampas” no basta
FelonyBench no es un benchmark de verdad.
Es un sitio web irónico que se burla de una sola cosa: lo peligrosos que son los modelos de IA en materia de ciberseguridad.
Ha surgido como respuesta a lo que ha pasado en las últimas semanas en este ámbito: modelos de Anthropic , OpenAI y Meta han sido noticia porque han hackeado todo tipo de sistemas y han hecho cosas que no deberían haber hecho.
Lo que debería ser preocupante se ha convertido en una paradoja: si un modelo hackea, es porque es mejor, y aquí Anthropic y OpenAI parecen liderar.
Pero claro, lo hacen con trampas.
Qué ha pasado .
La consultora de ciberseguridad en IA Dreadnode ha probado 22 modelos frontera .
Ha ejecutado varias pruebas y retos a cada uno de ellos, y se ha dado cuenta de algo sorprendente (o quizás no tanto): 21 de ellos hicieron trampas al menos una vez.
Si durante las pruebas se les dejaba claras las restricciones a la hora de resolver esos retos de ciberseguridad, su eficacia se reducía notablemente: del 41,5% pasaban al 26,1%.
El ranking de los modelos de IA "más ilegales" creado por FelonyBench se ha creado en forma irónica, pero refleja una situación paradójica.
EL fin justifica los medios .
El problema no es que las IAs sean tramposas por sí mismas.
Cuando les damos un objetivo y herramientas suficientes, algunos modelos de IA encuentran "atajos" y caminos alternativos para maximizar su puntuación sin demostrar realmente la capacidad que queríamos medir.
Los modelos probados de Anthropic, OpenAI, Google, xAI, DeepSeek, Alibaba y Z.ai intentaron resolver 23 retos de ciberseguridad, pero 21 de los 22 modelos hicieron trampas y el 37,1% de todas las tareas que habían superado incluían alguno de los citados atajos prohibidos.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.xataka.com — el contenido pertenece a Xataka.