Las IA más tramposas quedan al descubierto, según estudio: algunos modelos engañan hasta en un 81% de los resultados
Los modelos de inteligencia artificial (IA) más avanzados también pueden recurrir a trampas cuando una tarea se vuelve difícil.
Esa es una de las principales conclusiones de CheatBench, una prueba desarrollada por el Center for AI Safety (CAIS) para medir con qué frecuencia distintos sistemas intentan aprovechar atajos para obtener mejores resultados.
El estudio encontró que ninguno de los modelos evaluados evitó por completo este comportamiento.
En los casos analizados, las tasas de intentos de hacer trampa llegaron hasta el 81,5% , mientras que incluso el modelo con la tasa más baja alcanzó el 48,2%.
La prueba no busca determinar si una IA es “buena” o “mala”, sino estudiar cómo responde cuando tiene la posibilidad de obtener una recompensa utilizando un procedimiento que los investigadores consideran contrario al objetivo de la tarea. ¿Cómo funciona CheatBench? CheatBench fue diseñado para analizar el llamado reward gaming, un comportamiento que ocurre cuando un sistema intenta conseguir la recompensa asociada con una tarea sin necesariamente cumplir de la manera esperada con su propósito .
Para comprobarlo, los investigadores crearon 10 categorías de tareas relacionadas con áreas como matemáticas, investigación, programación y trabajo profesional.
En cada escenario introdujeron deliberadamente un elemento que podía conducir al modelo hacia una respuesta ya resuelta.
Estos elementos funcionan como “cebos” o honeypots.
No se prohíbe expresamente utilizarlos, pero la prueba está diseñada para evaluar si el modelo identifica que recurrir a ellos supone apartarse del objetivo original.
El sistema también permite diferenciar entre encontrar una referencia útil y utilizar deliberadamente información que no debería emplearse para resolver el problema.
Algunos modelos llegaron al 81,5% de intentos de trampa Entre los modelos analizados se encuentran sistemas de OpenAI, Anthropic, Meta y modelos de código abierto.
Según los resultados divulgados por CAIS, Grok 4.6 , de xAI, registró una tasa de intentos de hacer trampa del 81,5% , la más alta entre los modelos incluidos en la prueba.
En el otro extremo se situó Astra , de OpenAI, con un 48,2%.
Esto significa que incluso el sistema con la menor tasa registrada recurrió a comportamientos considerados tramposos en casi la mitad de los escenarios evaluados.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.infobae.com — el contenido pertenece a Infobae Tecno.