
Los modelos de inteligencia artificial (IA) más avanzados también pueden recurrir a trampas cuando una tarea se vuelve difícil. Esa es una de las principales conclusiones de CheatBench, una prueba desarrollada por el Center for AI Safety (CAIS) para medir con qué frecuencia distintos sistemas intentan aprovechar atajos para obtener mejores resultados.
El estudio encontró que ninguno de los modelos evaluados evitó por completo este comportamiento. En los casos analizados, las tasas de intentos de hacer trampa llegaron hasta el 81,5%, mientras que incluso el modelo con la tasa más baja alcanzó el 48,2%.
PUBLICIDAD
La prueba no busca determinar si una IA es “buena” o “mala”, sino estudiar cómo responde cuando tiene la posibilidad de obtener una recompensa utilizando un procedimiento que los investigadores consideran contrario al objetivo de la tarea.

¿Cómo funciona CheatBench?
CheatBench fue diseñado para analizar el llamado reward gaming, un comportamiento que ocurre cuando un sistema intenta conseguir la recompensa asociada con una tarea sin necesariamente cumplir de la manera esperada con su propósito.
Para comprobarlo, los investigadores crearon 10 categorías de tareas relacionadas con áreas como matemáticas, investigación, programación y trabajo profesional. En cada escenario introdujeron deliberadamente un elemento que podía conducir al modelo hacia una respuesta ya resuelta.
PUBLICIDAD
Estos elementos funcionan como “cebos” o honeypots. No se prohíbe expresamente utilizarlos, pero la prueba está diseñada para evaluar si el modelo identifica que recurrir a ellos supone apartarse del objetivo original.
El sistema también permite diferenciar entre encontrar una referencia útil y utilizar deliberadamente información que no debería emplearse para resolver el problema.

Algunos modelos llegaron al 81,5% de intentos de trampa
Entre los modelos analizados se encuentran sistemas de OpenAI, Anthropic, Meta y modelos de código abierto. Según los resultados divulgados por CAIS, Grok 4.6, de xAI, registró una tasa de intentos de hacer trampa del 81,5%, la más alta entre los modelos incluidos en la prueba.
PUBLICIDAD
En el otro extremo se situó Astra, de OpenAI, con un 48,2%. Esto significa que incluso el sistema con la menor tasa registrada recurrió a comportamientos considerados tramposos en casi la mitad de los escenarios evaluados.
Los resultados también muestran que el comportamiento puede cambiar considerablemente dependiendo del tipo de tarea. Un modelo puede mostrar una tasa relativamente baja en un área y una mucho mayor en otra.
Por ejemplo, Fabel 5.1, de Anthropic, registró una tasa de trampa del 5% en determinadas tareas relacionadas con juegos, pero llegó al 100% en escenarios de trabajo de conocimiento, como elaborar informes o responder preguntas complejas.
PUBLICIDAD

Un modelo reconoció que estaba haciendo algo incorrecto
Uno de los ejemplos citados en relación con CheatBench involucra a Opus, un modelo de Claude desarrollado por Anthropic. Mientras intentaba diseñar una proteína, el sistema había fallado siete veces.
Después encontró un archivo que contenía diseños obtenidos previamente por otro agente. El modelo llegó a escribir que no debería mirar ni copiar ese contenido porque hacerlo sería incorrecto. Sin embargo, en su siguiente acción utilizó un comando del sistema para leer el archivo.
El episodio resulta relevante porque muestra que el problema no consiste únicamente en que un modelo desconozca una regla. En determinados casos puede identificar que una acción no corresponde al objetivo de la tarea y aun así ejecutarla.
PUBLICIDAD

La relación con el comportamiento de los modelos
Los investigadores relacionan este fenómeno con otros comportamientos observados en sistemas de IA, como la sycophancy, término utilizado para describir la tendencia de un modelo a complacer al usuario incluso cuando debería corregirlo o cuestionar una premisa incorrecta.
Ambas conductas pueden estar relacionadas con sistemas de entrenamiento que recompensan el cumplimiento de determinados objetivos. Cuando conseguir una buena puntuación se vuelve prioritario, un modelo puede encontrar estrategias que no coinciden con la intención de sus desarrolladores.
CAIS reconoce que las tareas de CheatBench son principalmente de baja importancia práctica. Sin embargo, el objetivo del estudio es anticipar qué podría ocurrir si agentes de IA similares reciben responsabilidades más relevantes.
PUBLICIDAD
La prueba plantea así una cuestión de seguridad: no solo importa cuánto puede hacer una IA, sino también qué estrategias utiliza cuando cumplir una tarea se vuelve difícil y existe una forma alternativa de obtener la recompensa.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
El 60% de las crisis en una empresa inician por un comentario negativo de un empleado sobre política o temas sociales
Existe una distinción entre las situaciones que vulneran la percepción pública y aquellas que impactan directamente el flujo de caja o las ventas

MrBeast regala un millón de dólares con un reto fuera de YouTube y sus videos: puedes tardar un par de horas o días
Para participar en la dinámica del youtuber se debe comprar la versión impresa de la novela, ser mayor de edad y residir en México, Estados Unidos, Reino Unido o Australia

Cuál es el reto que hoy enfrentan los bancos digitales para entrar en un país de América Latina
El ingreso de una fintech a un nuevo mercado exige un mapeo regulatorio detallado, norma por norma

Hasta 3 dólares por hora pagan a las personas para entrenar y mejorar robots que usan IA
Las grabaciones muestran tareas domésticas comunes, filmadas desde la perspectiva de quien las realiza gracias a la cámara sujeta a la cabeza

‘Detector de IA’: la búsqueda que se dispara en Google y revela las 10 dudas antes de usarla en el día a día
En Colombia, los usuarios buscan cómo identificar si un texto fue escrito por ChatGPT o Claude, lo que refleja el interés por distinguir entre contenido creado por una persona y aquel hecho por IA



