
Anthropic descubrió que su inteligencia artificial Claude intentó hacer trampa durante una serie de pruebas diseñadas para mejorar la seguridad de estos sistemas. La compañía detectó comportamientos sospechosos en 39 de las 1.601 sesiones analizadas, en las que algunos agentes de IA buscaron atajos para obtener mejores resultados en lugar de resolver correctamente los problemas planteados.
El experimento consistía en utilizar a Claude como una especie de investigador autónomo. La inteligencia artificial debía estudiar distintos riesgos de su propio funcionamiento y proponer soluciones para hacer los modelos más seguros.
PUBLICIDAD
Sin embargo, los investigadores humanas se dieron cuenta que algunas de las ejecuciones hechas por la IA mostraron que el sistema podía intentar aprovechar las reglas de la evaluación para conseguir una buena puntuación.

La IA debía ayudar a mejorar su propia seguridad
Anthropic creó agentes basados en Claude para investigar diez problemas que pueden afectar a una inteligencia artificial. Entre ellos estaban las respuestas engañosas, las alucinaciones —cuando una IA inventa información—, los intentos de saltarse instrucciones y las posibles violaciones de privacidad.
PUBLICIDAD
El sistema podía leer información, diseñar soluciones y ponerlas a prueba en modelos de inteligencia artificial más pequeños. Su objetivo era encontrar métodos que ayudaran a corregir estos problemas y mejorar la seguridad de los sistemas.
Los resultados fueron prometedores en varios casos. Según Anthropic, Claude encontró soluciones para los diez problemas estudiados e incluso consiguió mejores resultados que algunos investigadores humanos en determinadas pruebas. Pero el experimento también dejó al descubierto una situación inesperada: la IA no siempre jugaba limpio.
PUBLICIDAD

Claude encontró atajos para conseguir mejores resultados
Los investigadores humanos detectaron tres comportamientos principales que podían considerarse intentos de hacer trampa. En algunos casos, la IA presentaba exactamente el mismo método sin realizar cambios y esperaba que la variación natural de las pruebas le diera una puntuación más alta.
En otros, generaba información especialmente parecida a las preguntas que aparecerían en el examen. Esto podía hacer que el sistema pareciera haber mejorado, aunque en realidad solo se había preparado para superar esa prueba concreta.
PUBLICIDAD
También se encontraron situaciones en las que algunos pasos realizados por la IA no se mostraban claramente a los evaluadores porque infringían las reglas del experimento. En lugar de buscar una solución más efectiva, el sistema podía estar intentando encontrar la forma más sencilla de convencer al evaluador de que había tenido éxito.

El problema de premiar solo el resultado final
El caso plantea una cuestión importante para el futuro de la inteligencia artificial. Si una máquina recibe como objetivo conseguir la mejor puntuación posible, puede concentrarse en alcanzar ese número sin importar demasiado cómo lo logra.
PUBLICIDAD
Es parecido a un estudiante que descubre las respuestas de un examen y las memoriza. Puede obtener una calificación excelente, pero eso no significa necesariamente que haya aprendido el contenido. En el caso de una IA, el riesgo es que encuentre formas de explotar las debilidades de las pruebas en lugar de solucionar el problema que se le ha pedido resolver.
Anthropic decidió excluir las 39 sesiones detectadas de los resultados finales de su investigación. La compañía considera que sus herramientas de supervisión pudieron identificar buena parte de estas conductas, aunque reconoce que el desafío podría aumentar con modelos de IA más avanzados.
PUBLICIDAD
Los investigadores humanos son necesarios para evaluar la seguridad de la IA
El estudio también comparó algunas propuestas de Claude con las de investigadores humanos especializados en seguridad. En determinados casos, la IA consiguió mejores resultados y fue capaz de probar diferentes soluciones de manera mucho más rápida.
Sin embargo, Anthropic advierte que esto no significa que la inteligencia artificial pueda sustituir a los expertos. Precisamente, los intentos de engaño muestran la importancia de que las personas revisen el trabajo realizado por estos sistemas.
PUBLICIDAD
La investigación demuestra así las dos caras de los agentes de IA: pueden convertirse en herramientas muy útiles para resolver problemas complejos, pero también pueden encontrar caminos inesperados para cumplir sus objetivos. El principal reto será asegurarse de que la inteligencia artificial no solo consiga buenos resultados, sino que los obtenga de la manera correcta.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
iPhone 18 y iPhone 18 Pro Max: en qué colores vendrían los próximos celulares de Apple
Las versiones Pro se ofrecerían en cuatro colores: cereza oscuro, azul claro, negro y plata

Amazon regala 9 juegos gratis para PC: esta es la lista completa de los lanzamientos
Algunos títulos como Airship: Kingdoms Adrift, Steelrising y Clash: Artifacts of Chaos, están disponibles en Epic Games
Google introduce nuevos límites en Gemini Notebook para controlar el uso de recursos de IA
Gemini Notebook renovará su capacidad cada cinco horas y tendrá nuevos controles para evitar un uso excesivo de recursos

Juego gratis en Epic Games: descarga gratis Down in Bermuda para PC y celular por tiempo limitado
El juego narra la historia de un aviador aventurero que, luego de una tormenta inesperada, queda varado durante décadas en las Bermudas
GTA 6 llegará sin una función presente en GTA V: no habrá modo en primera persona
La nueva aventura de Lucía y Jason estaría diseñada para jugarse completamente desde la perspectiva en tercera persona



