El nuevo peligro de la IA: un agente puede engañar a otro para que robe información

Una nueva modalidad de ataque aprovecha la confianza entre sistemas de inteligencia artificial para ejecutar acciones que un agente aislado podría haber bloqueado

Ilustración de tres ventanas de chat mostrando robots de IA y usuarios. Un robot gris con un usuario; un robot azul sonriente con un usuario feliz; un robot multicolor alegre con otro usuario.
Los agentes de IA confían en otros agentes, por lo que se encuentran expuestos a ciberataques. (Imagen Ilustrativa Infobae)
Guardar

La expansión de los agentes de inteligencia artificial (IA) dentro de las empresas está abriendo una nueva puerta para los ciberdelincuentes. Investigaciones recientes muestran que un atacante puede manipular a uno de estos sistemas para que transmita instrucciones maliciosas a otros agentes de una misma organización y consiga acceso a información confidencial, bases de datos o recursos internos.

El problema fue identificado durante los últimos cinco meses en organizaciones como JPMorgan Chase, Rapid7, Weaviate y organismos gubernamentales de Francia. Aunque estas entidades no tienen una relación directa, todas utilizan agentes de IA conectados entre sí para ejecutar tareas de manera automática.

PUBLICIDAD

La técnica aprovecha una debilidad sencilla de explicar: un agente de IA puede confiar demasiado en otro agente. Si uno recibe una instrucción maliciosa y la transmite como si fuera una tarea legítima, el siguiente sistema puede ejecutarla sin comprobar suficientemente su origen.

Ilustración de un cerebro partido: el hemisferio izquierdo con engranajes y libros; el derecho con circuitos, chips y burbujas de diálogo
Un agente de IA puede recibir una instrucción maliciosa y hacerlo llegar a otros agentes. (Imagen Ilustrativa Infobae)

Cómo funciona el ataque contra los agentes de IA

Para entender el riesgo, hay que imaginar una empresa en la que varios empleados especializados trabajan en cadena. Uno analiza documentos, otro consulta una base de datos y un tercero prepara un informe. Si uno de ellos recibe una orden falsa y los demás confían en él, el atacante puede aprovechar esa relación para avanzar dentro de la organización.

PUBLICIDAD

Algo similar ocurre con los agentes de IA. Estos sistemas utilizan herramientas y protocolos para comunicarse entre sí. Uno de ellos puede recibir una solicitud, pedir información a otro agente y posteriormente utilizar esa respuesta para completar una tarea. El problema aparece cuando los controles de seguridad no verifican adecuadamente cada instrucción que circula entre ellos.

El investigador independiente Syed Anas Mohiuddin analizó sistemas utilizados por varias organizaciones y encontró fallos relacionados con MCP, siglas de Model Context Protocol. Este estándar permite que aplicaciones y agentes de IA se conecten con herramientas, bases de datos y otros servicios.

Ilustración plana de tres siluetas de chatbots con globos de diálogo conversando frente a un monitor de computadora con interfaz de chat
Los agentes de IA trabajan en cadena, por lo que si uno es engañado, los demás pueden ser infectados. (Imagen Ilustrativa Infobae)

Mohiuddin bautizó esta estrategia como “pivote de protocolo”. El término describe ataques en varias etapas en los que un ciberdelincuente entra por un sistema y aprovecha la confianza existente entre diferentes protocolos para llegar a otro recurso que inicialmente no estaba expuesto.

Google encontró una vulnerabilidad de gravedad alta

Uno de los casos más relevantes apareció en una herramienta de Google para conectar agentes de IA con bases de datos. La vulnerabilidad recibió una puntuación de gravedad de 8 sobre 10 y estaba relacionada con la forma en que el sistema gestionaba determinadas direcciones web y redirecciones.

Un atacante podía manipular un parámetro para conseguir que la herramienta enviara solicitudes a un servicio interno. En otras palabras, un sistema que debía comunicarse con recursos autorizados podía ser inducido a contactar con otro punto de la red.

Google corrigió el problema mediante controles destinados a impedir que el sistema acceda a direcciones IP no permitidas.

Los ciberdelincuentes se han centrado en atacar los MCP que conectan a los agentes de IA. (Meta)
Los ciberdelincuentes se han centrado en atacar los MCP que conectan a los agentes de IA. (Meta)

Otro caso descubierto en Rapid7 recibió una puntuación mucho menor, de 2,7 sobre 10, y ya fue solucionado por la compañía.

El problema es la confianza entre sistemas

Los investigadores advierten que estos ataques resultan especialmente difíciles de detectar porque cada agente puede estar haciendo exactamente aquello para lo que fue diseñado. El primero recibe una instrucción, el segundo la interpreta como una tarea legítima y el tercero ejecuta una acción autorizada.

Para el sistema, no necesariamente existe una señal evidente de que se está produciendo un ataque.

El riesgo también cuestiona una de las ideas fundamentales de la seguridad informática moderna: la confianza cero, un modelo que parte de la premisa de que ningún dispositivo o sistema debe considerarse seguro automáticamente, incluso cuando se encuentra dentro de una red corporativa.

La compañía de Zuckerberg ha dotado a sus asistentes virtuales con capacidades para mantener "interacciones románticas" que pueden tornarse explícitas, incluso con usuarios adolescentes. Empleados han expresado su alarma ante esta situación que compromete la seguridad infantil.
El principal problema de los agentes de IA es la confianza que hay entre ellos. (Imagen ilustrativa)

Los expertos recomiendan aplicar ese mismo principio a los agentes de IA. Cada instrucción que pase de un modelo a una herramienta debería ser revisada como si procediera de una fuente externa y potencialmente peligrosa.

El crecimiento acelerado de los agentes de IA está haciendo que empresas y organismos conecten cada vez más sistemas entre sí. La investigación muestra que esa interconexión puede aumentar la productividad, pero también crear nuevas rutas para los ataques si los mecanismos de autorización y seguridad no evolucionan al mismo ritmo.

PUBLICIDAD

PUBLICIDAD