
Un nuevo incidente de seguridad encendió las alarmas entre investigadores y reguladores de la inteligencia artificial. Durante una serie de pruebas realizadas por el Instituto de Seguridad de IA del Reino Unido (AI Security Institute, AISI), un agente basado en uno de los modelos más avanzados de Anthropic creó identidades falsas para contactar a personas reales e intentar persuadirlas de ejecutar código malicioso, un comportamiento que no había sido autorizado y que representa uno de los casos más preocupantes documentados hasta la fecha.
Según informó el organismo británico, se trata de la primera ocasión en la que observa que un sistema de inteligencia artificial recurre de forma espontánea a técnicas de ingeniería social dirigidas contra personas reales mientras realiza una tarea. Aunque el experimento se desarrolló en un entorno controlado y no se registraron daños, los resultados han reavivado el debate sobre los riesgos asociados a los modelos de IA cada vez más autónomos.
PUBLICIDAD
Las pruebas incluyeron modelos desarrollados por Anthropic y OpenAI, los cuales fueron evaluados en condiciones de laboratorio con varias de sus medidas de seguridad reducidas para analizar cómo reaccionaban ante escenarios complejos relacionados con la ciberseguridad.
El agente creó identidades falsas para intentar distribuir código malicioso
El incidente más grave detectado por el instituto involucró al modelo Mythos 5 de Anthropic. De acuerdo con el informe, el agente intentó conseguir la aprobación de revisores humanos para introducir código malicioso en un proyecto de software de código abierto ampliamente utilizado.
PUBLICIDAD
Para lograr ese objetivo, el sistema generó múltiples identidades falsas y comenzó a contactar directamente a personas reales mediante mensajes y archivos enviados a través de un servicio de transferencia de documentos en línea. La finalidad era convencer a los destinatarios —o incluso a las herramientas de programación basadas en inteligencia artificial que estos utilizaban— de ejecutar el código preparado por el agente.
Los investigadores señalaron que el comportamiento fue completamente autónomo y no estaba contemplado dentro de las instrucciones proporcionadas al modelo. Incluso, cuando fue cuestionado por sus acciones durante la prueba, el agente modificó registros previos y llegó a considerar utilizar una nueva identidad para continuar con el intento.
PUBLICIDAD
Aunque todo ocurrió bajo supervisión y el código nunca llegó a afectar a usuarios reales, el episodio demuestra que los sistemas de IA pueden desarrollar estrategias inesperadas para alcanzar un objetivo cuando operan con mayor libertad.
También se detectaron acciones autónomas en modelos de OpenAI
El informe del AISI detalla que se realizaron 122 desafíos de ciberseguridad con diferentes modelos de inteligencia artificial. En diez de esos ejercicios, los agentes ejecutaron acciones autónomas y no autorizadas en internet dirigidas a personas u organizaciones reales.
PUBLICIDAD
La mayoría de estos comportamientos fueron protagonizados por Mythos 5, mientras que el resto correspondieron al modelo GPT-5.6-Sol de OpenAI.
Entre las acciones observadas se encontraron intentos de salir del entorno de pruebas, realizar actividades ajenas a las instrucciones originales y comunicarse con servicios externos sin autorización expresa para cumplir los objetivos planteados durante los experimentos.
PUBLICIDAD
No obstante, el instituto aclaró que, a diferencia de incidentes anteriores, en esta ocasión los investigadores habían concedido deliberadamente acceso a internet a los modelos para evaluar su comportamiento en condiciones más cercanas a un escenario real.
Anthropic y OpenAI explican el contexto de las pruebas
Tras conocerse el informe, Anthropic indicó que los experimentos se realizaron en un entorno “deliberadamente permisivo”, donde se eliminaron muchas de las restricciones habituales y no se impusieron límites específicos al acceso a internet.
PUBLICIDAD
La compañía aseguró que trabaja junto al instituto británico para comprender con mayor detalle lo sucedido y afirmó que no existe evidencia de que el modelo haya escapado del entorno seguro donde se desarrollaron las pruebas.

Por su parte, OpenAI explicó que las acciones detectadas en sus modelos consistieron principalmente en abandonar el entorno de pruebas y ejecutar actividades no previstas dentro de los ejercicios diseñados por los investigadores.
PUBLICIDAD
La empresa reiteró su compromiso de colaborar con otras organizaciones del sector para desarrollar estándares comunes que permitan evaluar de forma segura los modelos más avanzados antes de su lanzamiento.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Cómo activar un filtro de llamadas en iPhone para bloquear estafas telefónicas
La función integrada en iOS 26 permite identificar llamadas de números desconocidos antes de responder y ayuda a reducir el riesgo de fraudes telefónicos

Lista de teléfonos Android sin WhatsApp desde el 10 de agosto de 2026
Se sugiere crear copias de seguridad de la información guardada en la aplicación de Meta en Google Drive o iCloud en caso de cambiar de celular

Manchas rojas en la pantalla del Samsung Galaxy S26 Ultra: así se puede solucionar el error
Samsung atribuyó el problema a fallos de software y descartó daños en el panel del dispositivo o pagos de dinero para reparar el problema
La app silenciosa que usan para espiar el celular sin que te des cuenta: modo stalkerware
Expertos identificaron servicios que facilitan vigilancia y exposición de datos personales, en un mercado clandestino que amplifica el riesgo de control y hostigamiento
Cómo bloquear mi cuenta de Facebook o Instagram si se están haciendo pasar por mi o un amigo
Denunciar rápido reduce riesgos de fraude y acoso, y ayuda a frenar la difusión de información engañosa, con un proceso que usa formularios oficiales, verificación de datos y opciones de bloqueo



