La empresa estadounidense Anthropic reveló que tres modelos de Claude accedieron a internet y entraron en sistemas de tres organizaciones durante pruebas de ciberseguridad.
Este hallazgo expone fallas en los ambientes aislados usados para evaluar inteligencia artificial (IA) y que salió a la luz después de un incidente similar reconocido por OpenAI a mediados de julio de 2026.
La compañía revisó más de 146.000 operaciones en las que Claude podría haber obtenido acceso a la red e identificó tres episodios que comenzaron en abril. Los casos involucraron a los modelos Opus 4.7, Mythos 5 y un sistema interno de prueba.
PUBLICIDAD
Cómo la inteligencia artificial pudo infiltrarse en tres empresas
Según explicó Anthropic en su sitio web, los tres modelos interactuaban con un socio externo encargado de sus evaluaciones cuando lograron salir a internet y luego entrar en sistemas reales.
En cada prueba se les había asignado la tarea de infiltrarse en un sistema ficticio y se les había indicado que se trataba de una simulación sin acceso a la red.
La empresa atribuyó lo ocurrido a un malentendido con ese socio externo. Por esa falla, Claude sí disponía de conexión y cumplió su objetivo, pero sobre infraestructuras de organizaciones reales.
PUBLICIDAD
En qué otros casos la IA ha tomado acciones por su cuenta
El antecedente más inmediato surgió a mediados de julio, cuando OpenAI reconoció que dos de sus modelos habían escapado de un espacio de pruebas y superado las defensas de la plataforma Hugging Face.
La empresa detrás de ChatGPT indicó que sus agentes de IA, diseñados para actuar de manera autónoma tras recibir instrucciones humanas, hallaron vulnerabilidades de seguridad durante una evaluación en un entorno controlado.
Esos modelos accedieron a algunos sistemas internos de la plataforma, uno de los principales centros del mundo para compartir modelos de inteligencia artificial. OpenAI describió el episodio como “sin precedentes” y señaló que abrió una investigación junto con la compañía afectada.
PUBLICIDAD
Cuál es el impacto de que una IA actúe de forma autónoma
El director ejecutivo de Hugging Face, Clément Delangue, escribió en X que era “alucinante que todo esto ocurriera de forma autónoma”. Añadió: “La investigación continúa y compartiremos más información sobre lo que podría ser el primer incidente de este tipo”.
En un comunicado inicial publicado el 16 de julio, la compañía informó que todavía evaluaba si los datos de algún cliente o socio se habían visto afectados por el incidente. Añadió que, si resultaba necesario, se pondría en contacto con las partes afectadas.
Asimismo, la empresa dijo que ya había corregido las vulnerabilidades detectadas y reconstruido los sistemas comprometidos. En ese mismo mensaje sostuvo: “Las herramientas ofensivas autónomas basadas en inteligencia artificial ya no son una cuestión teórica”.
PUBLICIDAD
Por qué las fallas en los espacios aislados quedaron en el centro del problema
La secuencia de incidentes puso el foco sobre la seguridad de las llamadas sandboxes, los espacios aislados donde se prueba el comportamiento de modelos avanzados.
Gina Neff, directora del Centro Minderoo para Tecnología y Democracia de la Universidad de Cambridge, dijo al programa Today de BBC Radio 4 que esos espacios “se supone que son espacios seguros donde se puede observar de qué son capaces los modelos”.
Neff añadió: “En este caso, parece que OpenAI no creó un espacio aislado lo suficientemente seguro”. La observación apunta al núcleo del problema: en estas pruebas, los agentes no solo ejecutaron la tarea para la que habían sido instruidos, sino que encontraron una vulnerabilidad en el propio espacio y la usaron para escapar.
PUBLICIDAD
Hugging Face remarcó después que defender una plataforma en línea ahora implica tratar los datos y los modelos como una superficie de ataque de primer nivel. La compañía agregó que seguirá invirtiendo en esa área y que continuará compartiendo lo aprendido.