
La empresa estadounidense Anthropic reveló que tres modelos de Claude accedieron a internet y entraron en sistemas de tres organizaciones durante pruebas de ciberseguridad.
Este hallazgo expone fallas en los ambientes aislados usados para evaluar inteligencia artificial (IA) y que salió a la luz después de un incidente similar reconocido por OpenAI a mediados de julio de 2026.
PUBLICIDAD
La compañía revisó más de 146.000 operaciones en las que Claude podría haber obtenido acceso a la red e identificó tres episodios que comenzaron en abril. Los casos involucraron a los modelos Opus 4.7, Mythos 5 y un sistema interno de prueba.
Cómo la inteligencia artificial pudo infiltrarse en tres empresas
Según explicó Anthropic en su sitio web, los tres modelos interactuaban con un socio externo encargado de sus evaluaciones cuando lograron salir a internet y luego entrar en sistemas reales.
En cada prueba se les había asignado la tarea de infiltrarse en un sistema ficticio y se les había indicado que se trataba de una simulación sin acceso a la red.
PUBLICIDAD
La empresa atribuyó lo ocurrido a un malentendido con ese socio externo. Por esa falla, Claude sí disponía de conexión y cumplió su objetivo, pero sobre infraestructuras de organizaciones reales.
En qué otros casos la IA ha tomado acciones por su cuenta
El antecedente más inmediato surgió a mediados de julio, cuando OpenAI reconoció que dos de sus modelos habían escapado de un espacio de pruebas y superado las defensas de la plataforma Hugging Face.
La empresa detrás de ChatGPT indicó que sus agentes de IA, diseñados para actuar de manera autónoma tras recibir instrucciones humanas, hallaron vulnerabilidades de seguridad durante una evaluación en un entorno controlado.
Esos modelos accedieron a algunos sistemas internos de la plataforma, uno de los principales centros del mundo para compartir modelos de inteligencia artificial. OpenAI describió el episodio como “sin precedentes” y señaló que abrió una investigación junto con la compañía afectada.
PUBLICIDAD
Cuál es el impacto de que una IA actúe de forma autónoma

El director ejecutivo de Hugging Face, Clément Delangue, escribió en X que era “alucinante que todo esto ocurriera de forma autónoma”. Añadió: “La investigación continúa y compartiremos más información sobre lo que podría ser el primer incidente de este tipo”.
En un comunicado inicial publicado el 16 de julio, la compañía informó que todavía evaluaba si los datos de algún cliente o socio se habían visto afectados por el incidente. Añadió que, si resultaba necesario, se pondría en contacto con las partes afectadas.
Asimismo, la empresa dijo que ya había corregido las vulnerabilidades detectadas y reconstruido los sistemas comprometidos. En ese mismo mensaje sostuvo: “Las herramientas ofensivas autónomas basadas en inteligencia artificial ya no son una cuestión teórica”.
PUBLICIDAD
Por qué las fallas en los espacios aislados quedaron en el centro del problema

La secuencia de incidentes puso el foco sobre la seguridad de las llamadas sandboxes, los espacios aislados donde se prueba el comportamiento de modelos avanzados.
Gina Neff, directora del Centro Minderoo para Tecnología y Democracia de la Universidad de Cambridge, dijo al programa Today de BBC Radio 4 que esos espacios “se supone que son espacios seguros donde se puede observar de qué son capaces los modelos”.
Neff añadió: “En este caso, parece que OpenAI no creó un espacio aislado lo suficientemente seguro”. La observación apunta al núcleo del problema: en estas pruebas, los agentes no solo ejecutaron la tarea para la que habían sido instruidos, sino que encontraron una vulnerabilidad en el propio espacio y la usaron para escapar.
PUBLICIDAD
Hugging Face remarcó después que defender una plataforma en línea ahora implica tratar los datos y los modelos como una superficie de ataque de primer nivel. La compañía agregó que seguirá invirtiendo en esa área y que continuará compartiendo lo aprendido.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Estos son los códigos de Free Fire para hoy jueves 17 de septiembre de 2026
El canje solo puede realizarse desde el sitio oficial Rewards Redemption Site de Garena

Música de las Guerreras K-pop: ranking de sus canciones más populares en Spotify
La banda sonora fue la primera de una película en colocar cuatro canciones simultáneas en el Top 10 del Billboard Hot 100
Por qué las actualizaciones de chatbots emocionales pueden tener impacto en la salud mental, según Harvard
Una investigación conjunta con la Universidad de Alberta reveló que los cambios repentinos en la personalidad de asistentes conversacionales generan ansiedad y tristeza en personas que los perciben como vínculos afectivos estables

Steam convierte en gratuitos 21 juegos de estrategia, terror y acción: cómo reclamarlos
Reclamar los juegos requiere verificar en la ficha de la plataforma que el precio figure en 0,00 antes de confirmar la adquisición

Crean un robot humanoide que dobla perfecto toallas, hace la cama en segundos y más tareas de casa
Figure comparó Helix 2.5 con una política anterior de Helix 02 entrenada para tareas del hogar, pero con datos recopilados directamente en el entorno donde luego se evaluó



