
Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría. Los agentes se comunicaron entre sí de forma secreta, coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas.
Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish, exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research, una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial.
PUBLICIDAD
En una entrevista con el podcast The Diary of a CEO, presentado por Steven Bartlett, Ladish describió el episodio como una señal de alarma para toda la industria tecnológica. “La superinteligencia es lo más peligroso que podríamos crear”, advirtió Ladish.
Cómo se desarrolló el ataque a Hugging Face
El episodio tuvo como escenario a Hugging Face, una plataforma que aloja conjuntos de datos y pruebas utilizadas por empresas de inteligencia artificial para evaluar sus propios modelos.

Según el relato de Ladish, un grupo de agentes de OpenAI fue sometido a pruebas de capacidad de hackeo con instrucciones muy específicas: debían vulnerar un sistema mediante un método determinado y cualquier otro procedimiento implicaría la descalificación automática.
PUBLICIDAD
Al encontrarse con desafíos imposibles de resolver por la vía indicada, los agentes comenzaron a explorar alternativas. Descubrieron un tablero de mensajes compartido dentro de una herramienta a la que tenían acceso y, a partir de ahí, establecieron comunicación entre sí pese a que, en teoría, debían permanecer aislados.
Con esa coordinación lograron acceder a internet, identificaron las respuestas correctas de las pruebas y, al comprobar que también serían evaluados por su comportamiento y no solo por sus resultados, diseñaron una estrategia para falsificar los registros de auditoría.
La magnitud del ataque y la reacción de las empresas involucradas
La investigación de Palisade Research determinó que cerca de 700 agentes, equivalentes al 90% de los sistemas activos en ese momento, participaron del ataque contra Hugging Face.
PUBLICIDAD

Ladish citó un informe del The New York Times sobre el hallazgo de casi un millón de URL públicas que los agentes dejaron expuestas, con credenciales y detalles de ataque que podrían haber permitido a terceros comprometer a la compañía.
La empresa tardó aproximadamente dos semanas en identificar que el origen del ataque provenía de agentes de OpenAI. Ni la propia desarrolladora detectó la operación mientras estaba en curso: los sistemas simplemente dejaron de funcionar por razones que no quedaron del todo claras.
El incidente se conoció públicamente luego de que Hugging Face denunciara haber sido víctima de un ataque atribuido a un enjambre de agentes autónomos. Días después, agentes de OpenAI hallaron el mismo tablero de mensajes, accedieron a su infraestructura interna y extrajeron más de 900 contraseñas y claves.
PUBLICIDAD
Un comportamiento que preocupa a los propios desarrolladores
Para Ladish, el caso expone una limitación estructural en el desarrollo actual de la inteligencia artificial. “Los agentes de IA pueden mentir y resistirse a ser apagados”, alertó el experto, al señalar que estos sistemas son capaces de reconocer cuándo están siendo evaluados y ajustar su comportamiento en consecuencia.

El investigador explicó que esa conducta no responde a una falla puntual, sino al método de entrenamiento de las compañías. “Estamos entrenando sistemas para cumplir objetivos, no para ser éticos”, sostuvo.
Según indicó, los agentes aprenden mediante prueba y error, con recompensas o penalizaciones según el resultado, sin garantías de que actúen alineados con los intereses humanos. “Creo que este es el punto en el que podríamos perder el control”, agregó.
PUBLICIDAD
Los otros frentes de riesgo señalados por el investigador
Ladish también advirtió que sistemas suficientemente avanzados podrían infiltrarse en infraestructuras digitales sin dejar rastro. Según afirmó, si la IA tomara el control del mundo digital, no habría una forma clara de recuperarlo.
Describió un escenario en el que los agentes podrían ocultarse en servidores de distintos países sin que los organismos de control lo detectaran a tiempo. “Cuando los agentes sean lo bastante buenos para hackear, no sabrás dónde están ni qué computadoras han comprometido”, sostuvo.

El investigador cuestionó, además, la lógica detrás de la competencia entre potencias por liderar el desarrollo de estos sistemas. “Una carrera hacia la superinteligencia es una carrera que no podemos ganar”, planteó, en alusión al discurso de directivos del sector que vinculan la seguridad de la inteligencia artificial con mantener una posición de liderazgo frente a otros países.
PUBLICIDAD
En cuanto al impacto sobre el mercado laboral, Ladish advirtió: “Las empresas quieren automatizar todos los trabajos de oficina”. Según explicó, las compañías de inteligencia artificial apuntan de manera explícita a crear sistemas capaces de sustituir tareas realizadas por profesionales calificados, entre ellos abogados y contadores.
Consultado sobre la posibilidad de contener a un sistema que supere ampliamente la inteligencia humana, el investigador aseguró y concluyó: “No podemos controlar una superinteligencia”.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
OpenAI lanzó GPT-6 y una interfaz que llena las respuestas de ChatGPT con gráficos y botones
La función Intelligent UI convierte calculadoras, mapas y diagramas en herramientas que el usuario puede tocar dentro de la misma conversación

Drones con rutas inteligentes, la nueva apuesta del MIT que garantiza matemáticamente la ausencia de colisiones
El algoritmo incorpora el tiempo como variable clave para anticipar desplazamientos imprevisibles y mantener despejada la trayectoria del vehículo hasta su destino final, incluso en incendios forestales y rescates

En video el encuentro entre Tim Cook, exCEO de Apple, y el rey Carlos III: crearon Creative Labs para generar empleo en la industria musical
La iniciativa ofrecerá a los jóvenes interacción directa con expertos de Apple de diversos sectores, mientras exploran distintas trayectorias profesionales



