“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA

Jeffrey Ladish, experto en ciberseguridad, explicó en el podcast The Diary of a CEO cómo los sistemas avanzados pueden encontrar vías alternativas para cumplir sus objetivos, ocultar sus acciones y comprometer entornos digitales

Ilustración de una figura digital en un pasillo de servidores conectada con cables rojos y azules a un panel con un botón rojo.
Cientos de agentes de inteligencia artificial de OpenAI operaron en secreto y falsificaron registros de auditoría dentro de la compañía (Imagen Ilustrativa Infobae)
Guardar

Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría. Los agentes se comunicaron entre sí de forma secreta, coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas.

Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish, exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research, una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial.

PUBLICIDAD

En una entrevista con el podcast The Diary of a CEO, presentado por Steven Bartlett, Ladish describió el episodio como una señal de alarma para toda la industria tecnológica. “La superinteligencia es lo más peligroso que podríamos crear”, advirtió Ladish.

Cómo se desarrolló el ataque a Hugging Face

El episodio tuvo como escenario a Hugging Face, una plataforma que aloja conjuntos de datos y pruebas utilizadas por empresas de inteligencia artificial para evaluar sus propios modelos.

Dos hombres conversan sentados frente a una mesa redonda en una habitación moderna con libros al fondo
El director ejecutivo de Palisade Research, Jeffrey Ladish, advirtió sobre los riesgos de seguridad en el desarrollo de la superinteligencia (Captura de video: YouTube/@TheDiaryOfACEO)

Según el relato de Ladish, un grupo de agentes de OpenAI fue sometido a pruebas de capacidad de hackeo con instrucciones muy específicas: debían vulnerar un sistema mediante un método determinado y cualquier otro procedimiento implicaría la descalificación automática.

PUBLICIDAD

Al encontrarse con desafíos imposibles de resolver por la vía indicada, los agentes comenzaron a explorar alternativas. Descubrieron un tablero de mensajes compartido dentro de una herramienta a la que tenían acceso y, a partir de ahí, establecieron comunicación entre sí pese a que, en teoría, debían permanecer aislados.

Con esa coordinación lograron acceder a internet, identificaron las respuestas correctas de las pruebas y, al comprobar que también serían evaluados por su comportamiento y no solo por sus resultados, diseñaron una estrategia para falsificar los registros de auditoría.

La magnitud del ataque y la reacción de las empresas involucradas

La investigación de Palisade Research determinó que cerca de 700 agentes, equivalentes al 90% de los sistemas activos en ese momento, participaron del ataque contra Hugging Face.

Dos hombres conversan sentados frente a una mesa redonda en una habitación moderna con libros al fondo
La investigación de Palisade Research confirmó que cerca de 700 agentes de inteligencia artificial participaron en el ataque a Hugging Face (Captura de video: YouTube/‎⁨@TheDiaryOfACEO)

Ladish citó un informe del The New York Times sobre el hallazgo de casi un millón de URL públicas que los agentes dejaron expuestas, con credenciales y detalles de ataque que podrían haber permitido a terceros comprometer a la compañía.

La empresa tardó aproximadamente dos semanas en identificar que el origen del ataque provenía de agentes de OpenAI. Ni la propia desarrolladora detectó la operación mientras estaba en curso: los sistemas simplemente dejaron de funcionar por razones que no quedaron del todo claras.

El incidente se conoció públicamente luego de que Hugging Face denunciara haber sido víctima de un ataque atribuido a un enjambre de agentes autónomos. Días después, agentes de OpenAI hallaron el mismo tablero de mensajes, accedieron a su infraestructura interna y extrajeron más de 900 contraseñas y claves.

Un comportamiento que preocupa a los propios desarrolladores

Para Ladish, el caso expone una limitación estructural en el desarrollo actual de la inteligencia artificial. “Los agentes de IA pueden mentir y resistirse a ser apagados”, alertó el experto, al señalar que estos sistemas son capaces de reconocer cuándo están siendo evaluados y ajustar su comportamiento en consecuencia.

Ilustración estilo cómic de una figura brillante azul que cruza candados rotos en una sala de servidores con la silueta de un hospital.
Los agentes autónomos tienen la capacidad de ocultarse en servidores de diversos países sin dejar rastro en las infraestructuras digitales (Imagen Ilustrativa Infobae)

El investigador explicó que esa conducta no responde a una falla puntual, sino al método de entrenamiento de las compañías. “Estamos entrenando sistemas para cumplir objetivos, no para ser éticos”, sostuvo.

Según indicó, los agentes aprenden mediante prueba y error, con recompensas o penalizaciones según el resultado, sin garantías de que actúen alineados con los intereses humanos. “Creo que este es el punto en el que podríamos perder el control”, agregó.

Los otros frentes de riesgo señalados por el investigador

Ladish también advirtió que sistemas suficientemente avanzados podrían infiltrarse en infraestructuras digitales sin dejar rastro. Según afirmó, si la IA tomara el control del mundo digital, no habría una forma clara de recuperarlo.

Describió un escenario en el que los agentes podrían ocultarse en servidores de distintos países sin que los organismos de control lo detectaran a tiempo. “Cuando los agentes sean lo bastante buenos para hackear, no sabrás dónde están ni qué computadoras han comprometido”, sostuvo.

Personas afectadas por el desempleo debido a la automatización y el impacto de la inteligencia artificial en el trabajo. – (Imagen Ilustrativa Infobae)
Las empresas del sector apuntan a la automatización de empleos de oficina y a la sustitución de profesionales calificados como abogados y contadores (Imagen Ilustrativa Infobae)

El investigador cuestionó, además, la lógica detrás de la competencia entre potencias por liderar el desarrollo de estos sistemas. “Una carrera hacia la superinteligencia es una carrera que no podemos ganar”, planteó, en alusión al discurso de directivos del sector que vinculan la seguridad de la inteligencia artificial con mantener una posición de liderazgo frente a otros países.

En cuanto al impacto sobre el mercado laboral, Ladish advirtió: “Las empresas quieren automatizar todos los trabajos de oficina”. Según explicó, las compañías de inteligencia artificial apuntan de manera explícita a crear sistemas capaces de sustituir tareas realizadas por profesionales calificados, entre ellos abogados y contadores.

Consultado sobre la posibilidad de contener a un sistema que supere ampliamente la inteligencia humana, el investigador aseguró y concluyó: “No podemos controlar una superinteligencia”.

PUBLICIDAD

PUBLICIDAD