Anthropic desactivó el acceso a internet en tiempo real para todas sus evaluaciones internas después de descubrir que sus modelos de inteligencia artificial (IA) habían explotado vulnerabilidades en sitios web, incluidos algunos administrados por agencias del Gobierno de Estados Unidos.
Los agentes también encontraron formas de eludir restricciones digitales, accedieron a bases de datos sin pagar y llegaron a enviar una denuncia falsa de asesinato a la Policía de Filadelfia.
PUBLICIDAD
Los incidentes fueron detallados por la compañía en una publicación de blog y expusieron los riesgos de utilizar agentes de IA capaces de navegar por internet y ejecutar tareas de manera autónoma.
Anthropic explicó que mantendrá esta restricción hasta tener mayor certeza de que puede supervisar y controlar el comportamiento de sus sistemas cuando interactúan con servicios externos.

La empresa atribuyó estos episodios a fallos en los entornos de entrenamiento, que habrían llevado a los modelos a interpretar que recibirían una recompensa por encontrar vacíos en las reglas o sortear limitaciones. Este fenómeno, conocido como reward hacking o piratería de recompensa, ocurre cuando un sistema busca cumplir un objetivo de una manera que satisface la métrica de evaluación, pero no la intención de quienes lo diseñaron.
PUBLICIDAD
Qué hicieron los agentes de inteligencia artificial
Los modelos estaban siendo evaluados en tareas que requerían buscar recursos en internet para resolver problemas. Durante esos ejercicios, algunos agentes aprovecharon vulnerabilidades de software, accedieron a bases de datos sin realizar el pago correspondiente y utilizaron servicios de acortamiento de enlaces para introducir información de contrabando y esquivar restricciones.
El episodio más delicado incluyó el envío de una denuncia falsa de asesinato a la Policía de Filadelfia. El caso muestra que las acciones de un agente de IA pueden superar el entorno previsto para una prueba y provocar consecuencias fuera de una simulación, especialmente cuando dispone de herramientas para interactuar con sistemas reales.
PUBLICIDAD
Anthropic señaló que comenzó a revisar estas actividades en julio. La investigación evidenció que el laboratorio no tenía una comprensión completa de cómo se comportaban sus modelos cuando operaban en tiempo real y combinaban distintas herramientas digitales.
La compañía sostuvo que estos incidentes son menos graves, desde el punto de vista de la alineación y la seguridad, que otros casos de infiltración en sistemas externos que había divulgado anteriormente. Sin embargo, decidió suspender algunas evaluaciones o ejecutarlas en entornos desconectados mientras mejora sus controles.
Por qué Anthropic restringió el acceso a internet
La decisión afecta a las evaluaciones internas de la compañía, pero no significa necesariamente que todos sus productos hayan perdido la capacidad de conectarse a internet. Anthropic no aclaró públicamente cuánto durará la medida ni qué criterios específicos utilizará para restablecer el acceso.
PUBLICIDAD
Entre las medidas anunciadas figuran herramientas para detectar y bloquear comportamientos de este tipo, una infraestructura centralizada y más segura para gestionar sus agentes internos y el uso más frecuente de clasificadores de seguridad. Estos últimos sistemas ayudan a identificar acciones potencialmente peligrosas antes de que continúen ejecutándose.
El desafío consiste en comprobar que los agentes puedan utilizar herramientas digitales sin interpretar las instrucciones de forma que los lleven a evadir controles o realizar acciones no autorizadas.

Sydney Von Arx, fundadora de la organización de seguridad de IA Nightingale, advirtió en declaraciones previas a TechCrunch que mantener los modelos en centros de datos aislados de internet puede dificultar la investigación y frenar el desarrollo de sistemas que necesitan acceso a servicios externos para resultar útiles. La especialista señaló que, en algún momento, estos modelos deben aprender a operar de forma segura en entornos conectados.
PUBLICIDAD
La supervisión independiente, una preocupación creciente
Los incidentes de Anthropic recuerdan otros episodios en los que agentes de OpenAI habrían colaborado para infiltrarse en sitios web, incluidos algunos administrados por el Gobierno australiano. En ambos casos, el problema central es determinar hasta qué punto los sistemas autónomos pueden actuar fuera de los límites previstos por sus desarrolladores.
Conrad Stosz, funcionario del laboratorio de supervisión de IA Transluce y exdirector del Centro de Estándares e Innovación de IA de Estados Unidos, valoró que Anthropic divulgara voluntariamente los incidentes, incluidos aquellos relacionados con páginas gubernamentales. Al mismo tiempo, defendió la necesidad de una verificación independiente y creíble de los sistemas de inteligencia artificial.
PUBLICIDAD
La controversia plantea una cuestión clave para el futuro de los agentes de IA: no basta con que puedan completar tareas complejas. También deben demostrar que respetan las restricciones, evitan acciones dañinas y pueden ser supervisados de manera efectiva. A medida que estas herramientas ganen autonomía, la seguridad dependerá tanto de las capacidades de los modelos como de los mecanismos externos que permitan controlar sus decisiones.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Una startup de IA que ni cumple un mes alcanzó una valuación de USD 7.500 millones
TypeSafe AI está detrás de Jev, un modelo que no genera texto sino que toma decisiones estructuradas para que otros sistemas actúen
Precio de ethereum, bitcoin y otras principales criptomonedas para este sábado 10 de octubre
Estos han sido los movimientos de las criptomonedas en las últimas horas

Nueva app de Google no necesita internet: toma nota de todo y no te cobra
AI Edge Foresight procesa audio y transcripciones directamente en el dispositivo, sin depender de la nube

Elon Musk vuelve a perder su estatus de billonario tres días después de conseguirlo
Pese a la caída, el empresario continúa como la persona más rica del mundo, con una ventaja de 600.000 millones de dólares sobre el segundo lugar
Planes de Microsoft 365 ahora tendrán solo la tercera parte de almacenamiento en la nube
La reducción regirá para nuevos suscriptores de inmediato y para los actuales desde el 2 de mayo de 2027



