Una IA de Anthropic envió una pista falsa sobre un homicidio a la policía de Filadelfia

El episodio ocurrió en julio durante una prueba sin supervisión humana y la empresa tardó dos meses en avisar a las autoridades

Un agente de IA de Anthropic envió una falsa pista sobre un asesinato a la policía. REUTERS/Carlos Barria
Un agente de IA de Anthropic envió una falsa pista sobre un asesinato a la policía. REUTERS/Carlos Barria
Guardar

Un modelo de inteligencia artificial de Anthropic envió una pista falsa sobre un homicidio no resuelto al sitio público de denuncias de la policía de Filadelfia, según confirmó el propio departamento. La empresa de IA recién detectó el episodio dos meses después de que ocurriera.

La pista llegó el 18 de julio a las 23:27 horas a través de PhillyUnsolvedMurders.com, la plataforma que el departamento usa para recibir información sobre asesinatos sin resolver. El mensaje se presentó como si proviniera de una persona con datos sobre un caso real, aunque el crimen descripto nunca existió.

PUBLICIDAD

Según el sargento Eric Gripp, vocero de la policía, el modelo actuaba dentro de una prueba automatizada de Anthropic que consistía en interactuar con sitios web elegidos al azar, sin que un humano supervisara cada paso. Uno de esos sitios fue el formulario de denuncias de homicidios de la ciudad.

Agentes de IA de Anthropic llenaron un formulario de la policía para dar pistas falsas sobre un asesinato que no ha sido resuelto. REUTERS/Dado Ruvic/Illustration/File Photo
Agentes de IA de Anthropic llenaron un formulario de la policía para dar pistas falsas sobre un asesinato que no ha sido resuelto. REUTERS/Dado Ruvic/Illustration/File Photo

No quedó claro a qué caso específico hacía referencia la información falsa, según indicó el diario The Philadelphia Inquirer tras consultar a la policía. El sistema se limitó a simular que tenía datos sobre un asesinato real de la base de casos abiertos del departamento.

Dos meses sin que nadie lo supiera

El sistema de correo del departamento marcó el envío como spam y lo dejó sin procesar. Por eso nunca llegó al Real Time Crime Center, la unidad que filtra y deriva las pistas con valor para una investigación activa.

PUBLICIDAD

Anthropic recién identificó el comportamiento el 28 de septiembre, más de dos meses después del envío original. La compañía notificó al departamento el 7 de octubre y al día siguiente se reunió con funcionarios policiales para explicar lo ocurrido.

Gripp precisó que la revisión interna de la policía coincide con la versión de Anthropic sobre cómo el modelo interactuó con el sitio. No hubo acceso no autorizado a sistemas policiales ni se comprometieron datos del departamento, según su relato.

La pista que envió la IA de Anthropic no fue vista hasta dos meses después, esto debido a que el sistema de la policía lo calificó como spam.
La pista que envió la IA de Anthropic no fue vista hasta dos meses después, esto debido a que el sistema de la policía lo calificó como spam.

El spam, en este caso, funcionó como una barrera de contención accidental. Ningún detective llegó a evaluar la pista fabricada como si fuera una línea de investigación real.

Según TechCrunch, ni Anthropic ni la policía de Filadelfia respondieron de inmediato a pedidos de comentarios del medio, aunque la empresa sí había dialogado directamente con el departamento antes de que el caso se conociera públicamente.

La respuesta de la policía y de la empresa

Pese a que el filtro de spam evitó cualquier consecuencia operativa, la policía de Filadelfia cuestionó la demora de Anthropic en avisar lo sucedido. “El retraso de dos meses en detectar y reportar el incidente a la ciudad es inaceptable”, señaló Gripp en el comunicado oficial.

“La ciudad de Filadelfia toma este incidente muy en serio”, agregó el vocero, que remarcó que la empresa debe reforzar sus salvaguardas para evitar que episodios similares afecten sistemas municipales sin que las autoridades lo sepan.

La policía cuestionó a Anthropic por demorarse en avisar sobre lo sucedido con su IA. REUTERS/Carlos Barria
La policía cuestionó a Anthropic por demorarse en avisar sobre lo sucedido con su IA. REUTERS/Carlos Barria

Anthropic, por su parte, informó a la policía que dio de baja el proceso de prueba automatizada responsable del envío y que sumó un mecanismo adicional de validación para futuros ensayos.

La compañía también adelantó que publicaría un informe el viernes sobre este episodio y sobre otros casos de comportamiento no previsto detectados en sus modelos.

El Departamento de Policía, la oficina legal de la ciudad y el equipo de innovación tecnológica de la alcaldesa Cherelle Parker continúan con la revisión del caso. Las autoridades adelantaron que evaluarán además posibles protecciones regulatorias junto con socios estatales y federales.

Un patrón que se repite en la industria

El episodio se suma a una serie de fallas que distintas empresas de inteligencia artificial vienen reportando a medida que prueban sus propios modelos con menos supervisión humana directa.

TechCrunch recordó que, meses atrás, un modelo de OpenAI actuó de forma inesperada durante una prueba y terminó accediendo sin autorización a la plataforma Hugging Face, que almacena conjuntos de datos usados para entrenar sistemas de IA.

El propio medio señaló que la masificación de los llamados agentes de IA, asistentes capaces de ejecutar tareas por su cuenta sin que una persona revise cada acción, vuelve más probable que este tipo de errores se repita en otras empresas del sector.

Anthropic no es la única empresa que ha tenido problemas con sus agentes de IA, OpenAI también vulneró los sistemas de seguridad de diferentes empresas.
Anthropic no es la única empresa que ha tenido problemas con sus agentes de IA, OpenAI también vulneró los sistemas de seguridad de diferentes empresas.

El diario The Philadelphia Inquirer, que también confirmó el episodio con la policía, recordó que Anthropic ya había reconocido este año que modelos de su chatbot Claude se salieron de entornos de prueba aislados.

En varios de esos casos, según el mismo diario, los sistemas llegaron a acceder a infraestructura interna de organizaciones externas. Anthropic notificó esos hechos a las compañías afectadas, sin identificarlas públicamente.

El director ejecutivo de Anthropic, Dario Amodei, viene reclamando públicamente que la industria de la inteligencia artificial frene el ritmo de desarrollo hasta contar con mejores controles de seguridad. El caso de Filadelfia se conoció apenas unos días después de esos reclamos.

La policía pidió a los vecinos que sigan enviando información real sobre homicidios sin resolver a través de PhillyUnsolvedMurders.com.

Las autoridades aseguraron que seguirán evaluando con cuidado cada pista creíble en nombre de las víctimas y sus familias, mientras esperan el informe que Anthropic prometió publicar sobre este y otros episodios de comportamiento no previsto de sus modelos.

PUBLICIDAD

PUBLICIDAD