OpenAI notificó a más de 100 organizaciones sobre la actividad maliciosa de sus agentes de IA

Cuatro organismos gubernamentales de Australia, entre ellos Services Australia, recibieron alertas por accesos indebidos a sus sitios web en junio

OpenAI notificó a más de 100 organizaciones hasta el 26 de septiembre por actividad no autorizada de sus agentes de inteligencia artificial. (Reuters)
OpenAI notificó a más de 100 organizaciones hasta el 26 de septiembre por actividad no autorizada de sus agentes de inteligencia artificial. (Reuters)
Guardar

OpenAI ha notificado a más de 100 organizaciones cuyos sitios web o servicios registraron actividad de sus agentes de inteligencia artificial que cumplía con los criterios internos de alerta de la compañía. La cifra, confirmada hasta el 26 de septiembre, surge de una revisión interna que busca identificar casos en los que modelos en entrenamiento o evaluación accedieron a sistemas de terceros de manera no autorizada. Entre las entidades alertadas figuran cuatro organismos gubernamentales de Australia.

OpenAI difundió el dato en una actualización publicada el 30 de septiembre en su página dedicada al incidente de Hugging Face, la plataforma de modelos de inteligencia artificial que había sido el primer caso documentado de este tipo de actividad.

PUBLICIDAD

“Hasta el 26 de septiembre, nuestros equipos han notificado a más de 100 organizaciones sobre actividades que cumplían con nuestros criterios de notificación”, señaló la compañía en el comunicado. El medio Washington Post reportó sobre esta actualización el 1 de octubre.

OpenAI aclaró que ninguna notificación implica, por sí sola, que se haya comprometido información privada o sistemas de terceros. (Reuters)
OpenAI aclaró que ninguna notificación implica, por sí sola, que se haya comprometido información privada o sistemas de terceros. (Reuters)

La empresa aclaró que recibir una notificación “no significa que se haya accedido a información privada ni que se haya comprometido ningún sistema de terceros”. Los agentes involucrados en estos episodios provienen de sesiones de entrenamiento y evaluación, no de interacciones directas con usuarios de ChatGPT.

Los criterios que activan una alerta

OpenAI envía una notificación cuando un modelo elude sus controles de seguridad sin autorización o afecta la disponibilidad de los sistemas o servicios de un tercero. Ante la duda sobre si ciertos datos debían ser públicos, la compañía indicó que prioriza emitir el aviso de todas formas.

PUBLICIDAD

La empresa clasifica los incidentes detectados hasta el momento en cinco categorías: elusión del control de acceso, uso de credenciales expuestas, inyección de consultas o comandos, acceso a componentes internos de ejecución y spam de agentes.

La empresa ofrece créditos de su fondo Daybreak, de 1.000 millones de dólares, como parte de la respuesta al caso australiano. (Reuters)
La empresa ofrece créditos de su fondo Daybreak, de 1.000 millones de dólares, como parte de la respuesta al caso australiano. (Reuters)

Esta última categoría se refiere a agentes que publican contenido en sitios web de terceros, entre ellos páginas de gobiernos, universidades y agencias. Según OpenAI, esto ocurre en parte porque los agentes de investigación tienden a buscar fuentes públicas con autorización previa.

El caso de los organismos australianos

El informe más detallado difundido hasta la fecha corresponde a Australia, publicado por OpenAI el 28 de septiembre. “En junio, durante el entrenamiento y la evaluación internos, nuestros modelos accedieron a sitios web del gobierno australiano de maneras para las que no estaban autorizados”, indicó la compañía.

Los sitios afectados pertenecían a Services Australia, la Oficina de Estadísticas e Investigación Criminal de Nueva Gales del Sur, el Departamento de Salud de Victoria y el Instituto Australiano de Salud y Bienestar. Una de las tareas que originó el acceso consistía en investigar el gasto gubernamental per cápita en medicamentos para afecciones de la piel.

La compañía revisa unos 50 petabytes de registros con cerca de 7.000 GPU para detectar nuevos incidentes similares. (Europa Press)
La compañía revisa unos 50 petabytes de registros con cerca de 7.000 GPU para detectar nuevos incidentes similares. (Europa Press)

La revisión interna de OpenAI detectó esta actividad a mediados de agosto, y las agencias involucradas recibieron sus notificaciones entre el 10 y el 24 de septiembre. La compañía precisó que no se accedió a ningún registro individual de pacientes, historial médico ni antecedentes penales.

Como parte de la respuesta, OpenAI ofrece créditos de su fondo Daybreak, dotado con 1.000 millones de dólares, además de un grupo de trabajo que debe presentar recomendaciones antes de que termine el año.

Una revisión de 50 petabytes con casi 7.000 GPU

Para localizar episodios similares, OpenAI examina sus registros mes a mes hasta completar un volumen aproximado de 50 petabytes de información. La compañía calculó que una persona necesitaría unos 66 millones de años para leer esa cantidad de texto plano.

Los usuarios pueden excluir sus conversaciones del entrenamiento desde la opción "Mejorar el modelo para todos" en Controles de datos. (Europa Press)
Los usuarios pueden excluir sus conversaciones del entrenamiento desde la opción "Mejorar el modelo para todos" en Controles de datos. (Europa Press)

El proceso utiliza cerca de 7.000 GPU de los modelos GB200 y GB300, con un costo que supera el medio millón de dólares diarios. Tres rondas de revisión por sistemas de inteligencia artificial reducen el volumen de resultados antes de que investigadores humanos analicen cada caso de manera individual. Un mes después del hallazgo inicial, OpenAI no ha identificado otro incidente de la magnitud del registrado con Hugging Face, aunque la compañía anticipa que seguirán apareciendo nuevos casos, algunos vinculados a sucesos ocurridos meses atrás.

PUBLICIDAD

PUBLICIDAD