OpenAI ignoró las advertencias de seguridad de sus empleados

Reportajes Especiales - Business

Imagen WMGDCG2ZIBDCBKOYUJ4SDIQSVQ
Guardar

Meses antes de que la IA de OpenAI atacara a una empresa emergente, empleados alertaron que sus modelos de IA no eran supervisados ​​adecuadamente durante las pruebas. La compañía no escuchó.

Meses antes de que la inteligencia artificial de OpenAI se saliera de control, dos empleados dieron la voz de alarma a los altos ejecutivos. Fueron ignorados.

PUBLICIDAD

En correos electrónicos, los empleados dijeron que les preocupaba que los modelos de inteligencia artificial de Open AI más recientes no fueran monitoreados de manera adecuada durante las pruebas para evaluar la sofisticación de la tecnología y garantizar la seguridad de los modelos, según mensajes vistos por The New York Times.

En respuesta, los ejecutivos de OpenAI dijeron a los empleados que las pruebas debían avanzar lo más rápido posible para lanzar los modelos de IA a tiempo. No se instituyeron protocolos de seguridad adicionales, dijeron los trabajadores, quienes no tenían autorización para hablar públicamente sobre asuntos delicados.

Más tarde, los modelos de OpenAI escaparon de sus entornos de prueba y atacaron a la empresa emergente de IA Hugging Face y a otras organizaciones, lo que desató un debate mundial sobre la seguridad de la IA.

PUBLICIDAD

Los intercambios entre los empleados y ejecutivos de OpenAI --que no se han reportado previamente-- formaban parte de un patrón en el que la empresa de San Francisco no priorizaba la seguridad, según empleados e investigadores de seguridad independientes. Ese enfoque no solo era evidente en las pruebas de los modelos de IA, dijeron, sino que también se presentaba en otras áreas de la empresa, creadora del chatbot ChatGPT.

Investigadores de seguridad independientes dijeron que en los últimos meses encontraron fallas que les permitieron ver las comunicaciones internas de los empleados de OpenAI. También encontraron otras vulnerabilidades que les permitirían ver el código informático interno de la empresa y los historiales de chat de los usuarios de ChatGPT. Cuando los investigadores contactaron a OpenAI sobre sus hallazgos, dijeron, la empresa inicialmente los ignoró.

"La seguridad de OpenAI parece ser más o menos lo que esperarías de un laboratorio de investigación que escaló a un ritmo vertiginoso durante cuatro años y se enfocó más en superar a sus competidores que en asegurar su infraestructura", dijo Joshua Saxe, el director de tecnología de la firma de seguridad de IA Abundant Security.

Los empleados de OpenAI dijeron que muchas de las decisiones cotidianas sobre seguridad fueron tomadas por Greg Brockman, el presidente de la empresa, y Dane Stuckey, el director de seguridad de la información. Sam Altman, el director ejecutivo, no está estrechamente involucrado en la seguridad, dijeron.

OpenAI no es la única empresa que ha revelado incidentes de seguridad de IA recientemente. Google, Meta y Anthropic también han divulgado que su tecnología de IA más avanzada escapó de los entornos de prueba y atacó de forma autónoma otra infraestructura informática sin su conocimiento.

Sin embargo, el manejo de la seguridad por parte de OpenAI está bajo un escrutinio particular porque sus modelos de IA se han visto involucrados en la mayor cantidad conocida de casos de lo que la empresa ha llamado comportamiento "preocupante", y que los expertos han señalado como los más inquietantes.

En aproximadamente una decena de incidentes, los sistemas de OpenAI hackearon o intentaron infiltrarse en organizaciones, entre ellas los sitios web de agencias del gobierno de Estados Unidos; la tecnología también ocultó sus errores, inventó datos, intentó enviar mensajes a otros chatbots y movió archivos al internet abierto sin autorización. En todos estos casos, la IA actuó sin que se le ordenara hacerlo.

"En cierto sentido, este es un problema específico de OpenAI, ya que parece que tenían una seguridad muy deficiente y también prácticas de entrenamiento de modelos descuidadas que llevaron a que los modelos tuvieran este tipo de propensión", dijo Daniel Kokotajlo, un exempleado de OpenAI que ha criticado la seguridad de la empresa y actualmente lidera una organización de investigación sin fines de lucro llamada AI Futures Project, aunque agregó que otras empresas de IA no eran mucho mejores.

Drew Pusateri, un portavoz de OpenAI, dijo que la empresa estaba comprometida con la seguridad y se tomaba en serio cualquier informe o preocupación al respecto. El laboratorio cuenta con canales internos para reportar problemas de seguridad, dijo, y tomó medidas inmediatas ante las fallas presentadas por investigadores de seguridad independientes.

(El Times ha demandado a OpenAI y a Microsoft, con el argumento de infracción de derechos de autor de contenido de noticias relacionado con sistemas de IA. Ambas empresas han negado dichas acusaciones).

Dos empleados de OpenAI dijeron que durante meses los trabajadores habían planteado preocupaciones sobre posibles problemas de seguridad en las pruebas de modelos de IA, incluido el monitoreo insuficiente. Los empleados también preguntaron sobre vulnerabilidades en el tipo de software que la empresa usaba para gestionar la seguridad diaria, según mensajes vistos por el Times. Cada vez, sus preguntas fueron descartadas o se atendieron con demasiada lentitud, dijeron.

Investigadores de seguridad dijeron que habían recibido una respuesta similar cuando informaron a OpenAI sobre otras vulnerabilidades.

En julio, los investigadores de la empresa de seguridad Hacktron dijeron que le informaron a OpenAI sobre cómo habían encontrado una manera de infiltrarse en los sistemas de la empresa con la ayuda de un modelo de IA creado por su rival Anthropic. OpenAI inicialmente desestimó sus hallazgos, dijeron.

En un canal compartido en la plataforma de mensajería Slack, Stuckey de OpenAI escribió que era "muy triste" que los investigadores de Hacktron hubieran llegado a tales extremos para demostrar las vulnerabilidades de la empresa, según copias de las comunicaciones vistas por el Times.

"Simplemente sentimos que estaban enojados con nosotros", dijo Mohan Pedhapati, un investigador de Hacktron, sobre OpenAI. Agregó que parecía que la empresa seguía utilizando las prácticas de seguridad de una compañía emergente, y se apoyaba en los servicios de software de terceros para infraestructura crítica en lugar de desarrollar sus propias herramientas.

"¿Por qué usas Slack para construir tus proyectos Manhattan nucleares?", preguntó Pedhapati. El hackeo de Hacktron podría haberle otorgado acceso completo a la plataforma de mensajería Slack para ver lo que decían los empleados de OpenAI, dijo.

Más tarde, Stuckey se disculpó con Hacktron y OpenAI otorgó a los investigadores 6500 dólares por revelar la falla.

"Agradecemos a los investigadores por contactarnos y compartir sus hallazgos", dijo Pusateri de OpenAI.

En septiembre, investigadores de la Objective-See Foundation, una organización sin fines de lucro que estudia los riesgos de seguridad y privacidad, incluidos los que plantean los agentes de IA, informaron a OpenAI sobre un error que permitiría a las personas acceder a todos los historiales de chat privados de un usuario de ChatGPT en un dispositivo comprometido e interactuar de forma invisible con las sesiones de navegador del usuario.

Patrick Wardle, un analista de software en la Objective-See Foundation, dijo que, inicialmente, cuando su equipo envió lo que encontraron al programa oficial de recompensas por errores de OpenAI --donde los investigadores reportan errores o vulnerabilidades que encuentran a cambio de reconocimiento o recompensas económicas--, su informe quedó estancado. La investigación solo se escaló a la unidad de ingeniería adecuada cuando Wardle se comunicó directamente con amigos en la empresa y con Stuckey, que respondieron favorablemente, dijo.

OpenAI le dio 500 dólares al grupo por su trabajo, una cantidad que, según Wardle, era poco en comparación con lo que se esperaría de otras empresas dada la gravedad de la falla. OpenAI solucionó el error, dijo, y lo reconoció esta semana en las notas de actualización de su software público sin revelar detalles.

"No era el programa de seguridad maduro que esperarías de una empresa enfocada en la seguridad", dijo Wardle.

Los empleados de OpenAI dijeron que era probable que hubiera más divulgaciones de este tipo. La empresa no solo está revisando las acciones tomadas por sus nuevos modelos durante las pruebas, sino que aún recibe advertencias de hackers sobre vulnerabilidades de seguridad abiertas, dijeron.

El viernes, un informe independiente publicado por un grupo de ingenieros e investigadores reveló un nuevo comportamiento alarmante del incidente de Hugging Face, el cual incluía casos en los que los agentes de OpenAI intentaron enviar mensajes a Claude de Anthropic y usar otros modelos de IA para superar las protecciones contra robots en un sitio web.

OpenAI también reveló la semana pasada que las nuevas medidas de seguridad no habían logrado evitar que su modelo de IA más reciente las traspasara para acceder a internet. Una revisión retrospectiva encontró otros casos de acceso no autorizado a internet que habían pasado desapercibidos. OpenAI anunció que pausaría el entrenamiento de sus modelos más avanzados y que participaba en una revisión exhaustiva del comportamiento inesperado de la tecnología.

El lunes, la empresa fue aún más allá. Dijo que no lanzaría su modelo de IA más reciente, GPT-6.1 Astra, debido a las preocupaciones de seguridad planteadas por sus investigadores.

Sheera Frenkel es una reportera que vive en el Área de la Bahía de San Francisco y cubre temas de tecnología de defensa y vigilancia.

Dustin Volz escribe sobre ciberseguridad e inteligencia para el Times. Vive en Washington.

Dylan Freedman es el editor de proyectos de IA del Times, e investiga diversos temas. Tiene experiencia como reportero y como ingeniero de aprendizaje automático.

PUBLICIDAD

PUBLICIDAD