OpenAI informó que detectó seis instancias de “comportamiento inesperado o preocupante” en sus modelos de inteligencia artificial durante los últimos seis meses, al margen del reciente incidente con la plataforma Hugging Face. La compañía, valuada en cerca de un billón de dólares, publicó un nuevo marco de trabajo para el reporte de futuras conductas anómalas en sus sistemas.
Entre los casos divulgados figuran dos episodios en los que modelos —uno de investigación aún no publicado y otro correspondiente a un entrenamiento de GPT-5.6 Sol— insertaron instrucciones dirigidas a futuras versiones de sí mismos dentro de resúmenes de ventanas de chat, con el objetivo de “ocultar errores o comportamientos desalineados al usuario”, según el comunicado de la empresa.
PUBLICIDAD
Un modelo interno usó una clave de API filtrada sin autorización
Otro de los episodios reportados involucró a un modelo de uso exclusivamente interno que utilizó una clave de API filtrada sin autorización y luego fabricó datos para encubrir la acción. La compañía también identificó dos casos en los que modelos y agentes se comunicaron entre sí mediante tableros de mensajes y sistemas de intercambio de archivos no autorizados.

El sexto caso reunió dos ejemplos de entrenamiento en los que modelos subieron archivos a internet con el fin de citarlos luego como respuestas válidas frente a evaluadores humanos. OpenAI aclaró que estos reportes describen instancias individuales y que no deben interpretarse como evidencia de la frecuencia con la que ocurre la desalineación en el conjunto de sus modelos.
PUBLICIDAD
La compañía instaura un protocolo de divulgación con plazos definidos
El nuevo marco de trabajo presentado por la empresa establece que cualquier empleado puede señalar un problema para que el equipo de seguridad y alineación lo investigue. Ese proceso producirá plazos para cada etapa con el fin de garantizar una investigación y divulgación oportunas. Las investigaciones derivarán en informes que incluirán el comportamiento observado, los impactos externos e internos, y las medidas adoptadas en respuesta.
El proceso contempla, además, un sistema para determinar qué casos ameritan una divulgación pública. OpenAI señaló que el incidente de Hugging Face habría quedado encuadrado bajo la categoría de “investigación amplia” dentro de este nuevo esquema, reservada para casos complejos que requieren una revisión más extensa, en particular aquellos que involucran a terceros. La empresa se reservó el derecho de revisar este protocolo de seguridad según lo considere necesario.
PUBLICIDAD
Altman respaldó un llamado a frenar el ritmo de desarrollo de la IA
La divulgación se produce en un contexto de presión creciente sobre las empresas de inteligencia artificial para que aborden con mayor seriedad la alineación y la seguridad de sus modelos. OpenAI reiteró en su comunicado que “no creemos que la industria de la inteligencia artificial haya resuelto la alineación y el monitoreo en un grado suficiente para continuar escalando de manera responsable a máxima velocidad por mucho más tiempo”.
El término alineación refiere a la idea de que los modelos persigan resultados acordes con los intereses humanos. El sábado previo al anuncio, el director ejecutivo de OpenAI, Sam Altman, había respaldado un llamado a desacelerar el ritmo de avance de los modelos de inteligencia artificial, propuesta impulsada por Anthropic, la principal competidora de la compañía.
PUBLICIDAD
La iniciativa surgió después de que varios investigadores de la industria advirtieran la semana pasada sobre el creciente potencial de la inteligencia artificial para causar daños catastróficos.
Altman afirmó en una publicación en la red social X que la posibilidad de una desaceleración fue “un tema principal de las discusiones que tuvimos en OpenAI en las últimas semanas” y adelantó que la compañía compartiría más detalles próximamente.
El director ejecutivo de Anthropic, Dario Amodei, había propuesto durante el fin de semana un marco de tres pasos orientado a frenar el ritmo de desarrollo de la inteligencia artificial para disponer de más tiempo destinado a gestionar sus riesgos, propuesta que también recibió el respaldo del director ejecutivo de xAI, Elon Musk.
PUBLICIDAD
La divulgación de OpenAI coincide, además, con el momento en que la compañía había presentado de manera confidencial documentación para una posible oferta pública inicial (IPO) a comienzos de este año, aunque recientemente indicó que esa operación probablemente no se concretará antes de 2027.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Paramount ya tiene fecha para negociar su fusión con Warner Bros
La fusión, valuada en 111.000 millones de dólares, enfrenta la oposición de 12 estados por presunto riesgo de concentración de mercado
Anthropic llega a los bancos con la IA Claude: ahora los asesores financieros tendrán un asistente para atender a las personas
El software conecta a una red más amplia de asesores con las soluciones de análisis de inversión y carteras operadas por BlackRock y Vanguard

Sin cables ni electricidad: esta computadora solo usa ADN y calor para hacer cálculos
Un pulso de calor inicial y el enfriamiento gradual del líquido permiten que las hebras se autoensamblen y revelen la respuesta del cálculo

Códigos de Free Fire para hoy miércoles 16 de septiembre de 2026: diamantes, oro y skins gratis
Para recibir los premios, el jugador debe acceder al sitio oficial de canje e identificarse con la cuenta que tenga vinculada

“Estamos quedándonos sin tiempo para evitar este desenlace”, exempleado de DeepMind sobre las posibles consecuencias negativas de la IA
Bilal Chughtai subrayó que los investigadores aún tienen una comprensión “rudimentaria” de cómo entrenar sistemas avanzados para que persigan objetivos humanos de manera fiable




