
El lunes 28 de septiembre, OpenAI frenó el lanzamiento de GPT-6.1 Astra, uno de sus próximos modelos. Según Saachi Jain, responsable de Sistemas de Seguridad de la empresa, en las pruebas el modelo a veces avanzaba con tareas sin pedir permiso al usuario y no siempre le informaba bien lo que había hecho. El martes 29, Donald Trump firmó la orden ejecutiva “Inaugurando la era de la superinteligencia”. ¿Cómo puede llamarse superinteligencia una tecnología que uno de sus principales fabricantes todavía no se anima a dejar sola del todo?
Vamos unas semanas atrás. El jueves 3 de septiembre, al presentar GPT-6 Astra, la versión ya disponible, Greg Brockman, presidente de OpenAI, cerró la rueda de prensa con una frase sobre la inteligencia artificial general (AGI, por sus siglas en inglés): “Bienvenidos a la era de la AGI”.
PUBLICIDAD
Ese mismo día, ARC Prize, la fundación que administra ARC-AGI-3, una prueba de inteligencia en la que el modelo acababa de batir el récord, escribió que Astra representa “un progreso significativo hacia la generalización”, aunque aclaró: “No estamos afirmando que sea AGI”. Dos eras en 26 días, pero… recordá esto: ninguna etiqueta es una medición.
La orden de Trump manda a las agencias federales decir “superinteligencia” donde decían “inteligencia artificial”, porque, sostiene, las capacidades de los sistemas actuales “hacen mucho más que imitar o automatizar aspectos discretos de la inteligencia humana”. Da 60 días, hasta el 28 de noviembre, para proponer un texto de ley con una definición federal.
PUBLICIDAD
Mientras tanto, para aplicar la orden, “superinteligencia” abarca lo mismo que “inteligencia artificial” en la definición de la ley federal vigente: un sistema basado en máquinas que, para objetivos definidos por personas, puede hacer predicciones, recomendaciones o decisiones que influyen en entornos reales o virtuales. Un día después, el gobernador de California, Gavin Newsom, firmó una orden para que las agencias de su estado sigan diciendo “inteligencia artificial”. Por ahora, cambió la palabra, no la definición.
Con “AGI”, que sería el equivalente a una inteligencia general “de tipo humano”, pasa lo inverso, y no porque alguien mienta. Es algo más incómodo, pero mucho más útil entenderlo: la misma palabra nombra cosas distintas.
PUBLICIDAD
Tres cosas distintas con el mismo nombre

La carta fundacional de OpenAI, de 2018, habla de “sistemas altamente autónomos que superan a las personas en la mayoría del trabajo económicamente valioso”. Esa definición tiene al menos dos patas: el trabajo valioso y la autonomía. Pero los usos que se le dan a “AGI” caben en, por lo menos, tres cajas.
La caja uno es la IA que hace tareas que le definimos muy bien, la AGI funcional: redacta, programa y maneja una computadora como una persona, pero con nuestros ojos por sobre el hombro. La caja dos es la que se puede dejar sola, como a un empleado con las llaves de la oficina: la AGI robusta, que entiende, recuerda, aprende de la experiencia y teóricamente es confiable fuera de encargos acotados. La caja tres, la que nos supera a todos, es la superinteligencia.
PUBLICIDAD
Las tres cajas anteriores nos sirven para ubicar a quien habla: cuando alguien dice que la IA ya es de nivel humano, casi siempre está parado en la caja uno; cuando otro dice que todavía no hay AGI, piensa en la dos o en la tres.
Brockman, muy probablemente, hablaba de la uno. De la caja tres hablan Evan Hubinger, que dirige un equipo de seguridad de Anthropic y en septiembre reconoció que su empresa todavía no tiene un plan para que una superinteligencia comparta los valores de quienes la construyen, y el senador Bernie Sanders, que propone prohibirla. La orden de Trump usa el nombre de la caja tres, pero con una evidencia que, hasta hoy, es de la caja uno.
PUBLICIDAD
Parece una discusión sobre hechos; suele ser una discusión sobre definiciones.
Cómo se mide el trabajo valioso

Para la pata del trabajo valioso de la carta fundacional, se propuso el benchmark GDPval, que la propia OpenAI publicó en septiembre de 2025: ponía a la IA, como a un pasante nuevo, a competir en tareas puntuales con profesionales experimentados de 44 ocupaciones, de las nueve industrias que más aportan al PBI de Estados Unidos. Un jurado comparaba las entregas a ciegas y contaba cuántas veces ganaba o empataba la máquina.
PUBLICIDAD
El porcentaje suma victorias y empates; no es una nota de aprobación. De GPT-4o a Claude Opus 4.1, en poco más de un año, esa proporción pasó de 12,4% a 47,6%, según OpenAI. En diciembre de 2025, la empresa informó 70,9% para GPT-5.2 Thinking: ganó o empató en la mayoría de las comparaciones, aunque siempre con encargos completos y bien especificados. De ahí en más, la vara comenzó a cambiar: en septiembre de este año, la tabla GDPval-AA, de la firma independiente Artificial Analysis, dejó de anclar su escala en el profesional humano y pasó a anclarla en un modelo de IA. Con esos resultados, la referencia empieza a ser otra máquina.
Cómo se mide si podemos dejar sola a la IA

La pata de la autonomía la mide, por ejemplo, METR, una institución evaluadora sin fines de lucro, con tareas de programación, aprendizaje automático y ciberseguridad que un sistema completa solo, medidas en tiempo humano: no lo que tarda la máquina, sino lo que le llevaría a un experto realizar la tarea.
PUBLICIDAD
METR evalúa agentes: sistemas de IA que actúan además de responder. En su tablero de mayo, el mejor que midió con confianza, Claude Opus 4.6, completaba tareas de unas 12 horas acertando la mitad de las veces, y de 70 minutos si había que acertar ocho de cada diez. Era como calcular el tamaño del encargo que un pasante podía resolver sin consultar a nadie. Hoy también hay escalas nuevas, más largas, porque esta empieza a quedar corta: los mejores agentes resuelven bien, la mitad de las veces, tareas que a un experto le llevarían más de una jornada de trabajo. Hace dos años, ese mismo número se medía en minutos.
Si Brockman, al referirse a la AGI, hablaba de la caja uno, tiene argumentos: con los modelos de este año, esa caja ya se puede defender con evidencia y no solo con marketing.
PUBLICIDAD
Qué pasa con la AGI robusta, que entiende, recuerda y aprende

Mi lectura, discutible, es que la caja dos tiene casilleros vacíos, justo los que importan cuando se entregan las llaves a un empleado: memoria a largo plazo, aprendizaje continuo y fiabilidad en tareas largas y abiertas. GPT-6.1 Astra es el ejemplo de la semana: lo que frenó su salida no fue lo que sabía hacer, sino que no se quedaba dentro de lo autorizado ni rendía bien cuentas de lo que hacía.
Para esta caja se propusieron distintas mediciones. Por ejemplo, la prueba de ARC Prize que mencionamos al inicio. Imaginá un videojuego que nunca viste, sin manual: hay que tocar cosas, ver qué pasa y deducir las reglas. Eso es ARC-AGI-3: todos sus juegos los pueden resolver personas, y sacar 100% significa ganarlos con la misma eficiencia que ellas. Con la evaluación estándar, GPT-6 Astra sacó 62,7%, según publicó ARC Prize el 3 de septiembre: más del doble del récord anterior con la misma evaluación, que tenía Claude Opus 5, de Anthropic, con 30,2%.
Ambas evaluaciones usan un arnés, el software que conecta al modelo con el juego. El estándar conserva sus notas; el otro también conserva su razonamiento entre pasos y resume el contexto. Con este último, y otro nivel de esfuerzo, Astra llegó a 99,9%. Pero el entorno sigue acotado: medimos la caja uno con una cinta muy precisa sobre un pedazo muy chico de la realidad.
Para la caja dos, la definición de un grupo encabezado por Dan Hendrycks y Yoshua Bengio, publicada en octubre de 2025, compara a la IA con un adulto con buena formación en 10 capacidades, donde 100% es igualarlo. GPT-4 sacó 27% y GPT-5, 57%, con la capacidad de almacenamiento en la memoria a largo plazo, en cero. Estos sistemas pueden guardar archivos, pero, aun así, guardar datos y aprender de la experiencia son dos cosas distintas.
Hoy día, los agentes pueden ser muy capaces y poco fiables a la vez. Esto lo veo todas las semanas en las implementaciones que me tocan: el agente que resuelve en una hora algo que llevaba días, y el mismo agente que a la mañana siguiente malinterpreta una instrucción de dos líneas.
Qué pasa con la superinteligencia, ahora presente en la orden ejecutiva de Trump
En la caja tres hoy no hay ningún sistema; tampoco hay una prueba consensuada que la mida. Sí se discute, y mucho, como riesgo.
Los incidentes recientes con agentes no muestran exceso de inteligencia, sino una buena capacidad de caja uno con autonomía y sin la fiabilidad de la dos. Eso tranquiliza sin negar el riesgo. El peligro de hoy se parece menos a una mente superior que a un empleado que sabe resolver muchas cosas, con llaves que todavía no se ganó.
La próxima vez que alguien diga “esto ya es AGI” o “esto ya es superinteligencia”, no le discutas el veredicto. Hacele una sola pregunta: ¿qué definición estás usando? No elimina todos los desacuerdos, pero permite saber qué falta demostrar.
Últimas Noticias
Institutos penales para la libertad
En un tiempo en el que la palabra “libertad” aparece constantemente en discursos políticos, debates sociales y conversaciones cotidianas, la filosofía vuelve a plantear una pregunta tan antigua como necesaria: ¿de qué hablamos cuando hablamos de libertad? A esa pregunta debemos responder con otra: ¿en qué ámbito? O, dicho de otro modo, ¿libertad para qué?

Discapacidad: de la emergencia a la autonomía
Cómo construir un sistema que proteja sin depender del estado de excepción

El poder de un abrazo: acercarnos al otro puede cambiar el rumbo de la humanidad
En el marco del octavo centenario de la muerte de San Francisco de Asís, la iniciativa “Un abrazo por la humanidad” nos recuerda que la fraternidad se construye a partir de decisiones y acciones diarias.

20 años de ESI: solo la ley no garantiza el derecho
Sin presupuesto, metas ni formación docente, una política clave para cuidar infancias pierde alcance justo donde más se necesita




