Agregar Infobae enGoogle

Un estudio demostró que la IA no está lista para reemplazar a los científicos en investigación original

Tras 6 días de trabajo autónomo, acceso completo a internet y casi 3.000 dólares en créditos, los agentes entregaron artículos con calificaciones de rechazo y fallaron en el razonamiento científico básico

Un brazo robótico plateado sujeta un bolígrafo y escribe en una hoja con ecuaciones. Un monitor en segundo plano muestra códigos y mensajes de error
Un estudio del proyecto CRUX determinó que la inteligencia artificial todavía no puede realizar investigación científica original de manera autónoma (Imagen Ilustrativa Infobae)
Guardar

Un estudio del proyecto CRUX determinó que los agentes de inteligencia artificial todavía no pueden realizar investigación científica original de manera autónoma: aunque ya escriben código, ejecutan experimentos y rastrean literatura académica, el salto hacia trabajos abiertos sin intervención humana sigue fuera de su alcance, según informó el portal especializado TechXplore.

La prueba fue exigente y, aun así, el resultado fue pobre. Tras seis días de trabajo con acceso completo a internet, capacidad de cómputo dedicada y cerca de USD 3.000 en créditos para usar modelos, los sistemas entregaron artículos que recibieron calificaciones de rechazo inequívocas: 2/6 y 1/6 en la evaluación general hecha por revisores humanos.

PUBLICIDAD

El trabajo, publicado en el servidor de preprints arXiv, evaluó la capacidad de la IA para desarrollar investigación abierta, una tarea distinta de responder preguntas cerradas o resumir información existente. Conforme al portal, esa clase de trabajo exige formular hipótesis, rediseñar experimentos ante resultados adversos y sostener un razonamiento científico consistente.

La iniciativa contó con la participación de investigadores de la Universidad de Princeton, el UK AI Security Institute, la Universidad de Toronto, la Universidad de California en Berkeley, la Universidad de Georgetown, la Universidad Johns Hopkins y la Universidad de Stanford, entre otras instituciones.

PUBLICIDAD

Mujer con pelo recogido de espaldas frente a monitor con gráficos y texto, junto a teclado, mouse, libreta, documentos y hardware electrónico
La evaluación publicada en arXiv mostró que los artículos generados por la IA recibieron calificaciones de rechazo de 2/6 y 1/6 por parte de revisores humanos (Imagen Ilustrativa Infobae)

Agentes abordaron temas nuevos, pero no publicables

Los autores del estudio pusieron a prueba herramientas de frontera, descritas como sistemas diseñados para ejecutar tareas complejas y de varios pasos de forma autónoma. Para ello, les entregaron dos trabajos de conferencias de IA que en ese momento aún no habían sido publicados. La decisión buscó impedir que los modelos encontraran respuestas ya disponibles en línea.

Los temas asignados fueron dos: la estructura y controlabilidad de las personas de los modelos de lenguaje, y el diseño de un detector de cambios de distribución en modelos fundacionales tabulares. Una vez terminado el plazo, investigadores humanos revisaron los artículos generados por la IA con el mismo criterio usado para trabajos enviados a una conferencia de primer nivel en inteligencia artificial.

El resultado fue claro: los agentes comprendieron las preguntas de investigación y propusieron algunas líneas cercanas a las de los investigadores originales, pero fallaron en el razonamiento científico. Los diseños experimentales fueron débiles y, frente a retroalimentación negativa, tendieron a añadir salvedades sobre hallazgos previos en lugar de replantear sus estudios.

La evaluación de los revisores fue especialmente dura. David Africa, investigador del UK AI Security Institute y revisor experto del estudio, afirmó: “Los experimentos y las decisiones metodológicas eran extraños y difíciles de entender. Los resultados parecen claramente consecuencia de decisiones tomadas a posteriori”.

Un hombre en bata de laboratorio examina un documento frente a una pantalla con un artículo y referencias que muestran un efecto glitch en un laboratorio.
Un investigador en un laboratorio moderno revisa un artículo científico en una pantalla, donde las referencias digitales se desvanecen con un efecto glitch, simbolizando citas falsas generadas por inteligencia artificial. (Imagen Ilustrativa Infobae)

En otra de las valoraciones, Viet Nguyen, investigador de la Universidad de Toronto y coautor del estudio, cuestionó la lógica de una de las conclusiones: “Tras probar algunas señales fallidas usando elementos internos de un PFN, pasar de ahí a ‘no hay señales que podamos usar que aprovechen los elementos internos de un modelo’ es un salto enorme, una especie de falacia de ‘prueba por ejemplo’ que es altamente anticientífica”.

El principal límite no fue solo técnico, sino también metodológico

La investigación mostró además un problema de gestión del proceso. Los agentes administraron mal el tiempo y usaron menos de la mitad del presupuesto de API que tenían asignado, pese a contar con margen para explorar más y ejecutar más pruebas.

Esa combinación de apuro, escaso aprovechamiento de recursos y deficiencias metodológicas hizo que los artículos quedaran muy lejos de un estándar publicable. Pese a disponer de tiempo suficiente, los sistemas aceleraron el cierre del trabajo en vez de profundizar en la exploración abierta.

El hallazgo responde de forma directa a una de las promesas más repetidas sobre el futuro de la inteligencia artificial: por ahora, los modelos no están en condiciones de reemplazar a los científicos en investigaciones originales. Según los investigadores, el lugar más probable de estas herramientas en el corto plazo no es el de descubridor autónomo, sino el de asistente para tareas rutinarias dentro del laboratorio.

PUBLICIDAD

PUBLICIDAD

Últimas Noticias

Un chaleco probado por la NASA podría reducir hasta un 60% la radiación de las tormentas solares

La prenda fue evaluada a partir de los datos obtenidos durante Artemis I con dos maniquíes equipados con sensores. El estudio, publicado en Science Advances, analiza su posible uso en futuras misiones prolongadas

Un chaleco probado por la NASA podría reducir hasta un 60% la radiación de las tormentas solares

Un hongo letal irrumpe en el refugio más septentrional de murciélagos en Canadá

La confirmación en laboratorio del patógeno reactivó la preocupación entre especialistas, dos décadas después de su avance en 2007, con derrumbes de hasta 99% en especies vulnerables

Un hongo letal irrumpe en el refugio más septentrional de murciélagos en Canadá

Días nublados en el AMBA: cuál es el fenómeno climático detrás del “eterno” cielo gris

Según las estadísticas y los registros meteorológicos, un patrón de circulación atmosférica inusual intensificó la nubosidad durante este invierno, que se traduce en jornadas con menos horas de sol y una marcada secuencia de días grises. A qué responde la combinación de factores que favorecen el ingreso de humedad y la formación de nubes

Días nublados en el AMBA: cuál es el fenómeno climático detrás del “eterno” cielo gris

El brote de ébola es el más letal de la historia del Congo: la tasa de mortalidad llega al 46,8%

Los últimos datos oficiales reportan 2.325 muertes y 4.945 contagios confirmados, por encima del episodio de 2018-2020. La propagación no se atribuye solo al virus, advierten que la mayoría de los casos se detectan tarde

El brote de ébola es el más letal de la historia del Congo: la tasa de mortalidad llega al 46,8%

El método más eficaz para el desarrollo del habla en bebés, según un reciente estudio

Investigadores de la Universidad Internacional de Florida descubren cómo ciertas respuestas influyen en la forma en que los más pequeños utilizan sus primeras vocalizaciones y sonidos

El método más eficaz para el desarrollo del habla en bebés, según un reciente estudio
MÁS NOTICIAS