Un equipo de investigadores desarrolló un robot capaz de aprender tareas complejas mediante un proceso que imita el aprendizaje infantil. El sistema logró dominar habilidades como servir jugo, doblar toallas y destapar frascos a través de una combinación de observación humana y aprendizaje autónomo. Según informaron los responsables de la investigación, la máquina demostró su capacidad de adaptación y fiabilidad durante extensas pruebas en ambientes reales.
El sistema, bautizado como RL-100, fue presentado por científicos de la Universidad Jiao Tong de Shanghái. La estrategia se inspira en la manera en que los niños incorporan nuevas habilidades: primero observan y replican a los adultos, luego mejoran por sí mismos al practicar. El robot inicia su formación observando demostraciones humanas para adquirir comportamientos seguros y similares a los de una persona, y después perfecciona esas destrezas de manera autónoma.
PUBLICIDAD
El proceso se divide en tres etapas. Durante la primera, el robot observa a expertos ejecutar diversas tareas a través de teleoperación. Estas acciones humanas se utilizan para entrenar una política visuomotora basada en difusión, que asocia las imágenes captadas por cámaras RGB o nubes de puntos 3D con los movimientos necesarios para manipular objetos.

Aprendizaje autónomo y mejora continua
Tras superar el umbral de la simple imitación, el robot inicia la segunda fase, donde recurre al aprendizaje por refuerzo, un método que le permite perfeccionar sus habilidades mediante repetición y experiencia propia. Según la información facilitada por los desarrolladores, el sistema almacena y reutiliza intentos exitosos y fracasos, y ajusta de manera progresiva su política de acciones con un objetivo unificado basado en el algoritmo Proximal Policy Optimization (PPO).
PUBLICIDAD
Una de las innovaciones clave es la inclusión de un mecanismo de evaluación offline, que previene retrocesos en el rendimiento durante el proceso de actualización. Esta etapa resulta fundamental para que el robot logre mayor fiabilidad y capacidad de adaptación en entornos no estructurados, superando la limitación que imponen las demostraciones humanas.
La etapa final consiste en una breve fase de aprendizaje por refuerzo en tiempo real, directamente sobre el robot físico. Esta fase se orienta a corregir casos de fallo poco frecuentes, lo que incrementa la tasa de éxito del sistema desde aproximadamente 90 % hasta niveles cercanos al 100 %, sin requerir grandes volúmenes de datos adicionales.
PUBLICIDAD

Desempeño en tareas del mundo real
El marco de trabajo RL-100 fue evaluado en ocho tareas de manipulación, desde el manejo de objetos rígidos hasta materiales deformables, líquidos y ensamblajes de precisión. Entre las pruebas figuran la preparación de jugo de naranja, el doblado de toallas y la apertura de frascos. En 1.000 pruebas de evaluación, el robot alcanzó una tasa de éxito del 100 % y llegó a igualar, e incluso superar, la velocidad de teleoperadores humanos expertos.
El sistema demostró además capacidad de recuperación ante interferencias físicas y adaptabilidad frente a objetos desconocidos o cambios en el entorno, sin necesidad de reentrenamiento. Durante una experiencia real en un centro comercial, el robot operó de manera continua durante siete horas sirviendo jugo fresco sin registrar ningún fallo.
PUBLICIDAD
Soluciones técnicas para la robótica autónoma
Uno de los desafíos técnicos que resolvieron los investigadores fue la reducción de la latencia computacional asociada a las políticas basadas en difusión.

Tradicionalmente, estos modelos requieren múltiples pasos de procesamiento antes de ejecutar cada acción, lo que ralentiza el control robótico. Para abordarlo, el equipo implementó una técnica de destilación de modelos de consistencia, que condensa el proceso en un solo paso y reduce el tiempo de inferencia de 100 milisegundos a 10.
PUBLICIDAD
Según informaron los expertos de la Universidad Jiao Tong de Shanghái, el marco de aprendizaje es agnóstico respecto a la tarea, el tipo de robot o la representación sensorial utilizada. Puede aplicarse a brazos robóticos simples y a sistemas bimanuales, y admite el uso de imágenes RGB o nubes de puntos 3D sin modificar la estructura del aprendizaje.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Investigación revela que los consejos electorales de los chatbots de IA son “inexactos y poco fiables”
El informe evidenció la falta de transparencia en la generación de recomendaciones políticas por parte de sistemas de inteligencia artificial
Todo sobre Slack: para qué sirve, de quién es y diferencias entre plan gratuito y de pago
Esta plataforma se consolidó como la herramienta central para la comunicación interna en empresas de todo el mundo

Del falso Kevin Costner a la clonación de voz: cuáles son las estafas virtuales más comunes y cómo evitarlas
El fraude que terminó con una mujer de 70 años transfiriendo más de $3,6 millones expuso una tendencia en crecimiento. En Infobae al Regreso, el divulgador tecnológico Joan Cwaik explicó por qué estos engaños funcionan y qué hacer para reducir el riesgo de caer en ellos

Cómo programar eventos en WhatsApp: pasos para crear, editar y fijar reuniones en tus grupos
La función habilita programar fecha, hora, ubicación y descripción desde el menú de adjuntos, con confirmaciones de asistencia y avisos automáticos al inicio
Todos los códigos de Netflix disponibles para desbloquear categorías ocultas de películas y series
Con el código 6962, los usuarios pueden desbloquear la categoría de películas para niños entre 11 y 12 años como Las guerreras K-pop




