
El modelo GEN-1.5 aprende tareas robóticas con una demostración breve en lugar de requerir un entrenamiento específico para cada acción. Generalist AI ha presentado un sistema capaz de observar entre tres y 12 segundos de vídeo y después intentar reproducir la manipulación mostrada.
La empresa denomina physical prompting a este enfoque. El ejemplo que recibe el robot no es una instrucción escrita, sino una secuencia de movimientos que le sirve para identificar el estado inicial, la interacción con el objeto y el objetivo de la tarea.
El robot puede intentar abrir un bote, bajar una cremallera o sacar un billete de una cartera después de ver una única demostración, sin crear un nuevo conjunto de datos ni aplicar ajuste fino para cada tarea.
Un vídeo como contexto para controlar el robot
GEN-1.5 no necesita limitarse a repetir una trayectoria exacta. El modelo trata de extraer qué objetivo persigue la demostración y trasladarlo a sus pinzas. La escena puede mostrar a otro robot realizando la acción, pero también a una persona usando sus propias manos delante de las cámaras del sistema.
Generalist AI también ha mostrado experimentos en los que se combinan dos demostraciones diferentes para que el robot complete por sí mismo los movimientos intermedios. Además, una tarea realizada en un simulador puede utilizarse para controlar un robot físico, incluso cuando el sistema no ha sido preentrenado con simulaciones.
La precisión todavía limita el uso práctico
El planteamiento reduce el trabajo necesario para enseñar una acción, pero la capacidad obtenida mediante una demostración es menos consistente que la adquirida con entrenamiento. Generalist AI probó GEN-1.5 con diez tareas de manipulación sencillas y relativamente cortas, con una tasa media de éxito del 59%.
En esas condiciones, el robot falla aproximadamente cuatro de cada diez intentos. La compañía ha reconocido que el aprendizaje a partir del contexto todavía no ofrece la misma solidez que un entrenamiento específico, un aspecto especialmente relevante cuando una tarea exige precisión o debe ejecutarse de forma repetible.
Un pequeño ajuste mejora los resultados
Tras la demostración inicial, el modelo puede actualizarse con una cantidad reducida de datos. En una tarea sencilla, unos cinco minutos de grabaciones —alrededor de 50 demostraciones— y diez actualizaciones elevaron la tasa de éxito hasta el 83%. Los pesos del modelo cambiaron menos del 0,15% durante ese proceso.
La interpretación de Generalist AI es que esos ajustes reorganizan conocimientos generales que el modelo ya había adquirido. La empresa afirma haber preentrenado sus sistemas con más de medio millón de horas de interacción física, con la expectativa de que esa experiencia permita abaratar progresivamente el aprendizaje de nuevas manipulaciones.
Si estás siguiendo este tema, también puedes consultar GEN-1.5 de Generalist AI aprende tareas robóticas con una sola demostración.
Qué aporta este enfoque a la robótica
GEN-1.5 apunta a un cambio desde modelos especializados para cada tarea hacia sistemas capaces de reutilizar conocimientos entre objetos y escenarios. Para quienes desarrollan robots, enseñar una acción mediante una demostración podría ser más flexible que preparar un conjunto de datos y un entrenamiento independiente cada vez.
Eso no significa que el problema esté resuelto. El resultado depende de la capacidad del modelo para interpretar el vídeo y generalizarlo a la situación real, y las pruebas publicadas muestran una diferencia notable entre intentar una tarea tras verla y consolidarla con algunos ajustes adicionales.
Conclusión
GEN-1.5 presenta una vía para enseñar manipulaciones robóticas con unos segundos de contexto visual, incluida la posibilidad de usar demostraciones humanas o simuladas. Su tasa inicial del 59% muestra que la propuesta todavía está en una fase temprana, aunque el 83% alcanzado con un entrenamiento adicional reducido indica que el enfoque puede disminuir el coste de adaptar un robot a nuevas tareas.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.