
Dyna-2 es el nuevo modelo de acción robótica de Dyna Robotics, entrenado con más de un millón de horas de vídeo humano en primera persona. La compañía lo ha diseñado para controlar tareas de manipulación y estudiar hasta qué punto los vídeos cotidianos pueden complementar la escasez de datos de robots manejados por teleoperación.
El sistema no se distribuye como un modelo descargable. Dyna Robotics no ha anunciado pesos públicos, API ni licencia para Dyna-2, por lo que el acceso actual pasa por contratar una célula robótica de la empresa. Su aplicación se orienta a trabajos repetitivos en hostelería, lavanderías comerciales, restauración, montaje ligero y limpieza de instalaciones.
Dyna-2 combina predicción de vídeo y generación de acciones en un mismo modelo, pero durante la ejecución utiliza una política reactiva que no necesita generar ni consultar vídeo futuro.
Un modelo de acción entrenado con vídeo
Dyna-2 pertenece a la categoría de los world-action models (WAM). Su arquitectura separa los tokens de vídeo y de acción en distintas capas de transformadores, aunque ambas ramas pueden atenderse entre sí. La información propioceptiva entra directamente en el transformador de acciones, mientras que los tokens de vídeo pueden consultar texto; ese texto no influye de forma directa en los tokens de acción.
El entrenamiento utiliza flow matching y dos objetivos diferenciados: uno para el vídeo y otro para las acciones. El equipo ha mantenido la rama de acción deliberadamente más ligera y la conecta pronto con el flujo de vídeo para reducir la latencia. Una fase de destilación, probada en una GPU H100, redujo el muestreo de vídeo de 10.203 a 110 milisegundos.
La base de entrenamiento supera el millón de horas de vídeo humano en primera persona, una cantidad que Dyna Robotics cifra en unos 170 años de actividad durante las horas de vigilia. Para medir el efecto del volumen, la empresa construyó conjuntos anidados de 1.000, 10.000, 100.000 y 1.000.000 de horas, manteniendo la proporción de datos de cada origen.
Qué muestran las pruebas de escalado
Según las evaluaciones presentadas por Dyna Robotics, las cuatro métricas sobre datos humanos mejoraron de forma monotónica a lo largo de la escala y se ajustaron a leyes de potencia. La mejora relativa fue más marcada en la precisión de acción que en el error cuadrático medio, con un aumento del 51 % frente al 12 % en las métricas comparadas.
La compañía también evaluó los mismos puntos de control, sin entrenamiento específico previo, en 39 tareas robóticas de dos plataformas bimanuales YAM. El error cuadrático medio de acción descendió conforme aumentó el volumen de vídeo, con un cambio especialmente visible entre 10.000 y 100.000 horas. Dyna Robotics interpreta este resultado como una transferencia a datos robóticos que no aparecían en el preentrenamiento.
El postentrenamiento cubrió 14 tareas con un máximo de 10 horas de datos robóticos por tarea y tres tipos de cuerpo: brazos YAM de seis grados de libertad con pinzas paralelas, esos mismos brazos con manos dextrales WUJI-2 de 20 grados y un prototipo semihumanoide. El conjunto incluyó acciones como preparar kits de primeros auxilios, construir contenedores, recoger bebidas concretas de una nevera, atar cuerdas o retirar bandejas de residuos.
- La puntuación normalizada media pasó del 20 % al 53 % entre el primer y el último nivel de datos.
- El modelo obtuvo el mejor resultado en nueve de las 14 tareas con un millón de horas.
- El giro de una llave en una caja cerrada pasó del 0 % hasta 100.000 horas al 90 % en el nivel superior.
- El desenroscado de un tapón alcanzó el 50 % pese a contar con unos diez minutos de demostraciones para el postentrenamiento.
Comparación con el sistema de producción
Frente a Dyna-1, el modelo de visión, lenguaje y acción que la empresa utiliza en producción y que parte de Qwen3-VL-4B, una versión inicial de Dyna-2 registró una tasa de éxito 1,55 veces superior y una calificación 1,12 veces mayor. La comparación agrupó siete tareas y tres puntos de control.
En ubicaciones de clientes que no formaban parte de las pruebas internas, Dyna-2 superó los criterios de producción en el 87 % de los casos, frente al 46 % de Dyna-1. En las instalaciones propias, ambos sistemas se acercaron al 100 %. Estas cifras son resultados comunicados por el fabricante, no una evaluación independiente de laboratorio.
Qué implica para los usuarios
La principal consecuencia práctica es que el vídeo humano puede servir como señal adicional para mejorar la transferencia entre cuerpos robóticos y entornos distintos, sin necesidad de etiquetar cada acción humana como si fuera una demostración de robot. Eso podría reducir parte del trabajo de recopilación de datos para operadores con tareas repetitivas, aunque el sistema sigue necesitando postentrenamiento robótico específico.
Por ahora, Dyna-2 no es una opción para investigadores o desarrolladores que quieran ejecutar el modelo localmente. Su disponibilidad está vinculada a las células robóticas de Dyna Robotics y quedan pendientes tanto el acceso para terceros como las comprobaciones independientes sobre sus resultados y su comportamiento en más entornos.
Conclusión
Dyna-2 plantea una vía concreta para usar grandes volúmenes de vídeo humano en manipulación robótica. Los resultados de la empresa apuntan a que la predicción conjunta de vídeo y acción mejora la generalización entre plataformas, mientras que la política de ejecución mantiene una respuesta orientada a la latencia. El avance, sin embargo, llega como servicio integrado en robots de Dyna Robotics y no como un modelo abierto para descargar.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


