La robótica ha enfrentado una barrera fundamental en la escasez de datos de alta calidad y gran volumen, lo que ha limitado la escalabilidad de los modelos de política en comparación con los avances en modelos de lenguaje y visión. Este trabajo aborda el problema central de cómo escalar modelos de control robótico cuando la recolección de datos de robots reales es inherentemente costosa y lenta. Propone que, al igual que los modelos fundacionales en otros dominios, la clave reside en el aprovechamiento de leyes de escalado empíricas, donde la capacidad del modelo mejora con la cantidad de datos, parámetros y capacidad de cómputo.
El enfoque se centra en desacoplar el aprendizaje de representaciones generales de acción de la especificidad del hardware robótico. Esto se logra mediante un pre-entrenamiento masivo con datos 'embodiment-free' (UMI), que capturan interacciones del mundo real sin la necesidad de un robot físico específico. Posteriormente, una fase de post-entrenamiento más pequeña alinea estas capacidades generales con los robots reales y la comprensión de instrucciones en lenguaje natural, resolviendo así el cuello de botella de datos y permitiendo la aplicación de principios de escalado que han transformado otros campos de la IA.
Arquitectura del Sistema
La arquitectura de Xiaomi-Robotics-1 sigue un paradigma de entrenamiento de dos etapas, similar al de los Large Language Models (LLMs). La primera etapa es el pre-entrenamiento, cuyo objetivo es aprender representaciones generales para la generación de acciones a partir de un corpus masivo de datos UMI (Unimodal Interaction). Estos datos consisten en 100,000 horas de trayectorias de manipulación del mundo real, abarcando más de 1,700 escenarios diversos. Dada la escala, se implementa un pipeline de auto-etiquetado que segmenta videos largos en clips de duración fija y utiliza un modelo de visión-lenguaje (VLM) para describir las transiciones de estado de los grippers y objetos interactuantes dentro de cada clip. Esto genera un corpus de trayectorias anotadas con descripciones precisas en lenguaje natural, permitiendo al modelo aprender a generar acciones que impulsan la escena hacia los estados descritos.
La segunda etapa es el post-entrenamiento, que tiene dos objetivos principales: alineación con el 'embodiment' y alineación con las instrucciones. La alineación con el 'embodiment' utiliza datos de robots reales de alta calidad y 'cross-embodiment' para mapear la capacidad general de generación de acciones aprendida en el pre-entrenamiento a robots físicos específicos. La alineación con las instrucciones transforma el modelo de generar acciones basadas en descripciones de transiciones de estado a comprender y ejecutar directamente instrucciones en lenguaje natural. Este proceso utiliza datos UMI de alta calidad anotados manualmente con segmentos temporales y 'instruction prompts', que difieren de las descripciones de transición de estado auto-etiquetadas. El modelo resultante puede realizar una amplia gama de tareas de manipulación móvil en el mundo real 'out-of-the-box'.
Pipeline de Pre-entrenamiento de Datos UMI
- 1 Recolección de Trayectorias UMI 100,000 horas de videos de manipulación del mundo real en 1,700+ escenarios.
- 2 Segmentación de Video División de videos largos en clips de duración fija.
- 3 Auto-etiquetado VLM Modelo de Visión-Lenguaje describe transiciones de estado de grippers y objetos.
- 4 Corpus de Pre-entrenamiento Generación de un gran conjunto de datos con descripciones de lenguaje precisas.
Flujo de Entrenamiento de Xiaomi-Robotics-1
- 1 Pre-entrenamiento Aprendizaje de representaciones generales de acción con datos UMI auto-etique...
- 2 Alineación de Embodiment Uso de datos de robots reales 'cross-embodiment' para mapear capacidades a ro...
- 3 Alineación de Instrucciones Ajuste del modelo para comprender y ejecutar instrucciones en lenguaje natural.
- 4 Modelo Post-entrenado Xiaomi-Robotics-1 listo para tareas de manipulación móvil en el mundo real.
Trade-offs
Ganancias
- ▲ Reducción de la barrera de datos para robótica
- ▲ Capacidad de escalado del modelo
- ▲ Eficiencia en la adaptación a nuevas tareas
- ▲ Rendimiento 'out-of-the-box' en entornos no vistos
Costes
- △ Complejidad del pipeline de auto-etiquetado y gestión de datos
- △ Dependencia de un VLM robusto para el auto-etiquetado
Fundamentos Teóricos
El concepto de pre-entrenamiento a gran escala seguido de un ajuste fino (fine-tuning) se alinea directamente con los principios establecidos en la investigación de modelos fundacionales, particularmente aquellos que surgieron del trabajo en procesamiento de lenguaje natural. La idea de que un modelo puede aprender representaciones generales y transferibles de un corpus masivo de datos no estructurados, para luego ser especializado en tareas específicas con conjuntos de datos más pequeños, fue popularizada por modelos como BERT (Devlin et al., 2019) y GPT (Radford et al., 2018). Este enfoque se basa en la hipótesis de que las leyes de escalado empíricas, donde el rendimiento mejora logarítmicamente con el aumento de datos y parámetros, son universales a través de diferentes modalidades.
La aplicación de modelos de visión-lenguaje (VLM) para el auto-etiquetado de datos de video también tiene raíces en la investigación de aprendizaje multimodal, donde la combinación de información visual y textual ha demostrado ser efectiva para la comprensión contextual. Este trabajo extiende estos principios al dominio de la robótica, abordando el desafío de la escasez de datos específicos de robots mediante la creación de un puente entre el vasto mundo de los datos 'embodiment-free' y las necesidades de control de robots físicos. La demostración de que las leyes de escalado se mantienen en este dominio es una validación empírica de la transferibilidad de estos principios fundamentales de la computación y el aprendizaje automático.