Alibaba integra la IA en el mundo físico: presenta el conjunto de modelos Qwen-Robot Suite para el control de robots

El gigante tecnológico chino Alibaba ha dado un paso significativo hacia la "inteligencia artificial encarnada" (Embodied AI) al presentar el conjunto de modelos fundamentales Qwen-Robot Suite. Este conjunto de tres modelos especializados está diseñado para resolver tareas clave que enfrentan los robots físicos: navegación, manipulación de objetos y predicción del desarrollo de la escena. No se trata de un robot listo para usar, sino de un "cerebro" de software que, según la visión de los desarrolladores, debería convertirse en una herramienta universal para controlar varios tipos de mecanismos.
Los grandes modelos de lenguaje (LLM) ya han demostrado su eficacia en el trabajo con texto, imágenes y videos. Sin embargo, para los robots esto no es suficiente. No solo necesitan entender un comando en lenguaje natural, sino también traducirlo en una secuencia de acciones físicas, teniendo en cuenta la geometría del espacio, las propiedades de los objetos y las limitaciones de sus propios sensores. Precisamente este problema busca resolver Qwen-Robot Suite, uniendo percepción, planificación y ejecución en una pila unificada.
Qwen-RobotNav: navegador universal
El primer modelo del conjunto, Qwen-RobotNav, se centra en el desplazamiento. Combina cinco tareas de navegación diferentes: seguir instrucciones, moverse hacia un punto dado, buscar objetos, rastrear objetivos y elementos de conducción autónoma. Construido sobre la base del modelo multimodal Qwen3-VL, fue entrenado con 15,6 millones de muestras de datos relacionadas con la planificación de rutas y el razonamiento visual-lingüístico.
Los resultados de las pruebas son impresionantes: el modelo demuestra un 76,5% de éxito en el benchmark VLN-CE RxR y un 90% en EVT-Bench. Alibaba posiciona Qwen-RobotNav no como una solución aislada, sino como un módulo ejecutivo para sistemas de agentes más grandes, donde el modelo de alto nivel establece la tarea y el navegador se encarga de su implementación física.
Qwen-RobotManip: maestro de la manipulación
El segundo modelo, Qwen-RobotManip, se encarga de la interacción con objetos: agarre, movimiento y colocación de elementos. La innovación clave aquí es el intento de resolver el problema de la heterogeneidad de las plataformas robóticas. Diferentes robots (manipuladores, sistemas bimanuales, plataformas móviles) utilizan diferentes sistemas de coordenadas y formatos de comandos. Qwen-RobotManip busca crear una representación universal de acciones, permitiendo transferir habilidades adquiridas en un tipo de robot a otro.
Para entrenar el modelo se recopiló una cantidad colosal de datos: más de 38 100 horas, que incluyen tanto conjuntos de datos robóticos abiertos como videos de acciones humanas. Esto permitió a Qwen-RobotManip ocupar el primer lugar en el prestigioso benchmark RoboChallenge Table30 v1 y demostrar resistencia a instrucciones y objetos nuevos y desconocidos.
Qwen-RobotWorld: predictor del futuro
El tercer modelo, Qwen-RobotWorld, es un "modelo de video del mundo" controlado por lenguaje. Analiza el estado actual del entorno y un comando de texto, y luego genera un video que predice cómo se desarrollará la escena después de ejecutar la acción. Este enfoque es crítico para planificar manipulaciones complejas, la conducción autónoma y la creación de datos sintéticos para entrenar robots sin riesgo de averías en el mundo real.
El corpus de datos para Qwen-RobotWorld, denominado Embodied World Knowledge, incluye 8,6 millones de pares "video-texto" y más de 200 millones de fotogramas, que abarcan más de 20 tipos de robots y 500 categorías de acciones. El modelo ya ha ocupado los primeros lugares en los benchmarks EWMBench y DreamGen Bench, y también ha superado a todos los análogos abiertos en WorldModelBench y PBench.
Conclusión analítica
A pesar de las impresionantes declaraciones y los altos resultados en los benchmarks, Qwen-Robot Suite sigue siendo un conjunto de modelos de investigación, no un producto comercial listo para usar. Las condiciones reales de operación de los robots están llenas de "ruido", desgaste y situaciones imprevistas que son difíciles de modelar. Sin embargo, el enfoque de Alibaba para crear una "pila completa" para la IA encarnada es extremadamente prometedor. Si la empresa logra integrar estos modelos en escenarios reales de producción y servicio, seremos testigos de un salto cualitativo en el desarrollo de la robótica. Sin embargo, hasta la implementación masiva y el acceso público, a juzgar por la ausencia de plazos y precios concretos, quedan al menos varios años de pruebas intensivas.