Crypto news

17.06.2026
11:33

Alibaba lleva la IA al mundo físico: presenta el conjunto de modelos Qwen-Robot Suite para el control de robots

Tool_AI

Alibaba Cloud ha dado un paso significativo en el desarrollo de la inteligencia artificial física (Physical AI) al presentar Qwen-Robot Suite. No se trata simplemente de otro modelo de lenguaje, sino de un stack completo compuesto por tres modelos especializados, cada uno de los cuales resuelve una tarea concreta de robótica: navegación, manipulación de objetos y predicción de escenas físicas. El equipo de Qwen denomina a este proyecto «un stack completo para la inteligencia encarnada».

La esencia del avance radica en que los grandes modelos de lenguaje (LLM) ya funcionan excelentemente con texto, imágenes y vídeos, pero esto no es suficiente para interactuar con el mundo real. Los robots no solo necesitan comprender una orden en lenguaje natural, sino también traducirla en una acción física: moverse, agarrar, tener en cuenta la gravedad y las propiedades de los objetos. Qwen-Robot Suite pretende cerrar esta brecha entre lo digital y lo físico.

Qwen-RobotNav: Navegador universal

El primer modelo del stack, Qwen-RobotNav, está construido sobre la base de Qwen3-VL y representa un solucionador universal para cinco tipos de tareas de navegación: seguir instrucciones, desplazarse a un punto, buscar objetos, rastrear un objetivo y conducción autónoma. El modelo se ha entrenado con 15,6 millones de muestras relacionadas con el razonamiento visual-lingüístico.

Los resultados son impresionantes: un 76,5% de éxito en el complejo benchmark VLN-CE RxR y un 90% en EVT-Bench. En escenarios reales, esto significa que el robot no solo puede desplazarse, sino que, por ejemplo, puede encontrar un objeto perdido en una oficina y proporcionar una prueba visual al usuario. Qwen-RobotNav puede funcionar como un módulo ejecutivo para sistemas de agentes más grandes, donde el modelo de alto nivel planifica la tarea y este modelo se encarga del desplazamiento.

Qwen-RobotManip: Maestro de la manipulación

El segundo modelo, Qwen-RobotManip, resuelve uno de los problemas clave de la robótica: la heterogeneidad del hardware. Diferentes robots (manipuladores, plataformas bimanuales, sistemas móviles) utilizan diferentes sistemas de coordenadas y formatos de comandos. Qwen-RobotManip intenta crear una representación unificada, permitiendo transferir habilidades entre distintos tipos de robots.

Para el entrenamiento se utilizaron más de 38 100 horas de datos, incluyendo 11 320 horas de datos robóticos abiertos, 1933 horas de vídeos de acciones humanas y 24 808 horas de demostraciones sintéticas. El modelo ya ha ocupado el primer lugar en RoboChallenge Table30 v1 y demuestra resistencia a nuevas instrucciones y objetos desconocidos.

Qwen-RobotWorld: Predictor del futuro

El tercer modelo, Qwen-RobotWorld, es un modelo de mundo en vídeo controlado por texto. Recibe la observación actual y una orden, y luego genera el estado futuro probable del entorno. Esto es críticamente importante para la planificación de acciones y la creación de datos sintéticos para el entrenamiento.

El corpus Embodied World Knowledge, con el que se entrenó el modelo, incluye 8,6 millones de pares «vídeo-texto» y más de 200 millones de fotogramas, que abarcan 20 tipos de robots y 500 categorías de acciones. Qwen-RobotWorld ya ha ocupado los primeros lugares en los benchmarks EWMBench y DreamGen Bench, y también ha superado a todos los modelos abiertos en WorldModelBench y PBench, demostrando un alto conocimiento de la física (movimiento, gravedad, fluidos).

Mi análisis: Qwen-Robot Suite es un paso estratégicamente acertado. Alibaba no intenta crear un robot de juguete, sino que construye una plataforma fundamental para el futuro. Sin embargo, aún queda mucho para su implementación masiva. Las condiciones reales están llenas de ruido, desgaste y situaciones atípicas que los simuladores no tienen en cuenta. No obstante, son precisamente estos «stacks» la clave para un futuro en el que la IA no solo hable, sino que actúe.