Alibaba lleva la IA al mundo físico: presenta el conjunto de modelos Qwen-Robot Suite para el control de robots

El gigante tecnológico chino Alibaba ha logrado un avance estratégico al anunciar Qwen-Robot Suite, un conjunto integral de modelos de inteligencia artificial diseñados para controlar robots y resolver tareas en entornos físicos. No se trata de una simple actualización de un modelo de lenguaje, sino de un paso completo hacia la «IA encarnada» (embodied AI), donde los algoritmos aprenden a interactuar con el mundo real, no solo con texto e imágenes.
El paquete incluye tres modelos especializados. Qwen-RobotNav se encarga de la navegación, Qwen-RobotManip de la manipulación de objetos, y Qwen-RobotWorld es un modelo de video del mundo capaz de predecir la evolución de una escena basándose en comandos de texto. En Alibaba denominan directamente a este conjunto como «un stack completo para la inteligencia encarnada». Por el momento, las pruebas piloto se están llevando a cabo con clientes corporativos seleccionados de Alibaba Cloud en el ámbito de la robótica.
Por qué los modelos de lenguaje no son suficientes para los robots
El problema clave que resuelve Qwen-Robot Suite es la brecha entre la percepción digital y la acción física. Los LLM modernos manejan excelentemente textos, imágenes y videos, pero un robot no solo necesita entender una orden, sino traducirla en un movimiento preciso, teniendo en cuenta la fricción, la gravedad, las limitaciones de los sensores y las propiedades espaciales de los objetos. Alibaba denomina a este enfoque physical AI, subrayando que el modelo debe trabajar con lo «digital» y lo «físico» simultáneamente.
Qwen-RobotNav: un navegador universal basado en Qwen3-VL
El modelo unifica cinco tareas clave de navegación en un solo algoritmo: seguir instrucciones, moverse hacia un punto determinado, buscar objetos, rastrear un objetivo y conducción autónoma. Está construido sobre la arquitectura Qwen3-VL y entrenado con 15,6 millones de muestras relacionadas con la planificación de rutas y el razonamiento visual-lingüístico. Los resultados son impresionantes: un 76,5% de éxito en el benchmark VLN-CE RxR y un 90% en EVT-Bench. En escenarios prácticos, el robot puede encontrar un objeto perdido en una oficina o comprobar si una puerta está abierta en un edificio, recopilando pruebas visuales y devolviendo la respuesta al usuario.
Qwen-RobotManip: unificación de acciones físicas
Uno de los principales dolores de cabeza en robótica es la incompatibilidad de los formatos de comandos entre diferentes tipos de dispositivos. Un brazo manipulador, una plataforma bimanual y un robot móvil «hablan» diferentes idiomas de coordenadas y articulaciones. Qwen-RobotManip resuelve este problema llevando los datos a una representación común. Para el entrenamiento se utilizaron más de 38.100 horas de datos, incluyendo 11.320 horas de grabaciones robóticas abiertas y 24.808 horas de demostraciones sintéticas. El modelo ya ha ocupado el primer lugar en RoboChallenge Table30 v1, demostrando robustez frente a objetos desconocidos y transferencia de habilidades entre robots.
Qwen-RobotWorld: predicción de la física
Este modelo supone un verdadero avance en el ámbito de la simulación. Qwen-RobotWorld genera el estado futuro probable del entorno basándose en la observación actual y un comando de texto. Está entrenado con el corpus Embodied World Knowledge, que incluye 8,6 millones de pares «video-texto» y más de 200 millones de fotogramas, abarcando 20 tipos de plataformas robóticas. El modelo ocupó el primer lugar en EWMBench y DreamGen Bench, y superó a todos los análogos de código abierto en WorldModelBench. Es importante destacar que muestra una alta coherencia con las leyes físicas fundamentales: movimiento, conservación de la masa y gravedad.
Opinión de expertos
Alibaba ha hecho una apuesta poderosa, pero es importante entenderlo: Qwen-Robot Suite es, por ahora, un conjunto de herramientas para desarrolladores, no un producto de consumo listo para usar. Los escenarios de implementación real se enfrentan al ruido de los sensores, el desgaste de los actuadores y un sinfín de situaciones atípicas difíciles de modelar. Sin embargo, la unificación de la navegación, la manipulación y la predicción del mundo en un solo stack es precisamente lo que le faltaba a la industria para pasar de las demostraciones de laboratorio a los robots comerciales. Si Alibaba logra escalar esta tecnología y reducir la barrera de entrada para los desarrolladores, seremos testigos de un salto cualitativo en el desarrollo de la IA física.