Alibaba lleva Qwen al mundo físico: presenta un conjunto de modelos de IA para controlar robots

El gigante tecnológico chino Alibaba ha dado un paso importante hacia el llamado "inteligencia artificial encarnada" (Embodied AI) al presentar Qwen-Robot Suite. No se trata simplemente de otro modelo de lenguaje, sino de una pila de software completa compuesta por tres modelos fundamentales especializados, diseñados para dotar a los robots de la capacidad de percibir, planificar y actuar en el mundo físico. Hablamos de Qwen-RobotNav para navegación, Qwen-RobotManip para manipulación de objetos y Qwen-RobotWorld, un modelo del mundo que predice las consecuencias de las acciones.
La diferencia clave de este enfoque respecto a los LLM tradicionales es que para los agentes físicos no basta con comprender texto o imágenes. Necesitan transformar una orden en lenguaje natural en movimientos precisos, teniendo en cuenta el espacio tridimensional, la física de los objetos y las limitaciones de sus propios sensores. Alibaba Cloud ya ha iniciado pruebas piloto de este conjunto con clientes corporativos del sector robótico.
Qwen-RobotNav: navegador universal
El modelo Qwen-RobotNav, construido sobre la base de Qwen3-VL, resuelve cinco tareas clave de navegación dentro de una misma arquitectura: seguir instrucciones, desplazarse hacia un objetivo, buscar objetos, rastrear un objetivo y conducción autónoma. Entrenado con 15,6 millones de muestras, demuestra resultados impresionantes: un 76,5% de éxito en el benchmark VLN-CE RxR y un 90% en EVT-Bench. En esencia, es el "cerebro" para el desplazamiento, que puede integrarse en sistemas de agentes más grandes, donde un modelo de alto nivel plantea la tarea y Qwen-RobotNav se encarga de su ejecución física.
Qwen-RobotManip: maestría en la interacción
El segundo modelo, Qwen-RobotManip, se centra en la interacción física con objetos: agarrar, mover y colocar. La principal innovación aquí es el intento de resolver el problema de la incompatibilidad de datos entre diferentes tipos de robots (manipuladores, plataformas bimanuales, sistemas móviles). El modelo aprende de un enorme conjunto de datos que supera las 38.100 horas, incluyendo vídeos de acciones humanas en primera persona. El resultado es el primer puesto en la pista de modelos universales RoboChallenge Table30 v1 y, lo que es más importante, robustez ante nuevas instrucciones y transferencia de habilidades entre distintas plataformas robóticas.
Qwen-RobotWorld: predicción del futuro
Qwen-RobotWorld es un modelo de mundo en vídeo guiado por texto. Recibe la observación actual y una orden, y luego genera un vídeo probable de cómo cambiará el entorno. Esto es fundamental para planificar acciones complejas y crear datos sintéticos para el entrenamiento. El corpus Embodied World Knowledge, con el que se entrenó el modelo, incluye 8,6 millones de pares "vídeo-texto" y abarca más de 500 categorías de acciones. El modelo ya ha ocupado los primeros puestos en los benchmarks EWMBench y DreamGen Bench y, según los desarrolladores, muestra una alta coherencia con las leyes físicas básicas.
Comentario analítico: Sin duda, Qwen-Robot Suite es una potente declaración de intenciones para liderar el segmento de la IA Física. Sin embargo, no hay que dejarse engañar: la distancia entre los benchmarks de laboratorio y el trabajo real en un almacén o en un hogar es enorme. El ruido de los sensores, el desgaste mecánico y millones de escenarios poco comunes siguen siendo obstáculos importantes. Alibaba aún no ha revelado ni el coste de acceso ni los plazos de lanzamiento público, lo que indica que aún queda mucho para la implementación masiva de robots "inteligentes" basados en Qwen. No obstante, el mero hecho de que uno de los mayores proveedores de nube del mundo presente una "pila" de este tipo marca un nuevo vector de desarrollo para toda la industria.