Crypto news

17.06.2026
10:32

Alibaba lleva la IA al mundo físico: presenta el conjunto de modelos Qwen-Robot Suite para el control de robots

Tool_AI

Alibaba presentó oficialmente Qwen-Robot Suite, un conjunto integral de modelos fundamentales de IA diseñados para resolver tareas en entornos físicos. El paquete incluye tres modelos especializados: Qwen-RobotNav para navegación, Qwen-RobotManip para manipulación de objetos y Qwen-RobotWorld para predicción del desarrollo de escenas. Los desarrolladores posicionan este proyecto como un "stack completo para inteligencia artificial encarnada" (embodied AI). Se trata de modelos de software que permiten a agentes físicos —robots— percibir el espacio circundante, planificar acciones y ejecutar comandos dados en lenguaje natural. Por el momento, Qwen-Robot Suite está realizando pruebas piloto con clientes corporativos seleccionados de Alibaba Cloud en el ámbito de la robótica.

Por qué Alibaba lleva Qwen al mundo físico

Los modelos modernos de lenguaje grande y multimodales manejan brillantemente texto, imágenes y video, pero para los robots esto es categóricamente insuficiente. Los agentes físicos no solo necesitan entender un comando, sino también transformarlo en un movimiento preciso, teniendo en cuenta limitaciones espaciales, propiedades de objetos, ruido de sensores y las consecuencias de cada acción. Alibaba denomina a esto dirección de physical AI, o "IA encarnada", donde el modelo opera no solo con datos digitales, sino también con el entorno físico real.

Qwen-RobotNav: cinco tareas de navegación en un solo modelo

El modelo Qwen-RobotNav, construido sobre la base de Qwen3-VL y entrenado con 15,6 millones de muestras, integra cinco tareas clave de navegación: seguir instrucciones, moverse hacia un punto dado, buscar objetos, rastrear objetivos y conducción autónoma. Los resultados son impresionantes: 76,5% de éxito en el benchmark VLN-CE RxR y 90% en EVT-Bench. Una característica clave es que el modelo puede actuar como herramienta ejecutiva para sistemas de agentes más grandes, donde un modelo de alto nivel planifica la tarea y Qwen-RobotNav se encarga del desplazamiento físico. Las demostraciones muestran escenarios de búsqueda de un objeto perdido en una habitación o verificación del estado de un objeto específico, donde el robot no solo se mueve, sino que recopila pruebas visuales.

Qwen-RobotManip: acciones con objetos y transferencia de habilidades

Qwen-RobotManip resuelve uno de los problemas fundamentales de la robótica: la incompatibilidad de formatos de comandos entre diferentes tipos de dispositivos (manipulador, plataforma bimanual, sistema móvil). El modelo unifica los datos en una representación común, permitiendo transferir habilidades adquiridas en un tipo de robot a otro. Para el entrenamiento se utilizaron más de 38 100 horas de datos, incluyendo 11 320 horas de datos robóticos abiertos, 1933 horas de video de acciones humanas y 24 808 horas de demostraciones sintéticas. El modelo ocupó el primer lugar en RoboChallenge Table30 v1 y demostró robustez frente a nuevas instrucciones y objetos desconocidos.

Qwen-RobotWorld: modelo de mundo en video para predicción

Qwen-RobotWorld es un modelo de mundo en video controlado por lenguaje natural. Al recibir la observación actual y un comando textual, genera un estado futuro probable del entorno. El corpus Embodied World Knowledge, recopilado para el entrenamiento, incluye 8,6 millones de pares "video-texto" y más de 200 millones de fotogramas, abarcando 20 tipos de plataformas robóticas y 500 categorías de acciones. El modelo ocupó los primeros lugares en EWMBench y DreamGen Bench, superando a todos los análogos abiertos en WorldModelBench y PBench. Los desarrolladores afirman que el modelo muestra una alta coherencia con las leyes físicas básicas: movimiento, conservación de masa y gravedad.

Falta mucho para los robots masivos

A pesar de los impresionantes indicadores declarados, Qwen-Robot Suite sigue siendo un conjunto de modelos de investigación, no una plataforma de consumo lista para usar. La implementación real se enfrenta al ruido de los sensores, el desgaste de los actuadores y una enorme cantidad de escenarios raros que no se pueden simular en benchmarks. Alibaba aún no ha revelado el costo de acceso, las fechas de lanzamiento público ni la lista específica de clientes que están probando el sistema.

Opinión de experto: Alibaba da un paso estratégicamente correcto al unificar navegación, manipulación y predicción en un solo stack. Sin embargo, el mercado ha visto muchas plataformas robóticas prometedoras que nunca salieron de los laboratorios. El factor clave del éxito no será tanto la precisión en los benchmarks, sino la capacidad de los modelos para adaptarse al caos real del mundo físico. Por ahora, es una señal fuerte para la industria, pero no una revolución.