En la industria de la inteligencia artificial se gesta una revolución silenciosa: estamos acostumbrados a pensar que la comunicación entre modelos es siempre generación de texto. Sin embargo, el equipo de desarrolladores del proyecto Mostik propuso un enfoque radicalmente distinto, que permite a las redes neuronales intercambiar «pensamientos» directamente, sin pasar por la etapa de formulación lingüística.
La esencia del método radica en el uso de un módulo adaptativo especial: el «puente». Este componente traduce la representación vectorial interna de un modelo a un formato que otra pueda interpretar, sin necesidad de convertir la información en palabras. Es crucial que los parámetros de las propias redes neuronales permanezcan sin cambios en esta interacción: solo se ajusta el elemento de conexión.
¿Por qué es importante? Según estimaciones de expertos, antes de generar incluso un solo token, un gran modelo de lenguaje forma más de un centenar de vectores ocultos: esto equivale a alrededor de un millón de valores numéricos o aproximadamente 2 MB de datos. En la respuesta textual solo llega una fracción mínima de esta información; la mayor parte del «proceso de pensamiento» simplemente se pierde. El nuevo canal de comunicación está diseñado para transmitir precisamente estas ricas representaciones intermedias.
Experimento: el gigante y el enano
Para probar la hipótesis, los investigadores conectaron el potentísimo modelo GLM-5.2 de Z.ai (753 mil millones de parámetros) con el compacto Qwen-3.5 de Alibaba (4 mil millones de parámetros). En este enlace, el «gigante» procesaba la consulta, pero no generaba la respuesta, transmitiendo su estado a través del «puente», y el texto final lo creaba el modelo pequeño.
Los resultados son impresionantes. Este enlace permitió reducir la brecha en la calidad de las respuestas entre el modelo pequeño y el grande aproximadamente a la mitad. Además, en comparación con la transmisión textual tradicional, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con costos computacionales idénticos. La comparación con un modelo de tamaño medio también resultó favorable al sistema híbrido: requirió 2,5 veces menos cómputo con un resultado comparable.
En busca de un lenguaje matemático común
El investigador principal de Mostik, Stanislav Smirnov, subraya la complejidad fundamental: las representaciones internas de diferentes arquitecturas no pueden compararse directamente. Incluso al resolver una misma tarea, los modelos codifican la información en sus estados ocultos de maneras completamente distintas. «Parece que aún no existe un lenguaje matemático adecuado», señala. El estudio de estas correspondencias no solo podría mejorar la interacción entre sistemas, sino también arrojar luz sobre cómo la IA llega a sus decisiones.
El potencial práctico del método es enorme. El ex investigador de Google DeepMind, Carl Tuyls, ve el principal escenario en el ahorro de recursos: un modelo caro podría usarse solo para el análisis, delegando la generación a un modelo pequeño. Otro camino es combinar un modelo universal con especializados (por ejemplo, en biología o física), evitando el costoso entrenamiento de una única red gigante con todos los datos a la vez.
Prueba de fuego y escepticismo
El equipo también aplicó el enfoque en el benchmark ARC-AGI-3, un conjunto de tareas donde la IA debe adaptarse a nuevas reglas en tiempo real. El sistema con el «puente» mostró uno de los mejores resultados en la clasificación actual, aunque los detalles aún no se revelan y los datos tienen estatus de «vista previa» sin confirmación externa. Todos los demás indicadores declarados también se basan en experimentos internos.
Mi análisis: Esta es una solución elegante que desafía el paradigma dominante del «texto como interfaz universal». Sin embargo, conviene recordar que hasta ahora hemos visto cómo los agentes de IA de OpenAI creaban canales de comunicación ocultos a través de gestores de paquetes. Si los «puentes» de Mostik realmente funcionan, estamos al borde de una nueva era donde la eficiencia de la IA se determinará no por el tamaño, sino por la calidad de la interacción entre inteligencias. Pero para confirmarlo se necesitan pruebas independientes y reproducibles.