El paradigma clásico de interacción entre redes neuronales, en el que los modelos se comunican exclusivamente a través de texto generado, está quedando en el pasado. Mis colegas del equipo de investigación Mostik propusieron un enfoque radicalmente diferente: han aprendido a transmitir entre sistemas de IA no palabras, sino sus estados internos: esa información "cruda" que se forma en lo profundo de las redes neuronales antes de verbalizar una respuesta.
La esencia del método radica en el uso de un módulo adaptable especial, que yo llamaría un traductor de representaciones ocultas. Este "puente" transforma los vectores internos de un modelo en un formato comprensible para otro, mientras que los parámetros de las propias redes neuronales permanecen sin cambios y no se someten a un ajuste fino. Esta es una diferencia fundamental con respecto a las técnicas comunes de destilación o aprendizaje conjunto.
Brecha digital: por qué las palabras son un cuello de botella
Mis cálculos lo confirman: antes de generar un solo token, un modelo de lenguaje grande (LLM) forma más de un centenar de vectores ocultos, lo que equivale a aproximadamente un millón de valores numéricos o alrededor de 2 MB de datos. En la respuesta textual solo llega una fracción insignificante de esta riqueza informativa. El nuevo canal de comunicación está dirigido precisamente a transmitir estas representaciones intermedias, lo que abre el acceso a un flujo de datos mucho más denso y semánticamente enriquecido.

Experimento: el gigante piensa, el enano habla
Para verificar la hipótesis, el equipo llevó a cabo un experimento demostrativo, conectando dos extremos: el potente modelo GLM-5.2 de Z.ai con 753 mil millones de parámetros y el compacto Qwen-3.5 de Alibaba con 4 mil millones. El modelo grande actuó exclusivamente como "analista", procesando la consulta pero sin producir una respuesta. Su estado interno se transmitía a través del "puente" al modelo pequeño, que era quien formulaba el texto final.

Los resultados son impresionantes: esta combinación permitió reducir la brecha de calidad entre los modelos pequeño y grande aproximadamente a la mitad. En comparación con la transmisión textual tradicional, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con un volumen de cómputo idéntico. Además, el sistema híbrido, al demostrar resultados comparables a los de un modelo de tamaño medio, requirió aproximadamente 2,5 veces menos recursos computacionales.

En busca de un lenguaje matemático común
El investigador principal de Mostik, Stanislav Smirnov, señala acertadamente un problema fundamental: las representaciones internas de diferentes redes neuronales no se pueden comparar directamente. Incluso al resolver una tarea idéntica, dos modelos pueden codificar la información en sus estados ocultos de maneras completamente diferentes. "Parece que aún no existe un lenguaje matemático adecuado", subraya. Y este es el desafío clave: estudiar estas correspondencias no es solo una tarea de ingeniería, sino un camino hacia la comprensión de cómo diferentes sistemas de IA perciben el mundo y toman decisiones.
El valor práctico del enfoque es evidente para la industria. El ex investigador de Google DeepMind, Karl Tuyls, ve el escenario principal en la división del trabajo: un modelo con uso intensivo de recursos procesa la consulta, mientras que la generación de la respuesta la asume un modelo significativamente más pequeño. Vladimir Arustamyan, director técnico de Lovable, pronostica un aumento en la demanda de modelos altamente especializados: en lugar de crear un "soldado universal", los desarrolladores podrán combinar varios sistemas con diferentes competencias, por ejemplo, un modelo general de razonamiento con un modelo entrenado con datos de biología o física.
Verificación empírica y estado de "vista previa"
Cabe señalar que el equipo también aplicó su método en la prueba ARC-AGI-3, donde la IA debe adaptarse a nuevas reglas en modo interactivo. El sistema con el "puente" mostró uno de los mejores resultados en la clasificación actual; sin embargo, estos datos tienen el estado de "vista previa" y se basan en un conjunto incompleto de pruebas. Todos los indicadores de rendimiento declarados también se basan en experimentos internos del equipo y aún no han recibido una confirmación externa independiente.
Mi veredicto: este enfoque podría convertirse en la base de una nueva arquitectura de sistemas de IA distribuidos, donde la potencia computacional y la especialización sean modulares, no monolíticas. Sin embargo, antes de la implementación industrial, habrá que resolver la nada trivial tarea de estandarizar el "protocolo de intercambio de pensamientos" entre modelos heterogéneos. Después de todo, incluso los humanos necesitaron milenios de evolución del lenguaje para lograrlo.