En la industria de la inteligencia artificial se gesta una revolución silenciosa: estamos acostumbrados a que la comunicación entre modelos siempre esté mediada por texto. Sin embargo, el equipo de desarrolladores bajo la marca Mostik propone un enfoque radicalmente distinto: la transmisión directa de los «pensamientos» de la red neuronal, sin pasar por la etapa de verbalización. En lugar de generar texto intermedio, se utiliza un módulo adaptativo especial que yo denomino «puente». Este convierte las representaciones vectoriales internas de un modelo en un formato comprensible para otro, mientras que los parámetros de los propios sistemas permanecen intactos.

Esto es un cambio fundamental. Al generar incluso un solo token, un gran modelo de lenguaje produce más de un centenar de vectores ocultos, alrededor de un millón de valores numéricos, lo que equivale a aproximadamente 2 MB de datos. En la respuesta textual solo llega una fracción insignificante de esta información. El nuevo canal está orientado a transmitir precisamente estos ricos estados intermedios.

Experimento: el gigante piensa, el enano habla

Para poner a prueba la hipótesis, los investigadores ensamblaron una combinación de GLM-5.2 de Z.ai (753 mil millones de parámetros) y Qwen-3.5 de Alibaba (4 mil millones de parámetros). El punto clave: el modelo grande procesaba la consulta, pero no generaba la respuesta. Su estado interno se transmitía a través del «puente» al modelo pequeño, que era quien formaba el texto final.

Los resultados son impresionantes. Esta combinación cubrió aproximadamente la mitad de la brecha de calidad entre el modelo pequeño y el gigante. En comparación con la transmisión textual clásica, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con costos computacionales idénticos. Además, un sistema híbrido, comparable en calidad a un modelo medio, requirió aproximadamente 2,5 veces menos cómputo.

En busca de un lenguaje matemático común

El investigador principal de Mostik, Stanislav Smirnov, señala con razón un problema fundamental: las representaciones internas de diferentes redes neuronales no son directamente comparables. Incluso al resolver una misma tarea, los modelos codifican la información en sus estados ocultos de maneras distintas. «Parece que aún no existe un lenguaje matemático adecuado», constata. Esto abre un nuevo campo de investigación: estudiar las correspondencias entre espacios latentes podría arrojar luz sobre cómo la IA representa el conocimiento y toma decisiones.

El valor práctico del enfoque es evidente. El exinvestigador de Google DeepMind, Karl Tuyls, vislumbra un escenario donde un modelo de alto consumo se utiliza solo para «pensar», mientras que la generación de texto se delega a un sistema compacto. Otro camino es la simbiosis de un modelo universal con especializados (biología, física), lo que evita la necesidad de entrenar sistemas monolíticos con todos los datos a la vez.

Aspirando al liderazgo en ARC-AGI-3

Los desarrolladores aplicaron el método en el exigente benchmark ARC-AGI-3, donde la IA debe adaptarse a nuevas reglas en tiempo real. El sistema con «puente» mostró uno de los mejores resultados en la clasificación actual, aunque los detalles aún no se revelan, ya que la competición continúa. No obstante, estos datos deben tomarse con cautela: el estado de «vista previa» implica un conjunto de pruebas incompleto, y el resto de las métricas se basan en experimentos internos del equipo.

Mi análisis: Esta es una solución elegante a un problema largamente esperado. La economía de la IA choca con el costo de la inferencia, y la posibilidad de «dividir el trabajo» entre modelos no es solo una optimización, sino un paso hacia una arquitectura modular de la inteligencia. Sin embargo, el camino desde la demostración hasta la implementación industrial es largo: aún debemos aprender a construir «puentes» universales entre cualquier arquitectura, y no solo entre pares específicos.