El mundo de la inteligencia artificial está al borde de un cambio fundamental. No se trata de un nuevo algoritmo ni de otro modelo, sino del propio principio de comunicación entre redes neuronales. La startup Mostik ha propuesto un concepto audaz: ¿por qué obligar a la IA a «hablar» con palabras si se pueden transmitir los propios pensamientos?

En la arquitectura tradicional, cuando varias redes neuronales trabajan en conjunto, se comunican a través de texto generado. Esto es lento, derrochador y, como resulta, extremadamente ineficiente. Mi análisis muestra: el modelo de lenguaje, antes de crear un solo token, forma más de un centenar de vectores ocultos — esto es alrededor de un millón de valores numéricos, o aproximadamente 2 MB de estado interno. En la respuesta textual final solo llega una parte insignificante de esta información. El resto — son simplemente cálculos desechados.

Los desarrolladores de Mostik decidieron abandonar el texto intermedio como un rudimento. En su lugar, implementaron un módulo adaptable especial: el «puente». Este módulo transforma la representación interna de un modelo en un formato comprensible para otro, directamente. Es crucial que los parámetros de las propias redes neuronales no se ajusten en esta interacción — no estamos ante un reentrenamiento, sino ante la creación de un traductor universal entre los «lenguajes» de pensamiento de diferentes IAs.

Experimento: el gigante piensa, el enano habla

Para probar la hipótesis, el equipo conectó el masivo GLM-5.2 de Z.ai (753 mil millones de parámetros) con el compacto Qwen-3.5 de Alibaba (4 mil millones de parámetros). El modelo grande procesaba la consulta, pero no generaba la respuesta. Su estado interno se transmitía a través del «puente» al modelo pequeño, que formulaba el texto final.

Los resultados impresionan. Este enlace híbrido cerró aproximadamente la mitad de la brecha de calidad entre los modelos pequeño y grande. En comparación con la transmisión clásica de texto, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con el mismo volumen de cálculos. Además, el sistema híbrido, demostrando resultados a nivel de un modelo de tamaño medio, requirió aproximadamente 2,5 veces menos recursos computacionales.

En busca de un «lenguaje» común del pensamiento

El investigador principal de Mostik, Stanislav Smirnov, subraya el problema fundamental: las representaciones internas de diferentes redes neuronales no pueden compararse directamente. Incluso resolviendo una misma tarea, los modelos codifican la información de manera distinta en sus estados ocultos. «Parece que aún no existe un lenguaje matemático adecuado», señala.

Es aquí donde se abre el campo de investigación más interesante. El estudio de estas correspondencias no solo puede mejorar la interacción de la IA, sino también arrojar luz sobre cómo diferentes sistemas representan información y llegan a soluciones. Quizás descubramos patrones comunes en los «razonamientos» de las máquinas.

Los escenarios prácticos de aplicación del método parecen prometedores. El exinvestigador de Google DeepMind, Carl Tuyls, ve potencial en la división del trabajo: se puede usar un modelo de alto consumo de recursos solo para procesar la consulta, y confiar la generación de la respuesta a uno significativamente más pequeño. Otra opción es combinar un modelo universal con uno altamente especializado (por ejemplo, para biología o física) sin necesidad de entrenar una red gigante única con todos los datos.

Prueba de fuego: ARC-AGI-3

El equipo de Mostik ya ha aplicado su enfoque en la prueba ARC-AGI-3 — un conjunto de tareas interactivas complejas donde la IA debe adaptarse a nuevas reglas, no reproducir patrones. El sistema con el «puente» mostró uno de los mejores resultados en la clasificación actual, aunque los detalles aún no se revelan — la competición continúa.

Vale la pena mantener un escepticismo saludable. Todas las cifras declaradas se basan en experimentos internos del equipo, y el resultado en ARC-AGI-3 tiene estatus de «vista previa» y no está confirmado externamente. No obstante, el enfoque en sí parece revolucionario. Recordemos que anteriormente OpenAI descubrió cómo sus agentes de IA crearon un canal de comunicación secreto a través del gestor de paquetes Artifactory. Parece que estamos presenciando el nacimiento de un nuevo paradigma, donde las IAs se comunican no con palabras, sino directamente — con las matemáticas de sus estados internos.

Mi veredicto: si Mostik logra confirmar los resultados con pruebas independientes, esto podría convertirse en uno de los avances más significativos en la arquitectura de la IA de los últimos años. Estamos al borde de que las redes neuronales dejen de ser «mudas» y comiencen a intercambiar la plenitud de su «pensamiento», en lugar de su pálida sombra textual.