En la industria de la inteligencia artificial se gesta un cambio silencioso pero significativo. Estamos acostumbrados a que la colaboración entre redes neuronales ocurra mediante la generación de texto intermedio — una especie de «traducción» de pensamientos al lenguaje humano para transmitirlos a otro algoritmo. Sin embargo, el equipo de desarrolladores bajo la marca Mostik propone un camino radicalmente distinto: el intercambio directo de estados internos, omitiendo la etapa verbal.

La esencia del método radica en el uso de un módulo adaptable especial, al que llamo «puente». Este transforma los vectores ocultos de un modelo en un formato comprensible para otro, mientras que los parámetros de las propias redes neuronales permanecen intactos. Esto es fundamentalmente importante: no reentrenamos los modelos, sino que solo creamos una capa intermedia para su interacción sin fisuras.

Cifras y experimentos: prueba con gigantes

Los desarrolladores afirman que al generar un solo token, un modelo de lenguaje grande forma más de un centenar de vectores ocultos — esto equivale a alrededor de un millón de valores numéricos o aproximadamente 2 MB de datos. En la respuesta textual solo llega una pequeña fracción de esta riqueza. Su canal de transmisión se centra precisamente en estas ricas representaciones internas.

La verificación empírica resulta impresionante. En la combinación del gigante GLM-5.2 de Z.ai (753 mil millones de parámetros) y el compacto Qwen-3.5 de Alibaba (4 mil millones de parámetros), el modelo grande procesaba la consulta, pero no generaba la respuesta. En su lugar, su estado interno se transmitía a través del «puente» al modelo pequeño, que era quien formaba el texto final. Este tándem, según afirman los autores, cerró aproximadamente la mitad de la brecha de calidad entre los modelos. Al compararlo con la transmisión clásica de texto, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con los mismos costos computacionales. Además, el sistema híbrido requirió aproximadamente 2,5 veces menos cálculos que un modelo de tamaño medio con un resultado comparable.

El principal problema: encontrar un «lenguaje» común

La dificultad clave, que los propios investigadores reconocen, es la ausencia de un espacio matemático unificado para diferentes arquitecturas. El investigador principal de Mostik, Stanislav Smirnov, señala con razón: «Parece que aún no existe un lenguaje matemático adecuado». Las codificaciones internas de información de diferentes redes pueden diferir radicalmente incluso al resolver tareas idénticas. Por eso el «puente» debe ser adaptable: aprende a traducir de un «dialecto» de estados ocultos a otro.

El valor práctico del enfoque es evidente: podemos usar un modelo pesado solo para el trabajo intelectual complejo, mientras que la generación de la respuesta se delega a uno ligero. Esto abre el camino hacia la creación de sistemas híbridos que combinen modelos universales y altamente especializados sin necesidad de entrenar a un monstruo con todos los datos a la vez.

Evaluación y escepticismo

A pesar de los intrigantes resultados en las pruebas ARC-AGI-3, donde el sistema mostró uno de los mejores resultados, conviene mantener un escepticismo saludable. Todos los indicadores declarados se basan en experimentos internos del equipo y aún no han recibido confirmación externa. No obstante, si el método se confirma, estamos al borde de un nuevo paradigma en la escalabilidad de la IA, donde la eficiencia no se logra aumentando parámetros, sino mediante una comunicación inteligente entre agentes especializados.

Mi veredicto: es un paso audaz y potencialmente innovador, pero aún lejos de la producción. La cuestión clave es con qué estabilidad funcionará el «puente» en arquitecturas y tareas heterogéneas fuera de las condiciones de laboratorio. Sigamos su evolución.