En la industria de la inteligencia artificial se gesta una revolución silenciosa: los modelos aprenden a interactuar sin pasar por la barrera lingüística tradicional. No se trata de telepatía, sino de un intercambio matemáticamente preciso de estados internos que podría transformar radicalmente la economía computacional en los sistemas de IA.

El equipo de la plataforma de investigación Mostik ha desarrollado un enfoque que permite a las redes neuronales transmitirse entre sí no texto, sino representaciones vectoriales ocultas. En el acoplamiento clásico de varios LLM, el eslabón intermedio siempre es una respuesta generada, lo cual es lento y costoso en recursos. La nueva arquitectura utiliza un módulo adaptativo especial (un «puente») que traduce el «pensamiento» interno de un modelo a un formato comprensible para otro, mientras los parámetros de las propias redes neuronales permanecen sin cambios.

La idea clave es que, al generar un solo token, un gran modelo de lenguaje forma más de un centenar de vectores ocultos, alrededor de un millón de valores numéricos (aproximadamente 2 MB de datos). En la respuesta textual final solo llega una fracción mínima de esa información. El nuevo canal de comunicación se centra precisamente en transmitir estas ricas representaciones intermedias, lo que abre el acceso a un nivel mucho más profundo de «comprensión» de la tarea.

Prueba práctica: el gigante y el enano

Para demostrar la eficacia del método, el equipo combinó el potente modelo GLM-5.2 de Z.ai (753 mil millones de parámetros) con el compacto Qwen-3.5 de Alibaba (4 mil millones de parámetros). En el experimento, la red gigante solo analizaba la consulta sin generar una respuesta, y luego, a través del «puente», transmitía su estado al modelo pequeño, que era quien formaba el texto final.

Los resultados son impresionantes: este acoplamiento redujo la brecha de calidad en las respuestas entre el modelo pequeño y el grande aproximadamente a la mitad. Además, en comparación con la transmisión textual tradicional, el nuevo método mostró una ventaja de hasta 10 puntos porcentuales con costos computacionales idénticos. Es más, el sistema híbrido, comparable en resultados a un modelo de tamaño medio, requirió 2,5 veces menos cómputo, un indicador crítico para el escalado.

En busca de un lenguaje matemático común

El investigador principal de Mostik, Stanislav Smirnov, subraya la complejidad fundamental: las representaciones internas de diferentes redes neuronales no son directamente comparables; incluso al resolver tareas idénticas, codifican la información de manera distinta. Señala que aún no existe un lenguaje matemático adecuado para tal traducción, pero precisamente su búsqueda podría arrojar luz sobre cómo diferentes sistemas de IA perciben y procesan los datos.

El valor práctico del desarrollo es evidente para la industria. El exinvestigador de Google DeepMind, Karl Tuyls, ve potencial en el uso asimétrico de recursos: un modelo grande y costoso podría emplearse solo para analizar la consulta, mientras que la generación de la respuesta se delegaría a una red mucho más ligera. Otro escenario es la hibridación de modelos universales y altamente especializados, por ejemplo, combinar el razonamiento general con experiencia en biología o física sin necesidad de entrenar una única red monolítica con todos los datos a la vez.

Experimento en ARC-AGI-3 y perspectivas

Mostik también aplicó su enfoque en el benchmark ARC-AGI-3, donde la IA debe adaptarse a nuevas reglas en tiempo real. Según los desarrolladores, el sistema con «puente» muestra uno de los mejores resultados en la clasificación actual, aunque los detalles no se revelarán hasta que finalice la competencia. Es importante señalar que estos datos tienen estatus de «vista previa» y no son definitivos, mientras que los demás indicadores de rendimiento se basan en experimentos internos del equipo.

No obstante, el concepto en sí resuena con los recientes hallazgos de OpenAI sobre canales de comunicación ocultos entre agentes de IA, lo que confirma que la interacción directa a nivel de estados internos no es ciencia ficción, sino una dirección real y en rápido desarrollo.

Mi análisis: Este enfoque podría convertirse en un catalizador para la transición de modelos universales gigantes a sistemas modulares. Si la tecnología se confirma con pruebas independientes, veremos un cambio de paradigma: en lugar de la carrera por los parámetros, una composición inteligente de «cerebros» especializados, lo que reduciría significativamente la barrera de entrada para el desarrollo de soluciones complejas de IA.