La startup china de IA Moonshot AI ha logrado un avance significativo al presentar Kimi K3, el modelo abierto más grande de la clase 3T hasta la fecha. Con 2,8 billones de parámetros, visión nativa y una ventana de contexto de 1 millón de tokens, este sistema ingresa con confianza en la élite de la IA mundial, superando, según datos del propio desarrollador, solo a los gigantes propietarios Claude Fable 5 y GPT 5.6 Sol.
La base arquitectónica de K3 es la innovadora Kimi Delta Attention (KDA) y el mecanismo Attention Residuals (AttnRes). KDA optimiza el procesamiento de secuencias largas de datos, mientras que AttnRes permite al modelo extraer selectivamente información críticamente importante sin procesar todas las capas por igual. El resultado es una comprensión más profunda del contexto y la preservación del significado incluso al trabajar con textos complejos. La dispersión computacional está garantizada por el framework Stable LatentMoE: de 896 expertos, solo 16 están activos simultáneamente, lo que, combinado con nuevos datos y metodologías de entrenamiento, ha dado un aumento de eficiencia de 2,5 veces en comparación con su predecesora Kimi K2.
Benchmarks: dónde brilla K3 y dónde se queda atrás
Los resultados de las pruebas de K3 son mixtos. El modelo muestra un rendimiento excepcional en tareas que requieren sesiones de ingeniería prolongadas y un comportamiento agente complejo. En SWE Marathon obtuvo 42 puntos, superando a Fable 5 (35) y GPT-5.6 Sol (39). En la prueba BrowseComp (91,2) y Program Bench (77,8) también se situó por delante. En Terminal Bench 2.1, el resultado de 88,3 puntos es solo 0,5 puntos inferior a Sol (88,8) y supera significativamente a Fable 5 (84,6).
Sin embargo, en los benchmarks que evalúan el conocimiento científico profundo, K3 se queda atrás. En FrontierSWE obtuvo 81,2 frente a 86,6 de Fable 5, y en HLE-Full, 43,5 frente a 53,3. Es importante señalar que las metodologías de prueba diferían, y esto podría haber afectado las cifras finales.
Codificación, chips y creatividad: casos prácticos
K3 es capaz de realizar sesiones de ingeniería prolongadas de forma autónoma, navegar por repositorios enormes y gestionar herramientas de terminal. En una de las pruebas, el modelo se dedicó durante 24 horas a la optimización de núcleos GPU, mostrando un resultado al nivel de Fable 5. Además, una versión temprana de K3 escribió de forma independiente MiniTriton, un compilador compacto para núcleos GPU.
Los casos de demostración son impresionantes: K3 diseñó un chip para una red neuronal en su propia arquitectura en 48 horas, utilizando herramientas de código abierto. El chip resultante, con un área de 4 mm², produce más de 8700 tokens por segundo. El modelo también es capaz de crear prototipos de juegos, editar videos y realizar análisis científicos complejos, reproduciendo, por ejemplo, relaciones universales de la astrofísica computacional en dos horas en lugar de dos semanas de trabajo de un investigador.
Comentario analítico de Cryptalist: Kimi K3 es sin duda un paso adelante para los modelos abiertos. Sin embargo, la brecha con los líderes propietarios en tareas que requieren conocimiento profundo y una usabilidad impecable aún es notable. Es destacable que Moonshot AI apuesta por la autonomía en tareas de ingeniería, lo que podría convertirse en su principal baza en el nicho del desarrollo de software. Pero para el usuario masivo, K3 sigue siendo, aunque potente, una herramienta de nicho.