La startup china Moonshot AI ha anunciado oficialmente Kimi K3, el modelo de lenguaje abierto más grande hasta la fecha. Con 2,8 billones de parámetros declarados, visión nativa y una ventana de contexto de 1 millón de tokens, K3 aspira a ser la solución de código abierto más potente. Según las evaluaciones internas del equipo, en la clasificación general, la novedad solo es superada por los sistemas cerrados: Claude Fable 5 de Anthropic y GPT-5.6 Sol de OpenAI.

Innovaciones arquitectónicas y eficiencia

En el corazón de Kimi K3 se encuentra la nueva arquitectura Kimi Delta Attention (KDA) y el mecanismo Attention Residuals (AttnRes). KDA optimiza el procesamiento de secuencias largas de datos, mientras que AttnRes permite que el modelo extraiga selectivamente información críticamente importante de diferentes capas de la red, en lugar de procesarlo todo por igual. Esto garantiza una comprensión más profunda del contexto y la preservación del significado incluso al trabajar con textos complejos y confusos.

El elemento clave de la escalabilidad ha sido la arquitectura dispersa Stable LatentMoE. De los 896 expertos disponibles, solo se activan 16 para cada inferencia. Esta selectividad, combinada con nuevos datos y métodos de entrenamiento optimizados, ha permitido aumentar la eficiencia del modelo en 2,5 veces en comparación con la versión anterior, K2. Es notable que, durante nueve de los últimos doce meses, los modelos de la familia Kimi han mantenido el récord de tamaño entre todos los análogos abiertos.

Comparación con competidores: dónde K3 es más fuerte y dónde más débil

En varios benchmarks, K3 demuestra superioridad, superando incluso a competidores de renombre. En la prueba de resolución de problemas de ingeniería largos SWE Marathon, el modelo obtuvo 42 puntos frente a los 35 de Fable 5 y los 39 de Sol. En la tarea de investigación web BrowseComp, el resultado fue de 91,2 frente a 88 y 90,4 respectivamente. K3 también lidera en la prueba Program Bench (77,8 frente a 76,8 y 77,6) y muestra un resultado casi máximo en Terminal Bench 2.1 (88,3 puntos), superando a Sol por solo 0,5 puntos.

Sin embargo, en las pruebas FrontierSWE y HLE-Full (examen multidisciplinario complejo), K3 se queda atrás de Fable 5. Es importante señalar que la metodología de prueba varió: algunos modelos se ejecutaron a través de Claude Code, otros a través de Codex o el propio conjunto de herramientas KimiCode. Esto hace que la comparación directa no siempre sea correcta, pero el panorama general ya está claro: K3 es una herramienta extremadamente potente para tareas de agente.

Codificación, ingeniería y autonomía

K3 es capaz de realizar sesiones de ingeniería prolongadas con una mínima intervención humana. En la prueba de optimización de núcleos GPU, el modelo trabajó de forma autónoma hasta 24 horas, mostrando resultados al nivel de Fable 5 y superando significativamente a Opus 4.8, GPT-5.6 Sol y GPT-5.5. Mención especial merece la capacidad de K3 para escribir desde cero MiniTriton, un compilador compacto para núcleos GPU con su propia capa IR sobre MLIR.

También es impresionante la demostración de diseño de chips: K3 diseñó de forma autónoma un chip de red neuronal con su propia arquitectura. En 48 horas de trabajo autónomo, utilizando herramientas de código abierto, el modelo creó un diseño de chip de 4 mm² con una frecuencia de 100 MHz y un rendimiento de más de 8700 tokens por segundo en simulación.

Trabajo con conocimiento y multimodalidad

K3 demuestra una comprensión profunda de los datos científicos. En uno de los casos, el modelo reprodujo fórmulas complejas de astrofísica computacional en dos horas, mientras que a un investigador experimentado le habría llevado varias semanas. En otro ejemplo, K3 preparó un informe interactivo sobre la historia de 42 años de la industria ASIC, procesando más de 11 000 páginas de documentos.

Gracias al trabajo nativo con video, el modelo es capaz de editar clips, sincronizarlos con música y procesar audio. Esto abre nuevos horizontes para la automatización de procesos creativos.

Limitaciones y disponibilidad

El equipo de Moonshot AI admite honestamente que K3 es sensible a la pérdida del historial de razonamiento al cambiar el entorno del agente y puede mostrar una iniciativa excesiva en situaciones ambiguas. En términos de facilidad de uso, todavía está por detrás de los buques insignia Fable 5 y GPT-5.6 Sol.

El modelo ya está disponible en el sitio web de Kimi, en los servicios Kimi Work y Code, así como a través de API. Por defecto, el modo de razonamiento máximo está activado. Los pesos completos y el informe técnico se publicarán el 27 de julio.

Opinión de experto: El lanzamiento de Kimi K3 no es solo otro récord en la cantidad de parámetros. Es una demostración de que los modelos abiertos pueden competir con los gigantes cerrados al más alto nivel, especialmente en tareas de agente e ingeniería. Sin embargo, la brecha en la facilidad de uso y la sensibilidad al cambio de contexto recuerdan que el poder "en bruto" es solo una parte de la ecuación. La carrera por el liderazgo en IA apenas comienza, y estamos viendo cómo el sector abierto acelera el ritmo.