Comienza gratis

Día Abierto de Kimi K3: 2.8 billones de parámetros, ahora con pesos abiertos

Día Abierto de Kimi K3/2026-07-28/por Presentation Intelligence

El 27 de julio de 2026, Moonshot AI celebró el Kimi K3 Open Day y anunció tres lanzamientos conectados: los pesos del modelo Kimi K3, el anuncio técnico oficial, y tres tecnologías de infraestructura: MoonEP, FlashKDA y AgentEnv. El evento posicionó al Kimi K3 no solo como un nuevo modelo a gran escala, sino también como un lanzamiento que abarca el acceso al modelo, la arquitectura y la infraestructura de despliegue.

La especificación principal es clara: Kimi K3 es un modelo open-weight de 2.8 billones de parámetros construido sobre una arquitectura Mixture of Experts (MoE). Moonshot AI dio a conocer detalles técnicos clave, incluidos 896 expertos, 16 expertos activados por token, una ventana de contexto de 1M de tokens, KDA + AttnRes en una proporción de 3:1, MoonViT-V2, y una mejora de eficiencia de 2.5x reportada.

El término open-weight importa. Open-weight significa que los pesos del modelo entrenado se ponen a disposición bajo términos definidos. No implica automáticamente que el modelo sea completamente de código abierto, algo que normalmente conlleva un acceso más amplio al código fuente, los datos de entrenamiento, las herramientas y los pipelines de reproducción. Aun así, el acceso open-weight puede cambiar la forma en que los desarrolladores y las organizaciones despliegan, inspeccionan y construyen en torno a un modelo importante de IA.

57629b3fcbe5e09e2a8eed2d43379b68.png

Moonshot AI resumió el valor de este enfoque al decir que los «modelos open-weight... reducen la barrera para acceder a la inteligencia, impulsan la innovación y brindan a los usuarios un mayor control sobre los datos, la privacidad y la propiedad».


El evento Open Day: tres lanzamientos principales

El Kimi K3 Open Day se centró en tres categorías de lanzamiento.

En primer lugar, Moonshot AI lanzó los pesos del modelo Kimi K3. Esta es la parte central del anuncio open-weight. Para quienes construyen, el acceso a los pesos puede permitir un despliegue más flexible que una API solo alojada, especialmente cuando los equipos necesitan controlar la infraestructura, la latencia, la privacidad o la residencia de datos.

En segundo lugar, Moonshot AI publicó el informe técnico de Kimi K3. Esto es importante porque los anuncios de modelos grandes no pueden evaluarse solo por el conteo de parámetros. La arquitectura, la estrategia de enrutamiento, el diseño de contexto largo, la capacidad multimodal y las afirmaciones sobre eficiencia determinan si un modelo es útil en la práctica.

En tercer lugar, Moonshot AI lanzó MoonEP, FlashKDA y AgentEnv. Estas tecnologías de infraestructura están orientadas a la comunicación entre expertos, el rendimiento de la atención y la ejecución de agentes. Su inclusión muestra que el Kimi K3 Open Day no fue solo un lanzamiento de modelo; también fue un lanzamiento de infraestructura para usar con más eficacia modelos open-weight muy grandes.


El modelo: especificaciones clave

Kimi K3 es un modelo MoE de 2.8 billones de parámetros. En una arquitectura Mixture of Experts, solo se activa una parte del modelo para cada token. Un enrutador selecciona un subconjunto de expertos, lo que permite al sistema combinar una capacidad total muy grande con menos cómputo activo que un modelo denso de tamaño similar.

Según Moonshot AI, Kimi K3 tiene 896 expertos, con 16 expertos activados por token. Este diseño es central en el perfil de eficiencia del modelo. Le permite mantener una capacidad global masiva mientras usa activación selectiva durante la inferencia.

EspecificaciónDetalle oficial de Kimi K3
Parámetros totales2.8 billones
ArquitecturaMixture of Experts (MoE)
Asignación de expertos896 expertos / 16 activados por token
Ventana de contexto1M tokens
Diseño de la atenciónKDA + AttnRes en una proporción 3:1
Arquitectura de visiónMoonViT-V2
Eficiencia de escaladoMejora de 2.5x

La ventana de contexto de 1M tokens es una de las especificaciones más prácticas. Un contexto largo puede respaldar análisis de documentos completos, revisión de grandes bases de código, razonamiento que involucre múltiples archivos, flujos de trabajo de documentos legales o financieros, y tareas de agentes más largas sin obligar a cada entrada a fragmentarse en porciones pequeñas.

Kimi K3 también utiliza KDA + AttnRes en una proporción 3:1, un diseño híbrido de atención vinculado a su estrategia de contexto largo. El modelo incluye MoonViT-V2 como arquitectura de visión, lo que indica una capacidad multimodal nativa y no un sistema puramente de texto. Moonshot AI también informó una mejora de eficiencia de escalado de 2.5x, lo que sugiere que Kimi K3 se diseñó no solo para escalar, sino también para lograr una economía de entrenamiento e inferencia más práctica.


La liberación de Infraestructura: MoonEP, FlashKDA y AgentEnv.

Los modelos de pesos abiertos aún necesitan sistemas sólidos a su alrededor. Los modelos grandes MoE dependen de una comunicación eficiente, kernels de atención rápidos y entornos de ejecución seguros. La liberación de infraestructura de Moonshot AI aborda estas necesidades directamente.


MoonEP: Comunicación de expertos MoE

MoonEP es una biblioteca de comunicación para el paralelismo de expertos MoE. En sistemas MoE, los tokens se enrutan hacia distintos expertos, y esos expertos pueden distribuirse en múltiples dispositivos. Esto crea desafíos de comunicación que pueden limitar el rendimiento e incrementar la latencia.

Para Kimi K3, con 896 expertos y 16 activados por token, el enrutamiento de expertos es un problema importante de sistemas. MoonEP está diseñado para mejorar la comunicación entre expertos distribuidos y reducir los cuellos de botella en implementaciones a gran escala de MoE.


FlashKDA: Atención para contexto largo más rápida

FlashKDA es un kernel de atención optimizado para KDA. Su papel es especialmente importante para cargas de trabajo de contexto largo, donde el cómputo de prefill puede volverse costoso. Moonshot AI informó que FlashKDA ofrece una aceleración de 1.72x a 2.22x en rendimiento de prefill en GPUs Nvidia H20 en comparación con los baselines de flash-linear-attention.

Esto importa porque una ventana de contexto de 1M tokens solo es útil si puede atenderse de manera eficiente. Los kernels de atención más rápidos pueden hacer que el análisis de documentos largos, la revisión de código, los flujos de trabajo de investigación y el razonamiento de múltiples pasos sean más viables en producción.


AgentEnv:面向 AI 代理的沙盒

AgentEnv 是一套与 KVCache.ai 联合开发的代理沙盒系统。它为需要执行步骤、测试操作、分叉状态、还原先前状态或运行并行分支的代理提供一个隔离的沙盒环境

代理工作流通常不仅涉及文本生成。它们可能会使用文件、工具、代码执行以及多步决策。沙盒有助于在支持实验的同时,将代理行为与外部系统隔离开来。当代理需要在产生最终结果之前探索多条路径时,AgentEnv 的快照、还原和分叉功能尤其有用。


为什么“开放权重”很重要

开放权重改变了模型提供商与构建者之间的关系。封闭的托管 API 当然可能很强大,但基础设施、托管、数据流以及运营限制仍由提供商掌控。开放权重模型则让具备条件的团队有更多空间来部署、适配、优化,并将模型集成到自己的系统中。

对企业而言,最大的优势是部署与数据控制。敏感文档、内部代码、法律记录、客户信息以及金融资料可能需要私有基础设施。开放权重的访问方式能够支持本地部署或私有云部署,其中 数据治理、隐私和所有权是核心要求。

对开发者而言,开放权重访问能够实现更深层的技术集成。团队可以优化推理栈、测试适配方法,并围绕模型的优势构建工作流。Kimi K3 的 MoE 规模、1M-token 上下文能力、MoonViT-V2 的视觉能力以及基础设施发布,为构建面向特定场景的应用奠定了基础。

与开源的区别仍然至关重要。开放权重并不会自动提供训练数据、源代码流水线或完整的复现方案。然而,它仍然可以为那些需要模型访问、私有部署或对性能与隐私拥有更多控制的团队,降低实际落地门槛。


结论:一次模型与基础设施的发布

Kimi K3 Open Day 最好理解为在三层内容上的协同式发布:模型访问技术披露以及部署基础设施2.8 万亿参数的 MoE 模型是公告的核心,但技术报告与基础设施工具对于理解其更广泛的意义至关重要。

官方规格内容很扎实:2.8T 总参数每个 token 激活 16 位专家、共 896 位专家1M-token 上下文窗口KDA + AttnRes 以 3:1 的比例MoonViT-V2,以及据称2.5x 的缩放效率提升。MoonEP、FlashKDA 和 AgentEnv 表明,Moonshot AI 也在着力解决让大型开放权重模型能够高效运行所需的系统问题。

Kimi K3 并未被描述为完全开源;它是开放权重。即便如此,通过发布权重、技术细节以及配套的基础设施,Moonshot AI 仍让 Kimi K3 成为大规模开放权重 AI 发展的一个重要事件。


常见问题解答(FAQ)

Q: Kimi K3 是什么?

A: Kimi K3 是来自 Moonshot AI 的一个 2.8 万亿参数开放权重 Mixture of Experts(MoE)AI 模型,于 2026 年 7 月 27 日在 Kimi K3 Open Day 上发布。


Q: “开放权重”是什么意思?

A: 开放权重意味着训练好的模型权重会在规定的许可条款下可获取。它不同于开源,后者通常意味着对源代码、数据以及复现流水线拥有更广泛的访问。


Q: Kimi K3 发布了哪些基础设施技术?

A: Moonshot AI 发布了 MoonEPFlashKDAAgentEnv。MoonEP 支持 MoE 通信,FlashKDA 加速 KDA 注意力,而 AgentEnv 提供一套用于 AI 代理的沙盒系统。


Q: 最重要的 Kimi K3 规格有哪些?

A: Kimi K3 tiene 2.8T de parámetros totales, 896 expertos con 16 activados por token, una ventana de contexto de 1M tokens, KDA + AttnRes en una proporción de 3:1, MoonViT-V2, y una mejora de eficiencia de escalado de 2.5x.


Convierte este análisis de Kimi K3 en una PPT pulida con Pi, haciendo que los avances complejos en IA sean claros y fáciles de presentar.