Começar gratuitamente

Kimi K3 Open Day: 2.8 biliões de parâmetros, agora com pesos abertos

Kimi K3 Open Day/2026-07-28/por Presentation Intelligence

Em 27 de julho de 2026, a Moonshot AI realizou o Kimi K3 Open Day e anunciou três lançamentos conectados: os pesos do modelo Kimi K3, o anúncio técnico oficial e três tecnologias de infraestrutura: MoonEP, FlashKDA e AgentEnv. O evento posicionou o Kimi K3 não apenas como um novo modelo de grande escala, mas também como um lançamento que abrange o acesso ao modelo, a arquitetura e a infraestrutura de implantação.

A especificação do título é clara: Kimi K3 é um modelo open-weight de 2,8 biliões de parâmetros construído sobre uma arquitetura de Mixture of Experts (MoE). A Moonshot AI revelou detalhes técnicos importantes, incluindo 896 especialistas, 16 especialistas ativados por token, uma janela de contexto de 1M tokens, KDA + AttnRes numa proporção de 3:1, MoonViT-V2 e um alegado ganho de eficiência de escala de 2,5x.

O termo open-weight é importante. Open-weight significa que os pesos do modelo treinado são disponibilizados sob termos definidos. Não quer automaticamente dizer que o modelo seja totalmente open-source, o que normalmente implica acesso mais amplo ao código-fonte, aos dados de treino, às ferramentas e a pipelines de reprodução. Ainda assim, o acesso open-weight pode mudar a forma como programadores e organizações implantam, inspecionam e constroem em torno de um grande modelo de IA.

57629b3fcbe5e09e2a8eed2d43379b68.png

A Moonshot AI resumiu o valor desta abordagem ao dizer que “modelos open-weight... reduzem a barreira para aceder à inteligência, impulsionam a inovação e dão aos utilizadores maior controlo sobre os dados, a privacidade e a titularidade.”


Evento Open Day: Três Lançamentos Centrais

O Kimi K3 Open Day centrou-se em três categorias de lançamentos.

Primeiro, a Moonshot AI lançou os pesos do modelo Kimi K3. Esta é a comunicação central sobre open-weight. Para quem constrói, o acesso aos pesos pode permitir uma implantação mais flexível do que uma API apenas hospedada, especialmente quando as equipas precisam de controlo sobre a infraestrutura, a latência, a privacidade ou a residência dos dados.

Segundo, a Moonshot AI publicou o relatório técnico do Kimi K3. Isto importa porque os anúncios de grandes modelos não podem ser avaliados apenas pela contagem de parâmetros. A arquitetura, a estratégia de routing, o design de longo contexto, a capacidade multimodal e as alegações de eficiência determinam se um modelo é útil na prática.

Terceiro, a Moonshot AI lançou MoonEP, FlashKDA e AgentEnv. Estas tecnologias de infraestrutura visam a comunicação entre especialistas, o desempenho de atenção e a execução de agentes. A sua inclusão mostra que o Kimi K3 Open Day não foi apenas um lançamento de modelo; foi também um lançamento de infraestrutura para usar de forma mais eficaz modelos muito grandes open-weight.


O Modelo: Especificações Principais

O Kimi K3 é um modelo MoE de 2,8 biliões de parâmetros. Numa arquitetura Mixture of Experts, apenas parte do modelo é ativada para cada token. Um router seleciona um subconjunto de especialistas, permitindo que o sistema combine uma capacidade total muito grande com computação ativa mais baixa do que um modelo denso de tamanho semelhante.

De acordo com a Moonshot AI, o Kimi K3 tem 896 especialistas, com 16 especialistas ativados por token. Este desenho é central para o perfil de eficiência do modelo. Ele permite ao modelo manter uma capacidade geral enorme enquanto usa ativação seletiva durante a inferência.

EspecificaçãoDetalhes Oficiais do Kimi K3
Parâmetros Totais2,8 biliões
ArquiteturaMixture of Experts (MoE)
Alocação de Especialistas896 especialistas / 16 ativados por token
Janela de Contexto1M tokens
Design de AtençãoKDA + AttnRes numa proporção de 3:1
Arquitetura de VisãoMoonViT-V2
Eficiência de EscalaMelhoria 2,5x

A janela de contexto de 1M tokens é uma das especificações mais práticas. Um contexto longo pode suportar análise de documento completo, revisão de grandes bases de código, raciocínio multi-ficheiro, fluxos de trabalho de documentos legais ou financeiros e tarefas mais longas de agentes, sem forçar cada entrada em pequenos fragmentos.

O Kimi K3 usa também KDA + AttnRes numa proporção de 3:1, um design híbrido de atenção ligado à sua estratégia de contexto longo. O modelo inclui MoonViT-V2 como arquitetura de visão, indicando capacidade multimodal nativa em vez de um sistema puramente de texto. A Moonshot AI também comunicou uma melhoria de eficiência de escala 2,5x, sugerindo que o Kimi K3 foi concebido não apenas para escalar, mas também para economias mais práticas de treino e inferência.


O Lançamento da Infraestrutura: MoonEP, FlashKDA e AgentEnv.

Os modelos com pesos abertos ainda precisam de sistemas robustos à sua volta. Grandes modelos MoE dependem de comunicação eficiente, kernels de atenção rápidos e ambientes de execução seguros. O lançamento de infraestrutura da Moonshot AI aborda diretamente estas necessidades.


MoonEP: Comunicação de Especialistas MoE

MoonEP é uma biblioteca de comunicação para paralelismo de especialistas MoE. Em sistemas MoE, os tokens são encaminhados para diferentes especialistas e esses especialistas podem estar distribuídos por múltiplos dispositivos. Isso cria desafios de comunicação que podem limitar a capacidade de processamento e aumentar a latência.

Para o Kimi K3, com 896 especialistas e 16 ativados por token, o encaminhamento de especialistas é um grande problema de sistema. O MoonEP foi concebido para melhorar a comunicação distribuída entre especialistas e reduzir os gargalos na implementação em larga escala de MoE.


FlashKDA: Atenção para Contexto Longo Mais Rápida

FlashKDA é um kernel de atenção otimizado para KDA. O seu papel é especialmente importante para cargas de trabalho de contexto longo, onde o cálculo de prefill pode tornar-se caro. A Moonshot AI informou que o FlashKDA proporciona um aumento de velocidade de 1,72x a 2,22x no desempenho de prefill em GPUs Nvidia H20, em comparação com benchmarks de flash-linear-attention.

Isto importa porque uma janela de contexto de 1M tokens só é útil se puder ser disponibilizada de forma eficiente. Kernels de atenção mais rápidos podem tornar análises de documentos longos, revisão de código, fluxos de trabalho de pesquisa e raciocínio multi-etapas mais práticos em ambiente de produção.


AgentEnv:用于 AI 代理的沙盒

AgentEnv 是一个与 KVCache.ai 联合共同开发的代理沙盒系统。它为需要执行步骤、测试操作、分叉状态、恢复先前状态或运行并行分支的代理提供隔离的沙盒环境

代理工作流往往不止涉及文本生成。它们可能会使用文件、工具、代码执行以及多步骤决策。沙盒有助于在支持实验的同时,将代理行为与外部系统进行隔离。AgentEnv 的快照、恢复和分叉功能在代理需要在产生最终结果之前探索多条路径时尤其有用。


为何“开权重”至关重要

开权重的访问方式改变了模型提供方与构建者之间的关系。封闭式托管 API 可能很强大,但基础设施、托管、数据流以及运营限制仍由提供方掌控。开权重模型则让合格团队在部署、适配、优化,并将模型集成到自身系统方面拥有更大的空间。

对企业而言,最大的优势是部署与数据控制。敏感文件、内部代码、法律记录、客户信息以及金融资料可能需要私有化基础设施。开权重的访问可支持本地或私有云部署,在这种情况下,数据治理、隐私与所有权是核心要求。

对开发者而言,开权重的访问能够实现更深层的技术集成。团队可以优化推理堆栈、测试适配方法,并围绕模型的优势构建工作流。Kimi K3 的 MoE 规模、1M-token 上下文能力、MoonViT-V2 的视觉能力,以及基础设施发布,能够为专门化应用奠定基础。

与开源之间的区别仍然至关重要。开权重并不自动提供训练数据、源代码管线或完整的复现方案。不过,它仍能降低需要模型访问、私有化部署或对性能与隐私有更多控制的团队所面临的实际门槛。


结论:模型与基础设施发布

Kimi K3 Open Day 最好理解为在三层之上的协同发布:模型访问技术披露以及部署基础设施2.8 万亿参数的 MoE 模型是本次公告的核心,但技术报告与基础设施工具对于理解其更广泛的意义至关重要。

官方规格十分扎实:总计 2.8T 参数每个 token 激活 16 个的 896 位专家1M-token 上下文窗口KDA + AttnRes 以 3:1 比例MoonViT-V2,以及据称2.5 倍的缩放效率提升。MoonEP、FlashKDA 和 AgentEnv 表明 Moonshot AI 也在着手解决能有效运行大规模开权重模型所需的系统问题。

Kimi K3 并没有被描述为完全开源;它是开权重。即便如此,通过发布权重、技术细节以及配套的基础设施,Moonshot AI 仍让 Kimi K3 成为大规模开权重 AI 开发领域的一件重要事件。


常见问题(FAQ)

问:什么是 Kimi K3?

答:Kimi K3 是来自 Moonshot AI 的一个 2.8 万亿参数开权重专家混合(Mixture of Experts, MoE)AI 模型,于 2026 年 7 月 27 日的 Kimi K3 Open Day 发布。


问:开权重是什么意思?

答:开权重意味着训练好的模型权重在指定许可条款下可获取。它不同于通常所指的开源——开源通常意味着对源代码、数据与复现管线有更广泛的访问。


问:随 Kimi K3 一起发布了哪些基础设施技术?

答:Moonshot AI 发布了 MoonEPFlashKDAAgentEnv。MoonEP 支持 MoE 通信,FlashKDA 加速 KDA 注意力(attention),而 AgentEnv 为 AI 代理提供了沙盒系统。


问:Kimi K3 最重要的规格有哪些?

A: A Kimi K3 tem 2,8T de parâmetros no total, 896 especialistas com 16 ativados por token, uma janela de contexto de 1M tokens, KDA + AttnRes numa proporção de 3:1, MoonViT-V2 e uma melhoria de eficiência de escalamento de 2,5x.


Transforme esta análise da Kimi K3 numa apresentação PPT polida com a Pi, tornando os desenvolvimentos complexos em IA claros e fáceis de apresentar.