免费开始

Kimi K3 开放日:2.8 万亿参数现已开放权重

Kimi K3 开放日/2026-07-28/作者:Presentation Intelligence

2026年7月27日,Moonshot AI举办Kimi K3开放日,并宣布了三个互相关联的发布:Kimi K3模型权重、官方技术公告,以及三项基础设施技术:MoonEPFlashKDAAgentEnv。该活动将Kimi K3不仅定位为一个新的大规模模型,也定位为一次覆盖模型访问、架构与部署基础设施的发布。

一眼就能看懂的关键信息是:Kimi K3是一款2800亿参数的开权重模型,基于专家混合(Mixture of Experts,MoE)架构构建。Moonshot AI披露了多项关键技术细节,包括896个专家每个token激活16个专家100万token上下文窗口KDA + AttnRes的3:1比例MoonViT-V2以及据称2.5倍的扩展效率提升

“开权重”这个术语很重要。开权重意味着训练后的模型权重会在明确的条款下提供。它并不自动等同于模型完全开源,而开源通常意味着更广泛地获取源代码、训练数据、工具以及可复现的流程。尽管如此,开权重的获取方式仍可能改变开发者和组织部署、审查以及围绕一个重要AI模型进行构建的方式。

57629b3fcbe5e09e2a8eed2d43379b68.png

Moonshot AI总结了这种做法的价值,表示:“开权重模型……降低了获取智能的门槛,推动创新,并让用户对数据、隐私和所有权拥有更大的控制力。”


开放日活动:三项核心发布

Kimi K3开放日聚焦于三类发布。

首先,Moonshot AI发布了Kimi K3模型权重。这是核心的开权重公告。对构建者而言,获取权重可以让部署更灵活,而不仅仅依赖托管式API,尤其是当团队需要对基础设施、延迟、隐私或数据驻留进行控制时。

其次,Moonshot AI发布了Kimi K3技术报告。这一点很重要,因为大型模型的公告不能仅凭参数数量来评估。架构、路由策略、长上下文设计、多模态能力以及效率相关的声称,决定了该模型在实际中是否真正有用。

第三,Moonshot AI发布了MoonEPFlashKDA以及AgentEnv。这些基础设施技术面向专家通信、注意力性能与智能体执行。它们的加入表明,Kimi K3开放日不仅是一次模型发布;也是一次基础设施发布,旨在更有效地使用非常大的开权重模型。


模型:关键规格

Kimi K3是一个2800亿参数的MoE模型。在专家混合架构中,每个token只会激活模型的一部分。路由器会选择一组专家子集,使系统能够在总容量极大的同时,相比类似规模的稠密模型使用更低的实际计算量。

据Moonshot AI称,Kimi K3拥有896个专家,并且每个token激活16个专家。这种设计是模型效率画像的核心。它让模型在整体保持大规模容量的同时,在推理过程中采用选择性激活。

规格Kimi K3官方详情
总参数2800亿
架构专家混合(MoE)
专家分配896 名专家 / 每个 token 激活 16 个
上下文窗口100 万 tokens
注意力设计KDA + AttnRes,3:1 比例
视觉架构MoonViT-V2
扩展效率提升 2.5 倍

100 万 token 的上下文窗口”是最实用的规格之一。长上下文可以支持整份文档分析、大型代码库审查、多文件推理、法律或金融文档工作流,以及更长的智能体任务,而无需将每个输入都强行拆成小片段。

Kimi K3 同样采用了“KDA + AttnRes,3:1 比例”的设计,这是一种与其长上下文策略绑定的混合注意力方案。该模型还将 MoonViT-V2 作为其视觉架构,表明其具备原生多模态能力,而不是纯文本系统。Moonshot AI 也报告了“2.5 倍的扩展效率提升”,这意味着 Kimi K3 的设计不仅面向规模化,也兼顾更实际的训练与推理成本经济性。


Infra 发布:MoonEPFlashKDAAgentEnv

开源权重模型仍需要强大的配套系统。大型 MoE 模型依赖高效的通信、快速注意力算子 以及安全的执行环境。Moonshot AI 的基础设施发布直接满足了这些需求。


MoonEP:MoE 专家通信

MoonEP 是用于 MoE 专家并行的通信库。在 MoE 系统中,tokens 会被路由到不同的专家,而这些专家可能分布在多台设备上。这带来了通信方面的挑战,可能会限制吞吐量并增加延迟。

对于 Kimi K3 来说,896 个专家且每个 token 激活 16 个,专家路由是一个重大的系统性问题。MoonEP 的设计目标是提升分布式专家通信,并减少大规模 MoE 部署中的瓶颈。


FlashKDA:更快的长上下文注意力

FlashKDA 是针对 KDA 优化的注意力算子。它在长上下文负载场景中尤其重要,因为预填充(prefill)计算可能会变得十分昂贵。Moonshot AI 报告称,与 flash-linear-attention 基线相比,FlashKDA 在 Nvidia H20 GPU 上的预填充性能实现了“1.72x 到 2.22x 的加速”。

这很关键,因为只有在能够被高效提供服务的前提下,100 万 token 的上下文窗口才真正有用。更快的注意力算子可以让长文档分析、代码审查、研究工作流以及多步骤推理在生产环境中变得更可行。


AgentEnv:AI智能体的沙盒

AgentEnv 是一个智能体沙盒系统,由 KVCache.ai 共同开发。它为需要执行步骤、测试操作、分叉状态、恢复先前状态或运行并行分支的智能体提供隔离的沙盒环境

智能体工作流往往不止涉及文本生成。它们可能会使用文件、工具、代码执行以及多步骤的决策。沙盒有助于在支持实验的同时,将智能体行为与外部系统进行隔离。AgentEnv 的快照、恢复和分叉功能在智能体需要在产生最终结果之前探索多种路径时特别有用。


为什么开放权重很重要

开放权重改变了模型提供方与构建者之间的关系。封闭的托管 API 可能很强大,但基础设施、托管、数据流以及运营限制仍由提供方掌控。开放权重模型则让具备资质的团队拥有更多空间来部署、改造、优化,并将模型集成到他们自己的系统中。

对企业而言,最大的优势是部署与数据控制。敏感文档、内部代码、法律记录、客户信息以及金融材料可能需要私有基础设施。开放权重访问可以支持本地部署或私有云部署,让数据治理、隐私和所有权成为核心要求。

对开发者而言,开放权重访问使更深入的技术集成成为可能。团队可以优化推理栈、测试适配方法,并围绕模型的优势构建工作流。Kimi K3 的 MoE 规模、1M-token 上下文、MoonViT-V2 的视觉能力以及基础设施发布,为面向专门应用的落地打下了基础。

与开源之间的差别依然至关重要。开放权重并不会自动提供训练数据、源代码流水线或完整的复现方案。不过,它仍然可以降低团队在需要模型访问、私有部署或对性能与隐私拥有更多控制时的实际门槛。


结论:模型与基础设施的发布

Kimi K3 Open Day 最好理解为在三个层面上的协同发布:模型访问技术披露以及部署基础设施2.8 万亿参数的 MoE 模型是公告的核心,但技术报告与基础设施工具同样是理解其更广泛意义的关键。

官方规格十分扎实:2.8T 总参数每个 token 激活 16 个专家中的 896 位专家1M-token 上下文窗口KDA + AttnRes 按 3:1 比例MoonViT-V2,以及据称2.5x 的缩放效率提升。MoonEP、FlashKDA 和 AgentEnv 表明,Moonshot AI 也在解决有效运行大型开放权重模型所需的系统问题。

Kimi K3 并非被描述为完全开源;它是开放权重。即便如此,通过发布权重、技术细节以及配套基础设施,Moonshot AI 仍然让 Kimi K3 成为大规模开放权重 AI 开发中的一件重要事件。


常见问题(FAQ)

Q:Kimi K3 是什么?

A:Kimi K3 是来自 Moonshot AI 的一个 2.8 万亿参数开放权重专家混合(MoE)AI 模型,于 2026 年 7 月 27 日在 Kimi K3 Open Day 上发布。


Q:开放权重是什么意思?

A:开放权重表示训练后的模型权重在特定许可条款下可获取。它不同于开源,开源通常意味着对源代码、数据以及复现流水线的更广泛访问。


Q:Kimi K3 配套发布了哪些基础设施技术?

A:Moonshot AI 发布了 MoonEPFlashKDAAgentEnv。MoonEP 支持 MoE 通信,FlashKDA 加速 KDA 注意力,而 AgentEnv 为 AI 智能体提供了沙盒系统。


Q:Kimi K3 最重要的规格是什么?

A:Kimi K3 总参数量为 2.8T,拥有 896 个专家,每个 token 激活 16 个;上下文窗口为 1M token;KDA 与 AttnRes 的比例为 3:1;MoonViT-V2;并在可扩展性效率方面实现了 2.5 倍的提升。


将这份 Kimi K3 分析整理成一份精美的 PPT,并配合 Pi,让复杂的 AI 进展更清晰、更便于展示。