免费开始

Kimi K3 开放日:2.8 万亿参数模型现已开放权重

Kimi K3 开放日/2026-07-28/作者:Presentation Intelligence

2026年7月27日,Moonshot AI举办Kimi K3开放日,并宣布三项相互关联的发布:Kimi K3模型权重、官方技术公告以及三项基础设施技术:MoonEPFlashKDAAgentEnv。活动将Kimi K3不仅定位为新的大规模模型,也是一项覆盖模型访问、架构与部署基础设施的发布。


标题级规格很清晰:Kimi K3是一款拥有28亿亿(2.8万亿)参数的开权重模型,基于混合专家(MoE,Mixture of Experts)架构构建。Moonshot AI披露了多项关键技术细节,包括896个专家每个token激活16个专家1M-token上下文窗口KDA + AttnRes按3:1比例MoonViT-V2以及据称2.5倍的扩展效率提升


“开权重”这个概念很重要。开权重意味着训练好的模型权重会在规定条款下提供。但这并不自动等同于模型完全开源,通常开源意味着对源代码、训练数据、工具以及复现流程拥有更广泛的访问。尽管如此,开权重的获取方式仍然可能改变开发者和组织对大型AI模型的部署、检查以及围绕其构建的方式。

57629b3fcbe5e09e2a8eed2d43379b68.png

Moonshot AI通过这样的话总结了这种做法的价值:“开权重模型……降低了获取智能的门槛,推动创新,并让用户对数据、隐私和所有权拥有更大的控制权。”


开放日活动:三项核心发布


Kimi K3开放日围绕三类发布展开。


首先,Moonshot AI发布了Kimi K3模型权重。这是核心的开权重公告。对构建者而言,获得权重可以让部署比“仅托管式API”更灵活,尤其当团队需要对基础设施、延迟、隐私或数据所在地(数据驻留)进行控制时。


其次,Moonshot AI发布了Kimi K3技术报告。这一点很关键,因为大型模型的公告不能仅凭参数数量来评估。架构、路由策略、长上下文设计、多模态能力以及效率方面的论断,决定了模型在实际中是否真正有用。


第三,Moonshot AI发布了MoonEPFlashKDAAgentEnv。这些基础设施技术面向专家通信、注意力性能以及智能体执行。它们的加入表明,Kimi K3开放日不仅是一次模型发布;它同样是一项基础设施发布,旨在更有效地使用超大规模开权重模型。


模型:关键规格


Kimi K3是一款280万亿参数的MoE模型。在混合专家架构中,每个token只会激活模型的一部分。路由器会选择一组专家子集,使系统能够在比同等规模稠密模型更低的“实际激活计算”的情况下,结合非常大的总体容量。


根据Moonshot AI的说法,Kimi K3拥有896个专家,并且每个token激活16个专家。这种设计是模型效率表现的核心。它让模型在推理时通过选择性激活来使用海量整体容量。


规格Kimi K3官方详情
总参数2.8万亿
架构混合专家(MoE)
专家分配896 位专家 / 每个 token 激活 16 位
上下文窗口1M tokens
注意力设计3:1 比例的 KDA + AttnRes
视觉架构MoonViT-V2
扩展效率提升 2.5 倍

1M-token 的上下文窗口”是最实用的规格之一。长上下文可以支持完整文档分析、大型代码库审查、多文件推理、法律或金融文档工作流,以及更长的智能体任务,而无需将每一次输入都强行拆成很小的片段。


Kimi K3 同样采用了“3:1 比例的 KDA + AttnRes”,这是一种与其长上下文策略绑定的混合注意力设计。模型还将 MoonViT-V2 作为视觉架构,表明其具备原生多模态能力,而不是纯文本系统。Moonshot AI 也报告了“2.5 倍的扩展效率提升”,这意味着 Kimi K3 的设计不仅考虑规模,同时也兼顾更实用的训练与推理经济性。


基础设施发布:MoonEPFlashKDAAgentEnv


开源权重模型仍然需要其周边的强大系统。大型 MoE 模型依赖高效通信、快速注意力算子,以及安全的执行环境。Moonshot AI 的基础设施发布正是对这些需求的直接回应。


MoonEP:MoE 专家通信


MoonEP 是用于 MoE 专家并行的通信库。在 MoE 系统中,token 会被路由到不同的专家,而这些专家可能分布在多台设备上。这会带来通信方面的挑战,从而限制吞吐并增加延迟。


对于 Kimi K3 来说,拥有 896 位专家 且每个 token 激活 16 位 时,专家路由是一个关键的系统性问题。MoonEP 的设计目标是改进分布式专家通信,并在大规模 MoE 部署中减少瓶颈。


FlashKDA:更快的长上下文注意力


FlashKDA 是为 KDA 优化的注意力算子。它在长上下文工作负载中尤为重要,因为预填充(prefill)计算可能变得十分昂贵。Moonshot AI 报告称,与 flash-linear-attention 基线相比,FlashKDA 在 Nvidia H20 GPU 上的预填充性能实现了“1.72x 到 2.22x 的加速”。


之所以重要,是因为只有当 1M-token 的上下文窗口能够被高效服务时,它才真正有用。更快的注意力算子可以让长文档分析、代码审查、研究工作流以及多步推理在生产环境中变得更加可行。


AgentEnv:面向 AI 代理的沙盒环境


AgentEnv 是一个与 KVCache.ai 联合开发的智能体沙盒系统。它为需要执行步骤、测试操作、分叉状态、恢复先前状态或运行并行分支的代理提供隔离的沙盒环境


智能体工作流往往不止是文本生成。它们可能会使用文件、工具、代码执行以及多步骤决策。沙盒有助于在支持试验的同时,将智能体行为与外部系统进行隔离。AgentEnv 的快照、恢复和分叉功能在智能体需要在产出最终结果之前探索多种路径时尤其有用。


为什么“开放权重”很重要


开放权重会改变模型提供方与构建方之间的关系。封闭的托管 API 可能很强大,但基础设施、托管、数据流转与运营限制仍由提供方控制。开放权重模型则让具备资质的团队在部署、适配、优化以及将模型集成到自身系统方面拥有更大的空间。


对于企业而言,最大的优势是部署与数据控制。敏感文档、内部代码、法律记录、客户信息以及金融材料可能需要私有化基础设施。开放权重访问可支持本地或私有云部署,使数据治理、隐私与所有权成为核心要求。


对于开发者而言,开放权重访问能够实现更深层的技术集成。团队可以优化推理栈、测试适配方法,并围绕模型的优势构建工作流。Kimi K3 的 MoE 规模、1M-token 上下文能力、MoonViT-V2 视觉能力以及基础设施发布,为专门化应用奠定了基础。


与开源的区别依然至关重要。开放权重并不会自动提供训练数据、源代码流水线或完整的复现方案。不过,它仍然可以为那些需要模型访问、私有化部署或对性能与隐私拥有更多控制权的团队降低实践门槛。


结论:模型与基础设施发布


Kimi K3 Open Day 最好理解为围绕三层内容的协同发布:模型访问技术披露以及部署基础设施2800 亿参数的 MoE 模型是公告的核心,但技术报告与基础设施工具同样关键,用于理解其更广泛的意义。


官方规格内容很扎实:总计 2.8T 参数896 位专家并且每个 token 激活 16 位专家1M-token 上下文窗口KDA + AttnRes 以 3:1 的比例MoonViT-V2,以及据称2.5 倍的扩展效率提升。MoonEP、FlashKDA 与 AgentEnv 表明,Moonshot AI 也在着手解决有效运行大规模开放权重模型所需的系统能力。


Kimi K3 并未被描述为完全开源;它是开放权重。即便如此,通过发布权重、技术细节以及配套的基础设施,Moonshot AI 仍让 Kimi K3 成为大规模开放权重 AI 开发中的一件重要事件。

常见问题(FAQ)


问:Kimi K3 是什么?

答:Kimi K3 是 Moonshot AI 在 2026 年 7 月 27 日 Kimi K3 Open Day 上发布的一个 2.8 万亿参数开放权重专家混合(Mixture of Experts)AI 模型。


问:开放权重是什么意思?

答:开放权重表示在特定许可条款下可获取训练模型权重。它不同于开源——开源通常意味着更广泛地访问源代码、数据以及复现流水线。


问:Kimi K3 发布了哪些基础设施技术?

答:Moonshot AI 发布了 MoonEPFlashKDAAgentEnv。MoonEP 支持 MoE 通信,FlashKDA 加速 KDA 注意力,而 AgentEnv 为 AI 代理提供沙盒系统。


问:Kimi K3 最重要的规格是什么?

A:Kimi K3 总参数量为 2.8T,拥有 896 个专家,每个 token 激活 16 个,支持 1M-token 的上下文窗口,KDA + AttnRes 的配比为 3:1,MoonViT-V2,并实现了 2.5 倍的扩展效率提升。



把这份 Kimi K3 分析打磨成一份包含 Pi 的精美 PPT,让复杂的 AI 进展清晰易懂、便于展示。