Kimi K3 開放日:2.8 兆參數,現已開放權重
2026 年 7 月 27 日,Moonshot AI 舉辦 Kimi K3 Open Day,並宣布三項關聯的發布:Kimi K3 模型權重、官方技術公告以及三項基礎設施技術:MoonEP、FlashKDA、和 AgentEnv。該活動將Kimi K3不僅定位為新的大型模型,也是一項涵蓋模型存取、架構以及部署基礎設施的發布。
重點規格一目了然:Kimi K3 是一個 2.8 兆參數的開權重模型,建立在專家混合(Mixture of Experts, MoE)架構之上。Moonshot AI 揭露了多項關鍵技術細節,包括 896 位專家、每個 token 啟用 16 位專家、1M-token 上下文視窗、3:1 比例的 KDA + AttnRes、MoonViT-V2,以及據稱 2.5 倍的縮放效率提升。
「開權重」這個概念很重要。開權重表示訓練後的模型權重會在明確定義的條款下提供。它並不代表模型一定是完全開源的——通常這還意味著更廣泛地存取原始碼、訓練資料、工具以及重現流程。即便如此,開權重存取仍可能改變開發者與組織如何部署、檢視,並圍繞這個大型 AI 模型進行構建。

Moonshot AI 對這種做法的價值進行了總結,表示 「開權重模型... 降低了獲取智能的門檻,推動創新,並讓使用者在資料、隱私與所有權方面擁有更大的掌控權。」
Open Day 活動:三項核心發布
Kimi K3 Open Day 聚焦在三個發布類別。
首先,Moonshot AI 發布了 Kimi K3 模型權重。這是核心的開權重公告。對於建置者而言,取得權重可以讓部署方式比「僅靠託管 API」更具彈性,特別是在團隊需要掌控基礎設施、延遲、隱私或資料所在地(data residency)時。
其次,Moonshot AI 公開了 Kimi K3 技術報告。這很重要,因為大型模型的公告不能僅靠參數數量來評估。架構、路由策略、長上下文設計、多模態能力,以及效率方面的宣稱,都決定該模型在實務中是否真的有用。
第三,Moonshot AI 發布了 MoonEP、FlashKDA 以及 AgentEnv。這些基礎設施技術旨在提升專家通訊、注意力效能以及代理執行。這些內容被納入其中,表明 Kimi K3 Open Day 不只是一次模型發布;它同時也是一項基礎設施發布,用以更有效地使用非常大型的開權重模型。
模型:關鍵規格
Kimi K3 是一個 2.8 兆參數的 MoE 模型。在專家混合架構中,每個 token 只會啟用模型的一部分。路由器會選擇一組專家子集,使系統能在比相同規模的密集模型更低的實際計算量下,結合非常龐大的整體容量。
根據 Moonshot AI 的說法,Kimi K3 擁有 896 位專家,且 每個 token 啟用 16 位專家。這種設計是模型效率特性的核心。它讓模型在推論階段能夠透過選擇性啟用,既維持龐大的整體容量,又降低計算負擔。
| 規格 | Kimi K3 官方細節 |
|---|---|
| 總參數 | 2.8 兆 |
| 架構 | 專家混合(MoE) |
| 專家配置 | 896 位專家/每個 token 啟用 16 位 |
| 上下文視窗 | 100 萬 tokens |
| 注意力設計 | 3:1 比例的 KDA + AttnRes |
| 視覺架構 | MoonViT-V2 |
| 擴展效率 | 提升 2.5 倍 |
100 萬 token 的上下文視窗是最實用的規格之一。長上下文能支援完整文件分析、大型程式碼庫審閱、多檔推理、法律或金融文件工作流程,以及更長的代理任務,同時不必將每次輸入都強行切成小片段。
Kimi K3 也採用 3:1 比例的 KDA + AttnRes,這是一種與其長上下文策略相對應的混合注意力設計。該模型將 MoonViT-V2 作為其視覺架構,表明其具備原生的多模態能力,而不是純文字系統。Moonshot AI 也提到 2.5 倍的擴展效率提升,這暗示 Kimi K3 的設計不僅追求規模,也兼顧更實用的訓練與推論成本經濟性。
Infra 發佈:MoonEP、FlashKDA,以及 AgentEnv。
開放權重模型仍需要其周邊的強大系統。大型 MoE 模型依賴高效率的通訊,快速注意力核心,以及安全的執行環境。Moonshot AI 的基礎設施發佈正面回應了這些需求。
MoonEP:MoE 專家通訊
MoonEP 是用於 MoE 專家並行的通訊程式庫。在 MoE 系統中,tokens 會被路由到不同的專家,而這些專家可能分散在多台裝置上。這就帶來通訊方面的挑戰,可能會限制吞吐量並增加延遲。
以 Kimi K3 為例,具有 896 位專家,且每個 token 啟用 16 位,專家路由是主要的系統性問題。MoonEP 的設計目標是改善分散式專家通訊,並降低大規模 MoE 部署中的瓶頸。
FlashKDA:更快的長上下文注意力
FlashKDA 是針對 KDA 優化的注意力核心。它在長上下文工作負載中特別重要,因為在長上下文場景中,prefill 計算可能會變得昂貴。Moonshot AI 表示,FlashKDA 在 Nvidia H20 GPU 上的 prefill 效能,相較於 flash-linear-attention 的基準方案,能帶來 1.72 倍至 2.22 倍的加速。
這很重要,因為只有在能被高效率地提供服務時,100 萬 token 的上下文視窗才真正有用。更快的注意力核心能讓長文件分析、程式碼審閱、研究工作流程,以及多步推理在量產環境中更具可行性。
AgentEnv:面向 AI 代理的沙盒環境
AgentEnv 是一套由 KVCache.ai 共同開發的代理沙盒系統。它為需要執行步驟、測試操作、分叉狀態、還原先前狀態,或運行平行分支的代理,提供一個隔離的沙盒環境。
代理工作流程往往不只涉及文字生成。它們可能會使用檔案、工具、程式碼執行,並做出多步決策。沙盒能在支援實驗的同時,將代理行為與外部系統隔離開來。當代理需要在產出最終結果之前探索多種路徑時,AgentEnv 的快照、還原與分叉功能特別有用。
為什麼「開放權重」至關重要
開放權重的獲取方式,改變了模型供應商與建置者之間的關係。封閉的託管式 API 當然強大,但基礎建設、託管方式、資料流與運營限制仍由供應商掌控。開放權重模型則讓合格的團隊有更多空間去部署、調整、優化,並將模型整合到自身系統中。
對企業而言,最大的優勢是 部署與資料控制。敏感文件、內部程式碼、法律紀錄、客戶資訊以及金融材料,可能需要私有基礎設施。開放權重的存取可以支援本地或私有雲部署,使 資料治理、隱私與所有權成為核心要求。
對開發者而言,開放權重的存取能讓 更深度的技術整合 成為可能。團隊可以針對推論堆疊進行最佳化、測試適配方法,並以模型的優勢來打造工作流程。Kimi K3 的 MoE 規模、1M-token 上下文、MoonViT-V2 的視覺能力,以及基礎設施的釋出,為特定領域應用奠定了基礎。
與開源的差異仍然至關重要。開放權重並不會自動提供訓練資料、來源管線,或完整的重現配方。然而,它仍可能降低對於那些需要模型存取、私有部署或更大效能與隱私控制的團隊而言的實務門檻。
結論:模型與基礎設施的釋出
Kimi K3 Open Day 最好理解為在三個層面上的協調式釋出:模型存取、技術揭露、以及 部署基礎設施。2.8 兆參數的 MoE 模型 是公告的核心,但技術報告與基礎設施工具同樣關鍵,能幫助理解其更廣泛的意義。
官方規格相當完整:總計 2.8T 參數、每個 token 啟用 16 個的 896 位專家、1M-token 的上下文視窗、3:1 比例的 KDA + AttnRes、MoonViT-V2,以及據稱 2.5 倍的縮放效率提升。MoonEP、FlashKDA 與 AgentEnv 顯示,Moonshot AI 也在回應有效運作大型開放權重模型所需的系統層面需求。
Kimi K3 並未被描述為完全開源;它是開放權重。即便如此,透過釋出權重、技術細節與支援性的基礎設施,Moonshot AI 仍讓 Kimi K3 成為大規模開放權重 AI 開發中的一件重大事件。
常見問題(FAQ)
Q:Kimi K3 是什麼?
A:Kimi K3 是來自 Moonshot AI 的一款 2.8 兆參數、開放權重的「專家混合(Mixture of Experts)」AI 模型,於 2026 年 7 月 27 日的 Kimi K3 Open Day 公布。
Q:什麼是開放權重(open-weight)?
A:開放權重表示在定義的授權條款下,已訓練的模型權重可被存取。它不同於開源:開源通常意味著對程式碼、資料與重現流程的存取範圍更廣。
Q:Kimi K3 釋出了哪些基礎設施(Infra)技術?
A:Moonshot AI 釋出了 MoonEP、FlashKDA 與 AgentEnv。MoonEP 支援 MoE 通訊,FlashKDA 加速 KDA 注意力(attention),而 AgentEnv 則為 AI 代理提供沙盒系統。
Q:Kimi K3 最重要的規格是哪些?
A:Kimi K3 總參數量為 2.8T,包含 896 位專家,每個 token 啟用 16 位,具備 1M-token 的上下文視窗,KDA + AttnRes 以 3:1 的比例,MoonViT-V2,以及 2.5x 的縮放效率提升。


