Kimi K3 Open Day: 2,8 Tỷ Tham Số, Mở Trọng Lượng Hiện Đã

Kimi K3 Open Day/2026-07-28/bởi Presentation Intelligence

Vào ngày 27 tháng 7 năm 2026, Moonshot AI đã tổ chức Kimi K3 Open Day và công bố ba bản phát hành liên kết: trọng số mô hình Kimi K3, thông báo kỹ thuật chính thức, và ba công nghệ hạ tầng: MoonEP, FlashKDAAgentEnv. Sự kiện định vị Kimi K3 không chỉ như một mô hình quy mô lớn mới, mà còn như một bản phát hành bao gồm cả quyền truy cập mô hình, kiến trúc và hạ tầng triển khai.

Phần mô tả tiêu đề rất rõ ràng: Kimi K3 là mô hình open-weight với 2,8 nghìn tỷ tham số được xây dựng trên kiến trúc Mixture of Experts (MoE). Moonshot AI đã công bố nhiều chi tiết kỹ thuật quan trọng, bao gồm 896 chuyên gia, 16 chuyên gia được kích hoạt cho mỗi token, cửa sổ ngữ cảnh 1M token, KDA + AttnRes theo tỉ lệ 3:1, MoonViT-V2, và một cải thiện hiệu suất mở rộng 2,5x theo báo cáo.

Thuật ngữ open-weight rất quan trọng. Open-weight nghĩa là các trọng số mô hình đã được huấn luyện được cung cấp theo những điều khoản được xác định. Điều đó không đồng nghĩa tự động rằng mô hình hoàn toàn là mã nguồn mở, vốn thường ngụ ý phạm vi truy cập rộng hơn đến mã nguồn, dữ liệu huấn luyện, công cụ và các pipeline tái tạo. Tuy vậy, quyền truy cập open-weight có thể thay đổi cách các nhà phát triển và tổ chức triển khai, kiểm tra và xây dựng xung quanh một mô hình AI lớn.

57629b3fcbe5e09e2a8eed2d43379b68.png

Moonshot AI đã tóm tắt giá trị của cách tiếp cận này bằng cách nói rằng “các mô hình open-weight... hạ thấp rào cản tiếp cận trí tuệ, thúc đẩy đổi mới và mang lại cho người dùng quyền kiểm soát lớn hơn đối với dữ liệu, quyền riêng tư và quyền sở hữu.”


Sự kiện Open Day: Ba bản phát hành cốt lõi

Kimi K3 Open Day tập trung vào ba nhóm phát hành.

Đầu tiên, Moonshot AI đã phát hành trọng số mô hình Kimi K3. Đây là thông báo open-weight cốt lõi. Với những người xây dựng, việc có quyền truy cập trọng số có thể giúp triển khai linh hoạt hơn so với chỉ dùng API do bên thứ ba cung cấp, đặc biệt khi các đội cần kiểm soát hạ tầng, độ trễ, quyền riêng tư hoặc nơi lưu trữ dữ liệu.

Thứ hai, Moonshot AI đã công bố báo cáo kỹ thuật Kimi K3. Điều này quan trọng vì những thông báo về mô hình quy mô lớn không thể được đánh giá chỉ bằng số lượng tham số. Kiến trúc, chiến lược định tuyến, thiết kế ngữ cảnh dài, năng lực đa phương thức và các tuyên bố về hiệu suất quyết định liệu mô hình có hữu ích trong thực tế hay không.

Thứ ba, Moonshot AI đã phát hành MoonEP, FlashKDAAgentEnv. Các công nghệ hạ tầng này hướng tới truyền thông giữa các chuyên gia, hiệu năng chú ý và việc thực thi tác nhân. Việc đưa chúng vào cho thấy Kimi K3 Open Day không chỉ là một bản phát hành mô hình; đó còn là một bản phát hành hạ tầng để sử dụng hiệu quả hơn các mô hình open-weight quy mô rất lớn.


Mô hình: Thông số chính

Kimi K3 là . Trong kiến trúc Mixture of Experts, chỉ một phần của mô hình được kích hoạt cho mỗi token. Một bộ định tuyến chọn ra một tập con các chuyên gia, cho phép hệ thống kết hợp năng lực tổng thể rất lớn với chi phí tính toán đang hoạt động thấp hơn so với một mô hình dày (dense) có kích thước tương tự.

Theo Moonshot AI, Kimi K3 có 896 chuyên gia, với 16 chuyên gia được kích hoạt cho mỗi token. Thiết kế này là trung tâm trong hồ sơ hiệu quả của mô hình. Nó cho phép mô hình nắm giữ năng lực tổng thể khổng lồ trong khi chỉ kích hoạt có chọn lọc trong quá trình suy luận.

Thông số kỹ thuậtChi tiết chính thức Kimi K3
Tổng số tham số2,8 nghìn tỷ
Kiến trúcMixture of Experts (MoE)
Phân bổ chuyên gia896 chuyên gia / 16 chuyên gia được kích hoạt trên mỗi token
Cửa sổ ngữ cảnh1M token
Thiết kế AttentionKDA + AttnRes theo tỉ lệ 3:1
Kiến trúc tầm nhìnMoonViT-V2
Hiệu quả mở rộngCải thiện 2.5x

Cửa sổ ngữ cảnh 1 triệu token là một trong những thông số thực tiễn nhất. Ngữ cảnh dài có thể hỗ trợ phân tích theo toàn bộ tài liệu, rà soát cơ sở mã lớn, suy luận đa tệp, các quy trình tài liệu pháp lý hoặc tài chính, và các tác vụ tác nhân dài hơn mà không buộc mọi đầu vào phải bị chia nhỏ thành các đoạn nhỏ.

Kimi K3 cũng sử dụng KDA + AttnRes theo tỉ lệ 3:1, một thiết kế attention lai gắn với chiến lược ngữ cảnh dài của nó. Mô hình bao gồm MoonViT-V2 như kiến trúc tầm nhìn, cho thấy khả năng đa phương thức tích hợp chứ không phải chỉ là một hệ thống thuần văn bản. Moonshot AI cũng báo cáo cải thiện hiệu quả mở rộng 2.5x, cho thấy Kimi K3 không chỉ được thiết kế cho quy mô, mà còn cho kinh tế hơn trong huấn luyện và suy luận một cách thực tế.


Bản phát hành hạ tầng: MoonEP, FlashKDAAgentEnv.

Các mô hình open-weight vẫn cần những hệ thống mạnh mẽ bao quanh chúng. Các mô hình MoE quy mô lớn phụ thuộc vào truyền thông hiệu quả, các kernel attention nhanh và môi trường thực thi an toàn. Bản phát hành hạ tầng của Moonshot AI giải quyết trực tiếp những nhu cầu này.


MoonEP: Giao tiếp chuyên gia MoE

MoonEP là thư viện giao tiếp cho song song hóa chuyên gia MoE. Trong các hệ thống MoE, các token được định tuyến tới các chuyên gia khác nhau và các chuyên gia đó có thể được phân tán trên nhiều thiết bị. Điều này tạo ra thách thức về giao tiếp, có thể giới hạn thông lượng và làm tăng độ trễ.

Với Kimi K3, có 896 chuyên gia16 chuyên gia được kích hoạt trên mỗi token, thì định tuyến chuyên gia là một bài toán hệ thống lớn. MoonEP được thiết kế để cải thiện giao tiếp chuyên gia phân tán và giảm các điểm nghẽn trong triển khai MoE quy mô lớn.


FlashKDA: Attention ngữ cảnh dài nhanh hơn

FlashKDA là một kernel attention được tối ưu cho KDA. Vai trò của nó đặc biệt quan trọng đối với các tác vụ ngữ cảnh dài, nơi việc tính toán prefill có thể trở nên tốn kém. Moonshot AI cho biết FlashKDA mang lại tăng tốc từ 1.72x đến 2.22x về hiệu năng prefill trên GPU Nvidia H20 so với các baseline flash-linear-attention.

Điều này quan trọng vì cửa sổ ngữ cảnh 1 triệu token chỉ hữu ích nếu có thể được phục vụ một cách hiệu quả. Các kernel attention nhanh hơn có thể giúp các quy trình phân tích tài liệu dài, rà soát mã, nghiên cứu và suy luận nhiều bước trở nên thực tế hơn trong môi trường triển khai.


AgentEnv: Hệ thống sandbox cho tác nhân AI

AgentEnv là một hệ thống sandbox cho tác nhân, đồng phát triển với KVCache.ai. Nó cung cấp một môi trường sandbox được cách ly cho các tác nhân cần thực hiện các bước, kiểm tra hành động, tách trạng thái, khôi phục các trạng thái trước đó hoặc chạy song song nhiều nhánh.

Quy trình làm việc của tác nhân thường bao gồm nhiều hơn việc tạo sinh văn bản. Chúng có thể sử dụng tệp, công cụ, thực thi mã và các quyết định nhiều bước. Sandbox giúp tách biệt hành vi của tác nhân khỏi các hệ thống bên ngoài, đồng thời vẫn hỗ trợ việc thử nghiệm. Tính năng snapshot, restore và fork của AgentEnv rất hữu ích khi tác nhân cần khám phá nhiều hướng trước khi tạo ra kết quả cuối cùng.


Vì sao trọng lượng mở lại quan trọng

Quyền truy cập trọng lượng mở thay đổi mối quan hệ giữa các nhà cung cấp mô hình và những người xây dựng. API đóng dạng dịch vụ có thể rất mạnh, nhưng hạ tầng, dịch vụ lưu trữ, luồng dữ liệu và các giới hạn vận hành vẫn do nhà cung cấp kiểm soát. Một mô hình trọng lượng mở cho phép các đội ngũ đủ năng lực có nhiều không gian hơn để triển khai, điều chỉnh, tối ưu và tích hợp mô hình vào các hệ thống của riêng họ.

Đối với doanh nghiệp, lợi thế lớn nhất là triển khai và kiểm soát dữ liệu. Các tài liệu nhạy cảm, mã nội bộ, hồ sơ pháp lý, thông tin khách hàng và tài liệu tài chính có thể cần hạ tầng riêng. Quyền truy cập trọng lượng mở có thể hỗ trợ triển khai tại chỗ hoặc trên đám mây riêng, nơi quản trị dữ liệu, quyền riêng tư và quyền sở hữu là các yêu cầu trọng tâm.

Đối với nhà phát triển, quyền truy cập trọng lượng mở cho phép tích hợp kỹ thuật sâu hơn. Các nhóm có thể tối ưu các ngăn xếp suy luận, thử nghiệm các phương pháp thích nghi và xây dựng quy trình làm việc dựa trên thế mạnh của mô hình. Quy mô MoE của Kimi K3, ngữ cảnh 1 triệu token, năng lực tầm nhìn MoonViT-V2 và các bản phát hành hạ tầng tạo nền tảng cho các ứng dụng chuyên biệt.

Sự khác biệt so với mã nguồn mở vẫn là yếu tố then chốt. Trọng lượng mở không tự động cung cấp dữ liệu huấn luyện, pipeline nguồn hay đầy đủ công thức tái tạo. Tuy nhiên, nó vẫn có thể làm giảm đáng kể rào cản thực tiễn cho các đội ngũ cần quyền truy cập mô hình, triển khai riêng hoặc có nhiều quyền kiểm soát hơn đối với hiệu năng và quyền riêng tư.


Kết luận: Bản phát hành mô hình và hạ tầng

Kimi K3 Open Day có thể được hiểu tốt nhất như một bản phát hành phối hợp trên ba lớp: quyền truy cập mô hình, công bố kỹ thuậthạ tầng triển khai. Mô hình MoE 2,8 nghìn tỷ tham số là trung tâm của thông báo, nhưng báo cáo kỹ thuật và các công cụ hạ tầng cũng quan trọng để hiểu ý nghĩa rộng hơn của nó.

Các thông số chính thức rất đáng kể: 2,8T tổng tham số, 896 chuyên gia với 16 chuyên gia được kích hoạt trên mỗi token, khung ngữ cảnh 1M token, KDA + AttnRes theo tỷ lệ 3:1, MoonViT-V2 và báo cáo cải thiện hiệu suất mở rộng 2,5 lần. MoonEP, FlashKDA và AgentEnv cho thấy Moonshot AI cũng đang giải quyết các hệ thống cần thiết để vận hành hiệu quả các mô hình trọng lượng mở quy mô lớn.

Kimi K3 không được mô tả là mã nguồn mở hoàn toàn; đó là trọng lượng mở. Dù vậy, bằng việc phát hành trọng số, chi tiết kỹ thuật và hạ tầng hỗ trợ, Moonshot AI đã biến Kimi K3 thành một sự kiện quan trọng trong phát triển AI trọng lượng mở quy mô lớn.


Câu hỏi thường gặp (FAQ)

Q: Kimi K3 là gì?

A: Kimi K3 là một mô hình AI trọng lượng mở Mixture of Experts gồm 2,8 nghìn tỷ tham số từ Moonshot AI, được công bố tại Kimi K3 Open Day vào ngày 27 tháng 7 năm 2026.


Q: Trọng lượng mở nghĩa là gì?

A: Trọng lượng mở nghĩa là các trọng số của mô hình đã được huấn luyện có thể truy cập theo các điều khoản cấp phép được xác định. Nó khác với mã nguồn mở, thường ngụ ý mức độ truy cập rộng hơn đối với mã nguồn, dữ liệu và các pipeline tái tạo.


Q: Những công nghệ hạ tầng nào được phát hành cùng với Kimi K3?

A: Moonshot AI đã phát hành MoonEP, FlashKDAAgentEnv. MoonEP hỗ trợ giao tiếp MoE, FlashKDA tăng tốc sự chú ý của KDA, và AgentEnv cung cấp một hệ thống sandbox cho các tác nhân AI.


Q: Các thông số Kimi K3 quan trọng nhất là gì?

A: Kimi K3 có tổng cộng 2,8T tham số, 896 chuyên gia với 16 chuyên gia được kích hoạt trên mỗi token, cửa sổ ngữ cảnh 1M token, tỷ lệ KDA + AttnRes là 3:1, MoonViT-V2 và cải thiện hiệu suất mở rộng gấp 2,5 lần.


Hãy biến phần phân tích Kimi K3 này thành một bản PPT được biên tập đẹp mắt với Pi, để các phát triển AI phức tạp trở nên rõ ràng và dễ trình bày.