Kimi K3 Open Day: 2,8 Billionen Parameter, jetzt Open-Weight
Am 27. Juli 2026 hielt Moonshot AI den Kimi K3 Open Day ab und kündigte drei verknüpfte Releases an: die Kimi K3-Modellgewichte, die offizielle technische Ankündigung sowie drei Infrastrukturtechnologien: MoonEP, FlashKDA und AgentEnv. Die Veranstaltung positionierte Kimi K3 nicht nur als neues Large-Scale-Modell, sondern auch als Release, das Modellzugriff, Architektur und Infrastruktur für das Deployment umfasst.
Die Überschrift ist eindeutig: Kimi K3 ist ein Open-Weight-Modell mit 2,8 Billionen Parametern, das auf einer Mixture of Experts (MoE)-Architektur basiert. Moonshot AI gab große technische Details bekannt, darunter 896 Experten, 16 aktivierte Experten pro Token, ein 1M-Token-Kontextfenster, KDA + AttnRes im Verhältnis 3:1, MoonViT-V2 sowie eine gemeldete 2,5-fache Verbesserung der Skalierungseffizienz.
Der Begriff Open-Weight ist entscheidend. Open-Weight bedeutet, dass die trainierten Modellgewichte unter festgelegten Bedingungen verfügbar gemacht werden. Das heißt nicht automatisch, dass das Modell vollständig Open Source ist, was üblicherweise einen breiteren Zugang zu Quellcode, Trainingsdaten, Tools und Reproduktions-Pipelines impliziert. Dennoch kann der Zugang mit Open-Weight beeinflussen, wie Entwickler und Organisationen ein großes KI-Modell bereitstellen, untersuchen und darum aufbauen.

Moonshot AI fasste den Wert dieses Ansatzes so zusammen, dass „Open-Weight-Modelle… die Hürde senken, Zugang zu Intelligenz zu erhalten, Innovation vorantreiben und Nutzern mehr Kontrolle über Daten, Privatsphäre und Besitz geben.“
Open-Day-Event: Drei zentrale Releases
Der Kimi K3 Open Day konzentrierte sich auf drei Release-Kategorien.
Erstens veröffentlichte Moonshot AI die Kimi K3-Modellgewichte. Das ist die zentrale Ankündigung im Bereich Open-Weight. Für Entwickler kann der Zugang zu den Gewichten eine flexiblere Bereitstellung ermöglichen als eine reine gehostete API – insbesondere dann, wenn Teams Kontrolle über Infrastruktur, Latenz, Privatsphäre oder Datenresidenz benötigen.
Zweitens veröffentlichte Moonshot AI den technischen Bericht zu Kimi K3. Das ist wichtig, weil Ankündigungen großer Modelle nicht allein anhand der Parameteranzahl bewertet werden können. Architektur, Routing-Strategie, Design für lange Kontexte, multimodale Fähigkeiten und Effizienzbehauptungen entscheiden darüber, ob ein Modell in der Praxis nützlich ist.
Drittens veröffentlichte Moonshot AI MoonEP, FlashKDA und AgentEnv. Diese Infrastrukturtechnologien zielen auf Expert-Kommunikation, Aufmerksamkeits-Performance und die Ausführung von Agenten ab. Ihre Aufnahme zeigt, dass der Kimi K3 Open Day nicht nur ein Modell-Release war, sondern auch ein Infrastruktur-Release, um die Nutzung sehr großer Open-Weight-Modelle effektiver zu machen.
Das Modell: Wichtige Spezifikationen
Kimi K3 ist ein MoE-Modell (Mixture of Experts) mit 2,8 Billionen Parametern. In einer Mixture-of-Experts-Architektur wird für jedes Token nur ein Teil des Modells aktiviert. Ein Router wählt eine Teilmenge der Experten aus, sodass das System sehr große Gesamtkapazität mit geringerem aktivem Rechenaufwand kombiniert als ein dichtes Modell vergleichbarer Größe.
Laut Moonshot AI hat Kimi K3 896 Experten, mit 16 aktivierten Experten pro Token. Dieses Design ist zentral für das Effizienzprofil des Modells. Es ermöglicht, massive Gesamtkapazität vorzuhalten und gleichzeitig bei der Inferenz auf selektive Aktivierung zu setzen.
| Spezifikation | Offizielle Kimi-K3-Details |
|---|---|
| Gesamtparameter | 2,8 Billionen |
| Architektur | Mixture of Experts (MoE) |
| Experten-Zuweisung | 896 Experten / 16 pro Token aktiviert |
| Kontextfenster | 1M Tokens |
| Attention-Design | KDA + AttnRes im Verhältnis 3:1 |
| Vision-Architektur | MoonViT-V2 |
| Skalierungs-Effizienz | 2,5-fache Verbesserung |
Das 1M-Token-Kontextfenster ist eine der praktischsten Spezifikationen. Ein langer Kontext kann eine vollständige Dokumentenanalyse, die Überprüfung großer Codebasen, Schlussfolgerungen über mehrere Dateien, Workflows für rechtliche oder finanzielle Dokumente sowie längere Aufgaben von Agenten unterstützen, ohne dass jede Eingabe in kleine Fragmente aufgeteilt werden muss.
Kimi K3 verwendet außerdem KDA + AttnRes im Verhältnis 3:1, ein hybrides Attention-Design, das an seine Strategie für langen Kontext gekoppelt ist. Das Modell integriert mit MoonViT-V2 eine Vision-Architektur, was auf native Multimodalität hindeutet und nicht auf ein rein textbasiertes System. Moonshot AI berichtete zudem von einer 2,5-fachen Verbesserung der Skalierungs-Effizienz, was darauf schließen lässt, dass Kimi K3 nicht nur auf Skalierung, sondern auch auf praktischere Trainings- und Inferenz-Ökonomie ausgelegt wurde.
Die Infra-Veröffentlichung: MoonEP, FlashKDA und AgentEnv.
Open-Weight-Modelle brauchen dennoch starke Systeme rund um sie herum. Große MoE-Modelle hängen von effizienter Kommunikation ab, schnellen Attention-Kernels und sicheren Ausführungsumgebungen. Das Infrastruktur-Release von Moonshot AI adressiert diese Anforderungen direkt.
MoonEP: Kommunikation von MoE-Experten
MoonEP ist eine Kommunikationsbibliothek für MoE-Expertenparallelität. In MoE-Systemen werden Tokens an unterschiedliche Experten weitergeleitet, und diese Experten können über mehrere Geräte verteilt sein. Das schafft Kommunikationsherausforderungen, die den Durchsatz begrenzen und die Latenz erhöhen können.
Für Kimi K3 ist das Expert-Routing mit 896 Experten und 16 pro Token aktiviert ein großes Systemproblem. MoonEP wurde entwickelt, um die verteilte Kommunikation zwischen Experten zu verbessern und Engpässe bei groß angelegten MoE-Deployments zu reduzieren.
FlashKDA: Schnellere Attention für langen Kontext
FlashKDA ist ein für KDA optimierter Attention-Kernel. Seine Rolle ist besonders wichtig für Workloads mit langem Kontext, bei denen die Prefill-Berechnung teuer werden kann. Moonshot AI berichtete, dass FlashKDA im Vergleich zu den Baselines der flash-linearen Attention bei Nvidia H20-GPUs eine 1,72-fache bis 2,22-fache Beschleunigung in der Prefill-Performance liefert.
Das ist relevant, weil ein Kontextfenster von 1M Tokens nur dann nützlich ist, wenn es effizient bereitgestellt werden kann. Schnellere Attention-Kernels können die Analyse langer Dokumente, Code-Reviews, Forschungs-Workflows und mehrstufiges Reasoning in der Produktion deutlich praktikabler machen.
AgentEnv: Sandbox für KI-Agenten
AgentEnv ist ein Agent-Sandbox-System, das gemeinsam mit KVCache.ai entwickelt wurde. Es bietet eine isolierte Sandbox-Umgebung für Agenten, die Schritte ausführen, Aktionen testen, den Zustand verzweigen, frühere Zustände wiederherstellen oder parallele Abläufe starten müssen.
Agent-Workflows beinhalten oft mehr als nur Texterzeugung. Möglicherweise werden Dateien, Tools, Code-Ausführung und mehrstufige Entscheidungen verwendet. Eine Sandbox hilft dabei, das Verhalten des Agenten von externen Systemen zu trennen und gleichzeitig Experimente zu ermöglichen. Die Snapshot-, Restore- und Fork-Funktionen von AgentEnv sind besonders dann nützlich, wenn Agenten mehrere Pfade erkunden müssen, bevor sie ein finales Ergebnis produzieren.
Warum Open-Weight so wichtig ist
Der Open-Weight-Zugang verändert das Verhältnis zwischen Modellanbietern und Entwicklern. Eine geschlossene gehostete API kann zwar leistungsstark sein, doch Infrastruktur, Hosting, Datenfluss und betriebliche Limits bleiben weiterhin vom Anbieter kontrolliert. Ein Open-Weight-Modell gibt qualifizierten Teams mehr Spielraum, das Modell bereitzustellen, anzupassen, zu optimieren und in ihre eigenen Systeme zu integrieren.
Für Unternehmen besteht der größte Vorteil in Bereitstellung und Datensouveränität. Sensible Dokumente, interner Code, rechtliche Aufzeichnungen, Kundendaten und finanzielle Unterlagen benötigen möglicherweise eine private Infrastruktur. Open-Weight-Zugriff kann eine lokale oder private Cloud-Bereitstellung unterstützen, bei der Data Governance, Datenschutz und Eigentum zentrale Anforderungen sind.
Für Entwickler ermöglicht Open-Weight-Zugriff eine tiefere technische Integration. Teams können Inferenz-Stacks optimieren, Anpassungsmethoden testen und Workflows rund um die Stärken des Modells aufbauen. Das MoE-Skalierungsniveau von Kimi K3, der 1-Million-Token-Kontext, die Vision-Fähigkeit MoonViT-V2 und die Infrastruktur-Release-Updates schaffen eine Grundlage für spezialisierte Anwendungen.
Die Abgrenzung gegenüber Open Source bleibt wesentlich. Open-Weight stellt nicht automatisch Trainingsdaten, Source-Pipeline oder ein vollständiges Reproduktionsrezept bereit. Dennoch kann es die praktischen Hürden für Teams senken, die Modellzugang, private Bereitstellung oder mehr Kontrolle über Leistung und Datenschutz benötigen.
Das Urteil: Ein Modell- und Infrastruktur-Release
Der Kimi K3 Open Day ist am besten als koordinierte Veröffentlichung über drei Ebenen hinweg zu verstehen: Modellzugang, technische Offenlegung und Deployments-Infrastruktur. Das MoE-Modell mit 2,8 Billionen Parametern steht im Mittelpunkt der Ankündigung, doch der technische Bericht und die Infrastruktur-Tools sind entscheidend, um seine größere Bedeutung zu verstehen.
Die offiziellen Spezifikationen sind umfangreich: 2,8 T Gesamtsparameter, 896 Experten mit 16 aktivierten pro Token, ein 1M-Token-Kontextfenster, KDA + AttnRes im Verhältnis 3:1, MoonViT-V2 sowie eine gemeldete Verbesserung der Skalierungseffizienz um 2,5×. MoonEP, FlashKDA und AgentEnv zeigen, dass Moonshot AI außerdem an den Systemen arbeitet, die benötigt werden, um große Open-Weight-Modelle effektiv zu betreiben.
Kimi K3 wird nicht als vollständig Open Source beschrieben; es handelt sich um Open-Weight. Dennoch machte Moonshot AI durch die Veröffentlichung der Gewichte, technischer Details und unterstützender Infrastruktur Kimi K3 zu einem bedeutenden Ereignis in der großskaligen Open-Weight-KI-Entwicklung.
Häufig gestellte Fragen (FAQ)
F: Was ist Kimi K3?
A: Kimi K3 ist ein Open-Weight-Mixture-of-Experts-KI-Modell mit 2,8 Billionen Parametern von Moonshot AI, das beim Kimi K3 Open Day am 27. Juli 2026 angekündigt wurde.
F: Was bedeutet Open-Weight?
A: Open-Weight bedeutet, dass die trainierten Modellgewichte unter festgelegten Lizenzbedingungen zugänglich sind. Das unterscheidet es von Open Source, das normalerweise einen breiteren Zugang zu Quellcode, Daten und Reproduktions-Pipelines impliziert.
F: Welche Infrastrukt technologies wurden mit Kimi K3 veröffentlicht?
A: Moonshot AI hat MoonEP, FlashKDA und AgentEnv veröffentlicht. MoonEP unterstützt die MoE-Kommunikation, FlashKDA beschleunigt die KDA-Attention, und AgentEnv stellt ein Sandbox-System für KI-Agenten bereit.
F: Was sind die wichtigsten Kimi-K3-Spezifikationen?
A:Kimi K3 总参数量为 2.8T,包含 896 个专家,每个 token 激活 16 个,支持 1M-token 的上下文窗口,KDA 与 AttnRes 的比例为 3:1,MoonViT-V2,并且在扩展效率方面提升 2.5 倍。


