Kimi K3 Open Day: 2.8 Trilioni di parametri, ora open weight

Kimi K3 Open Day/2026-07-28/di Presentation Intelligence

Il 27 luglio 2026, Moonshot AI ha tenuto l’evento Kimi K3 Open Day e ha annunciato tre release collegate: i pesi del modello Kimi K3, l’annuncio tecnico ufficiale e tre tecnologie infrastrutturali: MoonEP, FlashKDA e AgentEnv. L’evento ha posizionato Kimi K3 non solo come un nuovo modello su larga scala, ma anche come un rilascio che copre l’accesso al modello, l’architettura e l’infrastruttura di deployment.

Il titolo e le specifiche sono chiari: Kimi K3 è un modello open-weight da 2,8 trilioni di parametri, costruito su un’architettura Mixture of Experts (MoE). Moonshot AI ha rivelato importanti dettagli tecnici, tra cui 896 esperti, 16 esperti attivati per token, una finestra di contesto da 1M token, KDA + AttnRes in rapporto 3:1, MoonViT-V2 e un presunto miglioramento dell’efficienza di scaling di 2,5x.

Il termine open-weight è importante. Open-weight significa che i pesi del modello addestrato sono resi disponibili secondo termini definiti. Non significa automaticamente che il modello sia completamente open-source, cosa che di solito implica un accesso più ampio al codice sorgente, ai dati di training, agli strumenti e alle pipeline di riproduzione. Tuttavia, l’accesso open-weight può cambiare il modo in cui sviluppatori e organizzazioni effettuano il deployment, ispezionano e costruiscono attorno a un grande modello AI.

57629b3fcbe5e09e2a8eed2d43379b68.png

Moonshot AI ha riassunto il valore di questo approccio dicendo che “i modelli open-weight... abbassano la barriera per accedere all’intelligenza, favoriscono l’innovazione e offrono agli utenti un maggiore controllo su dati, privacy e ownership.”


L’evento Open Day: tre release principali

L’Open Day di Kimi K3 si è concentrato su tre categorie di release.

In primo luogo, Moonshot AI ha rilasciato i pesi del modello Kimi K3. Questo è l’annuncio open-weight di base. Per chi sviluppa, l’accesso ai pesi può consentire un deployment più flessibile rispetto a una semplice API hosted, soprattutto quando i team hanno bisogno di controllo sull’infrastruttura, sulla latenza, sulla privacy o sulla localizzazione dei dati.

In secondo luogo, Moonshot AI ha pubblicato il report tecnico di Kimi K3. Questo è importante perché gli annunci sui grandi modelli non possono essere valutati solo in base al conteggio dei parametri. Sono infatti l’architettura, la strategia di routing, il design per contesti lunghi, la capacità multimodale e le affermazioni sull’efficienza a determinare se un modello sia davvero utile nella pratica.

In terzo luogo, Moonshot AI ha rilasciato MoonEP, FlashKDA e AgentEnv. Queste tecnologie infrastrutturali puntano alla comunicazione tra esperti, alle prestazioni dell’attenzione e all’esecuzione degli agenti. La loro inclusione mostra che l’Open Day di Kimi K3 non era solo una release di modello; era anche una release di infrastruttura per usare in modo più efficace modelli open-weight molto grandi.


Il modello: specifiche chiave

Kimi K3 è un modello MoE da 2,8 trilioni di parametri. In un’architettura Mixture of Experts, solo una parte del modello viene attivata per ogni token. Un router seleziona un sottoinsieme di esperti, permettendo al sistema di combinare un’enorme capacità totale con un calcolo attivo inferiore rispetto a un modello denso di dimensioni simili.

Secondo Moonshot AI, Kimi K3 ha 896 esperti, con 16 esperti attivati per token. Questo design è fondamentale per il profilo di efficienza del modello. Consente al modello di mantenere un’enorme capacità complessiva, utilizzando l’attivazione selettiva durante l’inferenza.

SpecificheDettagli ufficiali di Kimi K3
Parametri totali2,8 trilioni
ArchitetturaMixture of Experts (MoE)
Allocazione esperta896 esperti / 16 attivi per token
Finestra di contesto3M token
Design dell’attenzioneKDA + AttnRes con un rapporto 3:1
Architettura visionMoonViT-V2
Efficienza di scalabilitàMiglioramento di 2,5x

La finestra di contesto da 1M token è una delle specifiche più pratiche. Un contesto lungo può supportare l’analisi dell’intero documento, la revisione di grandi codebase, il ragionamento multi-file, i flussi di lavoro di documenti legali o finanziari e attività più lunghe dell’agente senza costringere ogni input in piccoli frammenti.

Kimi K3 utilizza anche KDA + AttnRes con un rapporto 3:1, un design di attenzione ibrido legato alla sua strategia di contesto lungo. Il modello include MoonViT-V2 come architettura vision, indicando una capacità multimodale nativa piuttosto che un sistema esclusivamente basato su testo. Moonshot AI ha inoltre riportato un miglioramento dell’efficienza di scalabilità di 2,5x, suggerendo che Kimi K3 sia stato progettato non solo per la scalabilità, ma anche per rendere più pratici gli aspetti economici di addestramento e inferenza.


Il rilascio dell’infrastruttura: MoonEP, FlashKDA e AgentEnv.

I modelli open-weight hanno comunque bisogno di sistemi solidi intorno. I grandi modelli MoE dipendono da comunicazioni efficienti, kernel di attenzione rapidi e ambienti di esecuzione sicuri. Il rilascio dell’infrastruttura di Moonshot AI affronta direttamente queste esigenze.


MoonEP: comunicazione tra esperti MoE

MoonEP è una libreria di comunicazione per il parallelismo tra esperti MoE. Nei sistemi MoE, i token vengono instradati verso esperti diversi e tali esperti possono essere distribuiti su più dispositivi. Questo crea sfide di comunicazione che possono limitare la produttività e aumentare la latenza.

Per Kimi K3, con 896 esperti e 16 attivi per token, l’instradamento degli esperti è un problema rilevante a livello di sistema. MoonEP è progettato per migliorare la comunicazione tra esperti distribuiti e ridurre i colli di bottiglia nelle implementazioni MoE su larga scala.


FlashKDA: attenzione per contesto lungo più veloce

FlashKDA è un kernel di attenzione ottimizzato per KDA. Il suo ruolo è particolarmente importante per i carichi di lavoro a contesto lungo, in cui il calcolo di prefill può diventare costoso. Moonshot AI ha segnalato che FlashKDA offre un incremento di velocità da 1,72x a 2,22x nelle prestazioni di prefill sulle GPU Nvidia H20 rispetto alle baseline flash-linear-attention.

Questo è importante perché una finestra di contesto da 1M token è utile solo se può essere servita in modo efficiente. Kernel di attenzione più rapidi possono rendere più pratiche in produzione l’analisi di documenti lunghi, la revisione del codice, i flussi di lavoro di ricerca e il ragionamento multi-step.


AgentEnv: sandbox per agenti

AgentEnv è un sistema di sandbox per agenti co-sviluppato con KVCache.ai. Offre un ambiente sandbox isolato per agenti che devono eseguire passaggi, testare azioni, effettuare fork dello stato, ripristinare stati precedenti o avviare rami in parallelo.

I flussi di lavoro degli agenti spesso coinvolgono molto più della generazione di testo. Possono usare file, strumenti, esecuzione di codice e decisioni multi-step. Una sandbox aiuta a separare il comportamento dell’agente dai sistemi esterni, pur supportando la sperimentazione. Le funzioni di snapshot, restore e fork di AgentEnv sono utili quando gli agenti devono esplorare più percorsi prima di produrre un risultato finale.


Perché l’accesso Open-Weight è importante

L’accesso open-weight cambia la relazione tra fornitori di modelli e sviluppatori. Un’API hosted chiusa può essere potente, ma l’infrastruttura, l’hosting, il flusso di dati e i limiti operativi restano controllati dal provider. Un modello open-weight offre ai team qualificati più spazio per distribuire, adattare, ottimizzare e integrare il modello nei propri sistemi.

Per le aziende, il vantaggio più grande è il controllo su distribuzione e dati. Documenti sensibili, codice interno, registri legali, informazioni sui clienti e materiali finanziari possono richiedere un’infrastruttura privata. L’accesso open-weight può supportare la distribuzione locale o in cloud privato, dove la governance dei dati, la privacy e la titolarità sono requisiti centrali.

Per gli sviluppatori, l’accesso open-weight abilita una più profonda integrazione tecnica. I team possono ottimizzare gli stack di inferenza, testare metodi di adattamento e costruire flussi di lavoro basati sui punti di forza del modello. La scalabilità MoE di Kimi K3, il contesto da 1M token, la capacità visiva MoonViT-V2 e i rilasci di infrastruttura creano una base per applicazioni specializzate.

La distinzione rispetto all’open-source resta essenziale. L’open-weight non fornisce automaticamente i dati di addestramento, la pipeline di sorgente o la ricetta di riproduzione completa. Tuttavia, può comunque ridurre le barriere pratiche per i team che hanno bisogno di accesso al modello, distribuzione privata o più controllo sulle prestazioni e sulla privacy.


Il verdetto: un rilascio di modelli e infrastruttura

Il Kimi K3 Open Day è meglio inteso come un rilascio coordinato su tre livelli: accesso al modello, divulgazione tecnica e infrastruttura di distribuzione. Il modello MoE da 2,8 trilioni di parametri è al centro dell’annuncio, ma il report tecnico e gli strumenti infrastrutturali sono fondamentali per comprenderne il significato più ampio.

Le specifiche ufficiali sono sostanziose: 2,8T parametri totali, 896 esperti con 16 attivati per token, una finestra di contesto da 1M token, KDA + AttnRes in rapporto 3:1, MoonViT-V2 e un miglioramento dell’efficienza di scaling di 2,5x riportato. MoonEP, FlashKDA e AgentEnv mostrano anche che Moonshot AI sta affrontando i sistemi necessari per far funzionare in modo efficace grandi modelli open-weight.

Il Kimi K3 non è descritto come completamente open-source; è open-weight. Eppure, rilasciando pesi, dettagli tecnici e infrastruttura di supporto, Moonshot AI ha reso Kimi K3 un evento significativo nello sviluppo di AI open-weight su larga scala.


Domande frequenti (FAQ)

D: Cos’è Kimi K3?

R: Kimi K3 è un modello AI open-weight Mixture of Experts con 2,8 trilioni di parametri di Moonshot AI, annunciato al Kimi K3 Open Day il 27 luglio 2026.


D: Cosa significa open-weight?

R: Open-weight significa che i pesi del modello addestrato sono accessibili secondo termini di licenza definiti. Si differenzia dall’open-source, che di solito implica un accesso più ampio al codice sorgente, ai dati e alle pipeline di riproduzione.


D: Quali tecnologie di Infra sono state rilasciate con Kimi K3?

R: Moonshot AI ha rilasciato MoonEP, FlashKDA e AgentEnv. MoonEP supporta la comunicazione MoE, FlashKDA accelera l’attenzione KDA e AgentEnv fornisce un sistema di sandbox per agenti AI.


D: Quali sono le specifiche più importanti di Kimi K3?

A: Kimi K3 ha 2,8T parametri totali, 896 esperti con 16 attivati per token, una finestra di contesto da 1M token, KDA + AttnRes in un rapporto 3:1, MoonViT‑V2 e un miglioramento dell’efficienza di scalabilità di 2,5x.


Trasforma questa analisi di Kimi K3 in una PPT rifinita con Pi, rendendo gli sviluppi complessi dell’IA chiari e facili da presentare.