// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Moonshot AI rilascia Kimi K3: un MoE open da 2,8 trilioni di parametri con contesto da 1M

Kimi K3 è un Mixture-of-Experts open da 2,8T di parametri con Kimi Delta Attention e finestra di contesto da un milione di token. Moonshot pubblica architettura, benchmark e prezzi.

Moonshot AI ha rilasciato Kimi K3, un modello Mixture-of-Experts (MoE) sparso da 2,8 trilioni di parametri con vision nativa e una finestra di contesto da un milione di token. L’azienda lo descrive come il primo modello open della classe 3T e ammette con chiarezza dove si colloca: nel complesso resta sotto i modelli proprietari più potenti come Claude Fable 5 e GPT 5.6 Sol, ma nella suite di valutazione interna supera con costanza gli altri modelli testati.

L’architettura

K3 si regge su tre leve. La prima è Kimi Delta Attention (KDA), un meccanismo di linear attention ibrido che secondo Moonshot abilita un decoding fino a 6,3 volte più veloce sui contesti da un milione di token. La seconda, Attention Residuals (AttnRes), lavora invece lungo la profondità del modello recuperando in modo selettivo le rappresentazioni tra i layer: dichiara circa il 25% di efficienza di training in più a fronte di meno del 2% di costo aggiuntivo. La terza è la sparsità: K3 usa Stable LatentMoE attivando 16 esperti su 896. A questi livelli, routing e ottimizzazione diventano il problema principale, gestito con tecniche come Quantile Balancing e Per-Head Muon. Nel complesso, Moonshot indica un’efficienza di scaling circa 2,5 volte migliore rispetto a Kimi K2.

Le scelte si riflettono anche sul serving: K3 applica quantization-aware training già dalla fase di SFT, usa pesi MXFP4 con attivazioni MXFP8 e, poiché KDA complica il prefix caching, Moonshot ha contribuito un’implementazione a vLLM.

I benchmark

Tutti i risultati di K3 usano reasoning effort impostato al massimo, con harness diversi per benchmark. Secondo la tabella pubblicata, K3 guida su Program Bench (77,8), SWE Marathon (42,0), BrowseComp (91,2), Automation Bench (30,8) e OmniDocBench (91,1). Resta invece dietro a Fable 5 su FrontierSWE (81,2 contro 86,6) e HLE-Full (43,5 contro 53,3), e dietro a GPT 5.6 Sol su DeepSWE (67,5 contro 73,0). Due avvertenze contano nella lettura: le richieste che Fable 5 rifiuta vengono dirottate su Opus 4.8, e il punteggio BrowseComp usa una compattazione del contesto attivata a 300K token (senza, K3 scende a 90,4).

Accesso e prezzi

K3 è disponibile su Kimi.com, Kimi Work, Kimi Code e via API, con accesso attraverso l’SDK OpenAI puntato su una base URL Moonshot. Il parametro reasoning_effort supporta solo max, mentre temperature, top_p e n sono fissi. Il prezzo è piatto, senza scaglioni per lunghezza di contesto: 0,30 dollari per milione di token in cache-hit, 3,00 in cache-miss e 15,00 per l’output. Il tasso di cache-hit diventa quindi la voce da tenere d’occhio, e Moonshot dichiara oltre il 90% di hit sui carichi di coding.

  • K3 è il primo MoE open a 2,8T di parametri, con 16 esperti attivi su 896 e contesto da 1M.
  • KDA, AttnRes e sparsità danno circa 2,5 volte di efficienza di scaling in più rispetto a K2.
  • Guida su alcuni benchmark agentici e di document parsing, ma resta sotto i proprietari di punta su altri.

Fonte: Moonshot AI Releases Kimi K3: A 2.8 Trillion Parameter Open MoE Model With Kimi Delta Attention and 1M Context — https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma