MarkTechPost mette a confronto tre modelli Mixture-of-Experts open a scala di trilioni di parametri: Kimi K3, DeepSeek V4 Pro e GLM-5.2. È un utile punto della situazione su capacità, licenze e costo di serving, ma richiede una lettura attenta perché convivono numeri indipendenti e numeri dichiarati dai vendor.
Parametri e capacità: attenzione a cosa è misurato
Sulla carta i totali sono enormi: 2,8T per Kimi K3 (con attivi non dichiarati, 16 esperti su 896), 1,6T con 49B attivi per DeepSeek V4 Pro, 744B con ~40B attivi per GLM-5.2. Tutti questi conteggi sono vendor-reported. Sul fronte indipendente, l’«Artificial Analysis Intelligence Index» colloca Kimi K3 in testa (~57, terzo assoluto), seguito da GLM-5.2 (51) e DeepSeek V4 Pro (44 con reasoning Max). I risultati di coding come SWE-bench (80,6% per DeepSeek V4 Pro Verified, 62,1% per GLM-5.2 Pro, 67,5–93,5% per Kimi K3) sono invece dichiarati dai produttori e usano varianti diverse del benchmark: non sono direttamente confrontabili tra loro.
Licenze: la differenza che pesa in produzione
Qui emerge lo scarto più rilevante. DeepSeek V4 Pro e GLM-5.2 sono già disponibili con pesi su Hugging Face sotto licenza MIT, quindi self-hostabili subito. Kimi K3 è invece solo via API e promette una «Modified MIT license» entro il 27 luglio 2026, con una clausola di attribuzione oltre i 100 milioni di utenti mensili. In pratica, il modello migliore sui benchmark indipendenti è anche il meno «aperto» oggi: un dettaglio che cambia la valutazione per chi vuole eseguire in casa.
Costi: cinque-diciassette volte di differenza
Sul prezzo API di listino il divario è marcato. DeepSeek V4 Pro costa 0,435/0,87 dollari per milione di token in input/output, contro 3,00/15,00 di Kimi K3 e 1,40/4,40 di GLM-5.2. Il costo misto per task stimato da Artificial Analysis è 0,04 dollari per V4 Pro, 0,32 per GLM-5.2 e 0,94 per K3. La sintesi ragionevole è che non c’è un vincitore unico: Kimi K3 guida sulle capacità, DeepSeek V4 Pro sul costo (fino a 5–17× più economico in output), GLM-5.2 su velocità (~168 token/s) e accessibilità immediata.
In sintesi
- I parametri totali sono tutti vendor-reported; per la capacità reale conta di più l’indice indipendente, che premia Kimi K3.
- I benchmark di coding usano varianti diverse e sono dichiarati dai produttori: da non confrontare uno a uno.
- Nessun vincitore assoluto: K3 per qualità, DeepSeek V4 Pro per costo, GLM-5.2 per velocità e licenza MIT già disponibile.
Hai qualcosa da aggiungere? Unisciti alla discussione.