SpaceXAI ha rilasciato Grok 4.5, che l’azienda descrive come il suo modello più capace finora, orientato a coding, task agentici e knowledge work. L’elemento distintivo dichiarato è che il modello è stato addestrato insieme a Cursor, l’editor di coding AI. Per chi valuta modelli per pipeline di sviluppo e agenti, il punto più interessante non è tanto il picco di intelligenza quanto l’efficienza per token e il prezzo.
Training e benchmark
Il training è stato eseguito su decine di migliaia di GPU NVIDIA GB300, con tecniche di stabilità per run su larga scala e un investimento significativo in filtraggio e curation dei dati (deduplica, quality scoring, selezione per dominio). Il team ha poi scalato il reinforcement learning su centinaia di migliaia di task, in gran parte software engineering multi-step, con grading automatico e model-based e uno stack che supporta training altamente asincrono.
Sui benchmark, vale la pena notare l’onestà del quadro: nel grafico pubblicato da SpaceXAI stessa, Fable (max) ottiene il punteggio più alto su tutti e quattro i benchmark di coding, mentre Grok 4.5 resta più vicino su Terminal Bench 2.1 (83,3% contro 84,3% di Fable). Sugli altri: DeepSWE 1.0 pass@1 al 62,0% (Fable 66,1%, GPT 5.5 xhigh 64,31%), DeepSWE 1.1 al 53% (Fable 70%), SWE Bench Pro resolve rate al 64,7% (Fable 80,4%, Opus 4.8 max 69,2%).
Efficienza, prezzo e disponibilità
Il dato che spicca è la token efficiency: su SWE Bench Pro, Grok 4.5 ha risolto i task con una media di 15.954 output token, contro i 67.020 riportati per Opus 4.8 (max) sullo stesso benchmark, circa 4,2 volte in meno. Meno output token significa in genere costo di output e latenza per task più bassi. Il modello è servito a 80 TPS e ha un prezzo di 2 dollari per milione di input token e 6 dollari per milione di output token. SpaceXAI afferma inoltre che risolve i task in meno della metà dei passi.
Grok 4.5 (model ID grok-4.5) è disponibile in Grok Build, in Cursor su tutti i piani e dalla console SpaceXAI, e risulta al primo posto sul Legal Agent Benchmark di Harvey. Non è ancora disponibile nell’UE, con disponibilità attesa a metà luglio; è previsto un utilizzo gratuito a tempo limitato in Grok Build e Cursor. Come sempre, conviene verificare il prezzo aggiornato nella console prima di fare stime di budget.
- Grok 4.5 è addestrato insieme a Cursor e punta su coding, task agentici e knowledge work.
- La token efficiency è il punto forte: circa 4,2 volte meno output token di Opus 4.8 (max) su SWE Bench Pro, con serving a 80 TPS e prezzo di 2/6 dollari per milione di token input/output.
- Sui benchmark pubblicati da SpaceXAI, Fable (max) resta in testa su tutti e quattro; Grok 4.5 è più vicino su Terminal Bench 2.1.
Fonte: SpaceXAI Releases Grok 4.5, a Cursor-Trained Model for Coding, Agentic Tasks, and Knowledge Work at $2/M Input — https://www.marktechpost.com/2026/07/08/spacexai-releases-grok-4-5/
Hai qualcosa da aggiungere? Unisciti alla discussione.