OpenAI ha portato in general availability la famiglia GPT-5.6 dopo una preview limitata. Non un modello ma tre: Sol come flagship, Terra come livello intermedio e Luna come opzione più economica. I prezzi per milione di token vanno da 1/6 dollari (input/output) di Luna a 2,50/15 di Terra fino a 5/30 di Sol.
La novità che interessa di più chi costruisce pipeline e agenti non è il ranking sui benchmark, ma un meccanismo nuovo dell’API.
Programmatic Tool Calling
Con il Programmatic Tool Calling il modello compone ed esegue JavaScript in un runtime V8 isolato e senza accesso di rete, orchestrando le chiamate ai tool via codice invece che con una sequenza di tool call separate. MarkTechPost riporta riduzioni di token, su clienti citati per nome, tra il 38% e il 63,5%. Nella Responses API arriva anche una modalità multi-agent in beta, che permette al modello di generare subagent per lavoro parallelo.
I numeri, letti con prudenza
Sull’Artificial Analysis Coding Agent Index Sol tocca 80, 2,8 punti sopra Claude Fable 5, usando — secondo OpenAI — meno della metà dei token di output e del tempo. Su Agents’ Last Exam Sol segna 53,6. Su OSWorld 2.0 arriva a 62,6% superando Claude Opus 4.8 con l’85% di token in meno.
Il quadro non è però univoco: su SWE-Bench Pro Sol si ferma al 64,6% contro l’80,3% di Claude Mythos 5, un divario di circa 15 punti su un benchmark di coding molto seguito. Vale la solita cautela: le tabelle sono pubblicate da OpenAI e i rivali sono mostrati nelle loro configurazioni migliori.
In sintesi
- GPT-5.6 arriva in tre tier (Sol, Terra, Luna) con prezzi da 1/6 a 5/30 dollari per milione di token.
- Il Programmatic Tool Calling esegue JavaScript in un sandbox V8 per orchestrare i tool, con riduzioni di token dichiarate fino al 63,5%.
- Sol guida diverse eval agentiche ma resta indietro sul coding di SWE-Bench Pro.
Hai qualcosa da aggiungere? Unisciti alla discussione.