Databricks ha reso disponibile il priority pay-per-token, chiamato anche priority mode, per le Foundation Model APIs in modalità pay-per-token. La feature è generally available per i modelli partner e in preview per i modelli open source. È un aggiornamento piccolo nella forma ma rilevante per chi porta LLM in produzione su Databricks.
Cosa cambia
Il priority mode è pensato per applicazioni real-time e sensibili alla latenza, che hanno bisogno di una disponibilità più consistente sotto carico. È il punto centrale dell’annuncio: non un nuovo modello, ma una diversa classe di servizio sulla stessa modalità pay-per-token, dove paghi in base ai token consumati anziché su endpoint a throughput provisionato.
Perché conta per chi costruisce su LLM
Nelle applicazioni interattive — assistenti, RAG, funzioni agentiche — la variabilità della latenza sotto carico è spesso il vero problema, più del costo per token. Avere una corsia prioritaria sul pay-per-token consente di mantenere il modello di consumo flessibile (niente capacità da prenotare in anticipo) pur ottenendo maggiore consistenza quando il traffico cresce. È una via di mezzo utile tra il pay-per-token standard, comodo ma soggetto a contese sotto carico, e il provisioned throughput, prevedibile ma da dimensionare. In pratica, sposta la leva dal solo prezzo alla qualità del servizio: chi ha picchi di traffico imprevedibili può ridurre il rischio di degradi percepiti dall’utente senza rifare l’architettura di serving.
La distinzione tra disponibilità GA per i modelli partner e preview per gli open source è concreta: chi lavora con modelli open source dovrebbe trattare la feature come sperimentale e verificare la copertura effettiva. Databricks rimanda alla propria documentazione delle Foundation Model APIs per l’elenco dei modelli supportati in priority mode, che conviene consultare prima di progettare intorno a questa modalità.
In sintesi
- Il priority pay-per-token è GA per i modelli partner e in preview per gli open source.
- Serve ad applicazioni real-time e latency-sensitive che richiedono disponibilità più consistente sotto carico.
- La disponibilità per modello va verificata nella documentazione delle Foundation Model APIs.
Fonte: Priority pay-per-token for Foundation Model APIs — https://docs.databricks.com/aws/en/release-notes/product/2026/july#priority-pay-per-token-for-foundation-model-apis
Hai qualcosa da aggiungere? Unisciti alla discussione.