// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Databricks introduce il priority pay-per-token per le Foundation Model APIs

Il priority mode per le Foundation Model APIs pay-per-token di Databricks è GA per i modelli partner e in preview per gli open source, pensato per applicazioni real-time.

Databricks ha reso disponibile il priority pay-per-token, chiamato anche priority mode, per le Foundation Model APIs in modalità pay-per-token. La feature è generally available per i modelli partner e in preview per i modelli open source. È un aggiornamento piccolo nella forma ma rilevante per chi porta LLM in produzione su Databricks.

Cosa cambia

Il priority mode è pensato per applicazioni real-time e sensibili alla latenza, che hanno bisogno di una disponibilità più consistente sotto carico. È il punto centrale dell’annuncio: non un nuovo modello, ma una diversa classe di servizio sulla stessa modalità pay-per-token, dove paghi in base ai token consumati anziché su endpoint a throughput provisionato.

Perché conta per chi costruisce su LLM

Nelle applicazioni interattive — assistenti, RAG, funzioni agentiche — la variabilità della latenza sotto carico è spesso il vero problema, più del costo per token. Avere una corsia prioritaria sul pay-per-token consente di mantenere il modello di consumo flessibile (niente capacità da prenotare in anticipo) pur ottenendo maggiore consistenza quando il traffico cresce. È una via di mezzo utile tra il pay-per-token standard, comodo ma soggetto a contese sotto carico, e il provisioned throughput, prevedibile ma da dimensionare. In pratica, sposta la leva dal solo prezzo alla qualità del servizio: chi ha picchi di traffico imprevedibili può ridurre il rischio di degradi percepiti dall’utente senza rifare l’architettura di serving.

La distinzione tra disponibilità GA per i modelli partner e preview per gli open source è concreta: chi lavora con modelli open source dovrebbe trattare la feature come sperimentale e verificare la copertura effettiva. Databricks rimanda alla propria documentazione delle Foundation Model APIs per l’elenco dei modelli supportati in priority mode, che conviene consultare prima di progettare intorno a questa modalità.

In sintesi

  • Il priority pay-per-token è GA per i modelli partner e in preview per gli open source.
  • Serve ad applicazioni real-time e latency-sensitive che richiedono disponibilità più consistente sotto carico.
  • La disponibilità per modello va verificata nella documentazione delle Foundation Model APIs.

Fonte: Priority pay-per-token for Foundation Model APIs — https://docs.databricks.com/aws/en/release-notes/product/2026/july#priority-pay-per-token-for-foundation-model-apis

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma