#serving
risultati
-
Databricks AI Search: la modalità High QPS diventa generally available
Su Databricks è ora in GA la modalità High QPS per gli endpoint standard di AI Search: si…
-
Netflix e il serving degli LLM in casa: perché reinternalizzare l’inferenza
Perché Netflix ha scelto di costruire una piattaforma interna per il serving degli LLM: controllo, latenza, costi e…
-
Cosa succede nei millisecondi dopo il tap: fraud detection sotto i 50 ms su Databricks
Una Databricks App che unisce Model Serving con route optimization e Lakebase Postgres per fare scoring delle transazioni…
-
Disaggregated prefill e decode per l’inference LLM su SageMaker HyperPod
Il DPD dell’HyperPod Inference Operator separa prefill e decode su pool di GPU distinti collegati via EFA RDMA,…
-
SageMaker HyperPod: cinque nuove funzionalità per l’inference enterprise
Amazon aggiunge a SageMaker HyperPod inference il data capture multi-tier, il deploy diretto da Hugging Face Hub, il…
-
I modelli Hugging Face arrivano su Foundry Managed Compute di Microsoft
Microsoft porta un catalogo curato di modelli open-weight di Hugging Face su Foundry Managed Compute: weight pre-caricati in…