#inferenza
risultati
-
srt-slurm: il framework NVIDIA per benchmark riproducibili di LLM serving su SLURM
srt-slurm di NVIDIA trasforma configurazioni YAML dichiarative in workflow di benchmark SLURM riproducibili per il serving distribuito di…
-
Nativ porta i modelli MLX in un’app desktop per Mac
Nativ incapsula MLX in un’applicazione desktop per macOS, con interfaccia di chat e API server locale. Un’alternativa in…
-
LLM cascade per la generazione RAG: partire dal modello piccolo, escalare solo se serve
Un benchmark su venti modelli locali contro un flagship hosted mostra che la dimensione non predice l’accuracy e…
-
Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026
Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la…
-
Cosa succede nei millisecondi dopo il tap: fraud detection sotto i 50 ms su Databricks
Una Databricks App che unisce Model Serving con route optimization e Lakebase Postgres per fare scoring delle transazioni…
-
Grok 4.3 arriva su Amazon Bedrock: reasoning configurabile e contesto da 1M per gli agenti
Il modello Grok 4.3 di xAI è ora in general availability su Amazon Bedrock, con reasoning effort configurabile,…
-
LiteRT.js: Google porta i modelli .tflite nel browser con WebGPU
Google ha rilasciato LiteRT.js, il binding JavaScript del suo runtime di inference on-device. Esegue modelli .tflite direttamente nel…
-
Bonsai 27B: Qwen3.6-27B in versione 1-bit e ternaria per laptop e telefoni
PrismML rilascia Bonsai 27B, build a bassissimo numero di bit di Qwen3.6-27B: la ternaria conserva il 94,6% della…
-
Ridurre latenza e costi di inference degli LLM in produzione: 12 leve pratiche
Scalare un’app LLM non significa aggiungere GPU, ma togliere lavoro inutile da ogni richiesta. Una rassegna di 12…
-
Quanto costa davvero far girare un LLM in locale? Euro per milione di token, misurati
Un benchmark misura il costo in energia GPU di otto modelli locali su una singola RTX 3090. Il…