#inferenza
risultati
-
Analog AI: la fisica fa la moltiplicazione gratis, poi arriva il conto del rumore
Il calcolo analogico in-memory promette di far fare le matrici alla fisica invece che ai transistor. Un’analisi su…
-
srt-slurm: il framework NVIDIA per benchmark riproducibili di LLM serving su SLURM
srt-slurm di NVIDIA trasforma configurazioni YAML dichiarative in workflow di benchmark SLURM riproducibili per il serving distribuito di…
-
Nativ porta i modelli MLX in un’app desktop per Mac
Nativ incapsula MLX in un’applicazione desktop per macOS, con interfaccia di chat e API server locale. Un’alternativa in…
-
LLM cascade per la generazione RAG: partire dal modello piccolo, escalare solo se serve
Un benchmark su venti modelli locali contro un flagship hosted mostra che la dimensione non predice l’accuracy e…
-
Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026
Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la…
-
Cosa succede nei millisecondi dopo il tap: fraud detection sotto i 50 ms su Databricks
Una Databricks App che unisce Model Serving con route optimization e Lakebase Postgres per fare scoring delle transazioni…
-
Grok 4.3 arriva su Amazon Bedrock: reasoning configurabile e contesto da 1M per gli agenti
Il modello Grok 4.3 di xAI è ora in general availability su Amazon Bedrock, con reasoning effort configurabile,…
-
LiteRT.js: Google porta i modelli .tflite nel browser con WebGPU
Google ha rilasciato LiteRT.js, il binding JavaScript del suo runtime di inference on-device. Esegue modelli .tflite direttamente nel…
-
Bonsai 27B: Qwen3.6-27B in versione 1-bit e ternaria per laptop e telefoni
PrismML rilascia Bonsai 27B, build a bassissimo numero di bit di Qwen3.6-27B: la ternaria conserva il 94,6% della…
-
Ridurre latenza e costi di inference degli LLM in produzione: 12 leve pratiche
Scalare un’app LLM non significa aggiungere GPU, ma togliere lavoro inutile da ogni richiesta. Una rassegna di 12…