#inferenza
risultati
-
Nemotron Labs 3 Puzzle 75B A9B: NVIDIA comprime un MoE ibrido per raddoppiare il throughput
NVIDIA comprime Nemotron-3-Super in una variante da 75,3B totali e 9,3B attivi, ottenendo fino a 2,14x di throughput…
-
Cross-region inference su Bedrock: usare gli LLM in Europa senza rinunciare alla compliance
Il Cross-Region Inference di Amazon Bedrock instrada le richieste tra più Region UE, conciliando accesso ai modelli più…
-
Attenzione sparsa: il paper che potrebbe dimezzare i costi di inferenza
Un nuovo meccanismo di attenzione riduce la complessità quadratica a quasi-lineare senza perdere qualità. Spieghiamo come funziona.