#efficienza
risultati
-
Il collo di bottiglia dell’AI non è il compute, è spostare i dati
Sara A. Metwalli argomenta che i sistemi AI moderni non sono limitati dalla velocità di calcolo ma dalla…
-
Nemotron Labs 3 Puzzle 75B A9B: NVIDIA comprime un MoE ibrido per raddoppiare il throughput
NVIDIA comprime Nemotron-3-Super in una variante da 75,3B totali e 9,3B attivi, ottenendo fino a 2,14x di throughput…
-
Automatizzare le statistiche descrittive in Python: da df.describe() alle tabelle pronte da pubblicare
Una pipeline riutilizzabile per passare da un DataFrame grezzo a tabelle di sintesi formattate, senza reimplementare gli stessi…
-
SpaceXAI rilascia Grok 4.5, modello addestrato con Cursor per coding e task agentici
Grok 4.5 punta su coding, task agentici e knowledge work, addestrato insieme a Cursor. Il dato di spicco…
-
Le leggi di scala di Chinchilla: più dati, non solo più parametri
Il paper Chinchilla ha mostrato che molti LLM erano sottoaddestrati: a parità di budget di calcolo, conviene bilanciare…
-
Basta ottimizzare i kernel a mano: gli agenti AI arrivano su AWS Trainium
Le Neuron Agentic Development capabilities di AWS automatizzano l’ottimizzazione dei kernel su Trainium e Inferentia con agenti AI.…
-
Da partizioni a liquid clustering senza riscrivere la tabella: ora è GA su Databricks
Databricks rende GA la conversione di tabelle partizionate a liquid clustering: un solo ALTER TABLE, senza ricreare i…
-
Attenzione sparsa: il paper che potrebbe dimezzare i costi di inferenza
Un nuovo meccanismo di attenzione riduce la complessità quadratica a quasi-lineare senza perdere qualità. Spieghiamo come funziona.
-
LoRA e QLoRA: fine-tuning efficiente spiegato ai practitioner
Due tecniche che hanno democratizzato l’adattamento dei modelli. Comprendiamo la matematica, i trade-off e quando usare quale.