Paper
Ricerca e letteratura, spiegata
risultati
-
Il J-lens di Anthropic: guardare cosa un LLM sta calcolando prima che lo scriva
Anthropic ha costruito il Jacobian lens per osservare i layer intermedi di Claude Opus 4.6. In un caso…
-
Databricks misura i coding agent sul proprio codice: cosa cambia su costi e modelli
Databricks ha costruito un benchmark interno sui propri milioni di righe di codice per capire quale coding agent…
-
SensorFM: il foundation model di Google per la salute da wearable
Google Research presenta SensorFM, un foundation model per dati da wearable pre-addestrato su oltre un trilione di minuti…
-
LingBot-World-Infinity: il world model causale open di Robbyant con un harness agentico
Robbyant (Ant Group) rilascia un world model causale da 14B che si comporta come un simulatore interattivo, con…
-
Riassumere video in locale con SmolVLM2-2.2B su una GPU consumer
SmolVLM2-2.2B gira su 5,2 GB di GPU RAM e regge il confronto con modelli più grandi sui benchmark…
-
Nemotron Labs 3 Puzzle 75B A9B: NVIDIA comprime un MoE ibrido per raddoppiare il throughput
NVIDIA comprime Nemotron-3-Super in una variante da 75,3B totali e 9,3B attivi, ottenendo fino a 2,14x di throughput…
-
SpaceXAI rilascia Grok 4.5, modello addestrato con Cursor per coding e task agentici
Grok 4.5 punta su coding, task agentici e knowledge work, addestrato insieme a Cursor. Il dato di spicco…
-
DPO: allineare i modelli alle preferenze umane senza reinforcement learning
La Direct Preference Optimization allinea gli LLM alle preferenze umane senza la complessità del reinforcement learning. Spieghiamo l’idea…
-
Le leggi di scala di Chinchilla: più dati, non solo più parametri
Il paper Chinchilla ha mostrato che molti LLM erano sottoaddestrati: a parità di budget di calcolo, conviene bilanciare…
-
Chain-of-Thought: perché chiedere a un modello di “ragionare a voce alta” funziona
Il chain-of-thought prompting migliora il ragionamento degli LLM facendoli esplicitare i passaggi intermedi. Spieghiamo il paper che ha…