#benchmark
risultati
-
Poolside rilascia Laguna S 2.1: un coding model MoE open-weight da 118B che gira su un DGX Spark
Poolside pubblica Laguna S 2.1, un coding model MoE open-weight da 118B totali e 8B attivi con context…
-
srt-slurm: il framework NVIDIA per benchmark riproducibili di LLM serving su SLURM
srt-slurm di NVIDIA trasforma configurazioni YAML dichiarative in workflow di benchmark SLURM riproducibili per il serving distribuito di…
-
Google spinge la serie Gemini Flash su efficienza e prezzo: 3.6 Flash, 3.5 Flash-Lite e Flash Cyber
Google aggiorna il tier Flash di Gemini puntando su token efficiency e costi più bassi. La 3.6 Flash…
-
Tabular foundation model: un modello da 28M di parametri batte XGBoost tunato
Sul benchmark TabArena ogni singolo modello sopra il miglior gradient-boosted tree tunato è un tabular foundation model. Una…
-
SQRL: modelli text-to-SQL che ispezionano il database prima di scrivere la query
SQRL di Feyn AI ispeziona il database in sola lettura prima di impegnare la query: 70,6% di execution…
-
WANDR: il benchmark di Perplexity che chiede agli agenti di cercare largo e profondo
Perplexity presenta WANDR, benchmark aperto per research agent che devono cercare largo e profondo: metodo solido, ma risultati…
-
Il context engineering non basta: un esperimento di loop engineering senza LLM nel loop
Un benchmark Python deterministico e senza dipendenze isola una singola proprietà del loop engineering: la failure isolation. Un…
-
Moonshot AI rilascia Kimi K3: un MoE open da 2,8 trilioni di parametri con contesto da 1M
Kimi K3 è un Mixture-of-Experts open da 2,8T di parametri con Kimi Delta Attention e finestra di contesto…
-
Soofi S 30B-A3B: un foundation model open Mamba-Transformer MoE per tedesco e inglese
Un consorzio di ricerca tedesco rilascia Soofi S 30B-A3B, un base model ibrido Mamba-Transformer MoE che attiva 3,2B…
-
Thinking Machines Lab rilascia Inkling, MoE multimodale da 975B a pesi aperti
Inkling è un Mixture-of-Experts da 975B parametri totali (41B attivi) con contesto fino a 1M token, input testo-immagini-audio…