#benchmark
risultati
-
Tabular foundation model: un modello da 28M di parametri batte XGBoost tunato
Sul benchmark TabArena ogni singolo modello sopra il miglior gradient-boosted tree tunato è un tabular foundation model. Una…
-
SQRL: modelli text-to-SQL che ispezionano il database prima di scrivere la query
SQRL di Feyn AI ispeziona il database in sola lettura prima di impegnare la query: 70,6% di execution…
-
WANDR: il benchmark di Perplexity che chiede agli agenti di cercare largo e profondo
Perplexity presenta WANDR, benchmark aperto per research agent che devono cercare largo e profondo: metodo solido, ma risultati…
-
Il context engineering non basta: un esperimento di loop engineering senza LLM nel loop
Un benchmark Python deterministico e senza dipendenze isola una singola proprietà del loop engineering: la failure isolation. Un…
-
Moonshot AI rilascia Kimi K3: un MoE open da 2,8 trilioni di parametri con contesto da 1M
Kimi K3 è un Mixture-of-Experts open da 2,8T di parametri con Kimi Delta Attention e finestra di contesto…
-
Soofi S 30B-A3B: un foundation model open Mamba-Transformer MoE per tedesco e inglese
Un consorzio di ricerca tedesco rilascia Soofi S 30B-A3B, un base model ibrido Mamba-Transformer MoE che attiva 3,2B…
-
Thinking Machines Lab rilascia Inkling, MoE multimodale da 975B a pesi aperti
Inkling è un Mixture-of-Experts da 975B parametri totali (41B attivi) con contesto fino a 1M token, input testo-immagini-audio…
-
Real World VoiceEQ: misurare la qualità umana della voice AI
Hume AI e Hugging Face presentano Real World VoiceEQ, un benchmark che valuta oltre 40 modelli vocali su…
-
Mistral Vibe, Claude Code, Cursor e Codex a confronto su un task scaffold-to-PR
MarkTechPost mette a confronto quattro coding agent su un unico workflow di ingegneria (scaffold, test, PR), valutando funzionalità…
-
Claude Sonnet 5 contro Sonnet 4.6 e Opus 4.8: benchmark, prezzi e trade-off
Anthropic ha rilasciato Claude Sonnet 5, il suo modello mid-tier più agentico: batte Sonnet 4.6 su ogni benchmark…