#benchmark
risultati
-
Real World VoiceEQ: misurare la qualità umana della voice AI
Hume AI e Hugging Face presentano Real World VoiceEQ, un benchmark che valuta oltre 40 modelli vocali su…
-
Mistral Vibe, Claude Code, Cursor e Codex a confronto su un task scaffold-to-PR
MarkTechPost mette a confronto quattro coding agent su un unico workflow di ingegneria (scaffold, test, PR), valutando funzionalità…
-
Claude Sonnet 5 contro Sonnet 4.6 e Opus 4.8: benchmark, prezzi e trade-off
Anthropic ha rilasciato Claude Sonnet 5, il suo modello mid-tier più agentico: batte Sonnet 4.6 su ogni benchmark…
-
Bonsai 27B: Qwen3.6-27B in versione 1-bit e ternaria per laptop e telefoni
PrismML rilascia Bonsai 27B, build a bassissimo numero di bit di Qwen3.6-27B: la ternaria conserva il 94,6% della…
-
@clickhouse/rowbinary: una libreria che è anche una Agent Skill per generare parser
ClickHouse ha rilasciato @clickhouse/rowbinary, reader e writer Node.js per i formati RowBinary che funziona anche come Agent Skill:…
-
NeuroVFM: un foundation model per il neuroimaging addestrato con Vol-JEPA su MRI e CT clinici non curati
Un team dell’University of Michigan pubblica su Nature Medicine NeuroVFM, un modello che impara anatomia e patologia del…
-
TRACE: Stanford trasforma i fallimenti ricorrenti degli agenti in ambienti RL mirati
TRACE diagnostica le capacità mancanti di un agente, genera un ambiente verificabile per ogni gap, addestra un adapter…
-
GPT-5.6 Sol, Terra e Luna disponibili in GA su Amazon Bedrock
OpenAI porta la famiglia GPT-5.6 in general availability su Amazon Bedrock con tre tier (Sol, Terra, Luna), prompt…
-
Fivetran Enterprise Data Infrastructure Benchmark 2026: i costi nascosti delle pipeline
Il benchmark 2026 di Fivetran su oltre 500 leader stima 29,3 milioni di spesa annua sui dati e…
-
Databricks misura i coding agent sul proprio codice: cosa cambia su costi e modelli
Databricks ha costruito un benchmark interno sui propri milioni di righe di codice per capire quale coding agent…