#benchmark
risultati
-
Soofi S 30B-A3B: cosa succede quando cambi solo i dati e lasci l’architettura invariata
Un consorzio tedesco pubblica il pretraining report di Soofi S 30B-A3B, base model ibrido Mamba-Transformer MoE. Adottando l’architettura…
-
NeuroVFM: un foundation model per il neuroimaging addestrato su dati clinici non curati
NeuroVFM, foundation model per il neuroimaging dell’University of Michigan, è addestrato con Vol-JEPA su 5,24 milioni di volumi…
-
KAT-Coder-V2.5: coding agentico come problema di infrastruttura, non di scala
KwaiKAT rilascia KAT-Coder-V2.5, addestrato su oltre 100.000 ambienti-repository verificabili. AutoBuilder, audit dei sandbox e risultati sui benchmark.
-
Marker 2 di Datalab: 76,0 su olmOCR-bench a 2,9 pagine al secondo
Datalab riscrive da zero Marker: la modalità balanced segna 76,0% su olmOCR-bench a 2,9 pagine al secondo su…
-
Claude Opus 5: coding agentico allo stato dell’arte, prezzo Opus invariato
Anthropic rilascia Claude Opus 5: stesso prezzo di Opus 4.8, context da 1M token, thinking on di default…
-
Gigatoken: un tokenizer BPE in Rust che arriva a 24,53 GB/s
Gigatoken, tokenizer BPE in Rust sotto licenza MIT, arriva a 24,53 GB/s su GPT-2: 989x i tokenizers HuggingFace.…
-
Genie Code batte i coding agent generici su qualità e costo: cosa dice il benchmark Databricks
Un benchmark interno Databricks su 401 task reali: Genie Code raggiunge il 76,6% di accuratezza a 0,55 $/task,…
-
Capire i benchmark degli LLM: come leggerli senza farsi ingannare
Benchmark diversi misurano capacità diverse, con scoring non confrontabili. Una guida per leggere MMLU, GSM8k, HumanEval e gli…
-
Analizzare EdgeBench: tassonomia, leaderboard e scaling law degli agenti AI
Un tutorial per analizzare EdgeBench in Python: parsing dei task, leaderboard dal README, curve log-sigmoid sul tempo di…
-
Cisco Antares: SLM open-weight da 350M e 1B per la vulnerability localization
Cisco Foundation AI rilascia Antares, SLM open-weight da 350M e 1B per la vulnerability localization, con il benchmark…