#benchmark
risultati
-
Marker 2 di Datalab: 76,0 su olmOCR-bench a 2,9 pagine al secondo
Datalab riscrive da zero Marker: la modalità balanced segna 76,0% su olmOCR-bench a 2,9 pagine al secondo su…
-
Claude Opus 5: coding agentico allo stato dell’arte, prezzo Opus invariato
Anthropic rilascia Claude Opus 5: stesso prezzo di Opus 4.8, context da 1M token, thinking on di default…
-
Gigatoken: un tokenizer BPE in Rust che arriva a 24,53 GB/s
Gigatoken, tokenizer BPE in Rust sotto licenza MIT, arriva a 24,53 GB/s su GPT-2: 989x i tokenizers HuggingFace.…
-
Genie Code batte i coding agent generici su qualità e costo: cosa dice il benchmark Databricks
Un benchmark interno Databricks su 401 task reali: Genie Code raggiunge il 76,6% di accuratezza a 0,55 $/task,…
-
Capire i benchmark degli LLM: come leggerli senza farsi ingannare
Benchmark diversi misurano capacità diverse, con scoring non confrontabili. Una guida per leggere MMLU, GSM8k, HumanEval e gli…
-
Analizzare EdgeBench: tassonomia, leaderboard e scaling law degli agenti AI
Un tutorial per analizzare EdgeBench in Python: parsing dei task, leaderboard dal README, curve log-sigmoid sul tempo di…
-
Cisco Antares: SLM open-weight da 350M e 1B per la vulnerability localization
Cisco Foundation AI rilascia Antares, SLM open-weight da 350M e 1B per la vulnerability localization, con il benchmark…
-
Poolside rilascia Laguna S 2.1: un coding model MoE open-weight da 118B che gira su un DGX Spark
Poolside pubblica Laguna S 2.1, un coding model MoE open-weight da 118B totali e 8B attivi con context…
-
srt-slurm: il framework NVIDIA per benchmark riproducibili di LLM serving su SLURM
srt-slurm di NVIDIA trasforma configurazioni YAML dichiarative in workflow di benchmark SLURM riproducibili per il serving distribuito di…
-
Google spinge la serie Gemini Flash su efficienza e prezzo: 3.6 Flash, 3.5 Flash-Lite e Flash Cyber
Google aggiorna il tier Flash di Gemini puntando su token efficiency e costi più bassi. La 3.6 Flash…