#benchmark
risultati
-
SensorFM: il foundation model di Google per la salute da wearable
Google Research presenta SensorFM, un foundation model per dati da wearable pre-addestrato su oltre un trilione di minuti…
-
Databricks ha costruito un benchmark per i coding agent sulle proprie pull request
Databricks ha valutato modelli e harness per il coding partendo dalle pull request realmente mergiate dai suoi ingegneri.…
-
Datalab Lift: un extractor schema-first da 9B a confronto con NuExtract3, Gemini e Docling
Lift di Datalab è un modello vision da 9B che trasforma PDF e immagini in JSON conforme a…
-
OpenAI: circa il 30% dei task di SWE-Bench Pro e rotto
Un audit di OpenAI stima che circa il 30% dei task di SWE-Bench Pro sia difettoso, tra test…
-
SpaceXAI rilascia Grok 4.5, modello addestrato con Cursor per coding e task agentici
Grok 4.5 punta su coding, task agentici e knowledge work, addestrato insieme a Cursor. Il dato di spicco…
-
I modelli open-weight raggiungono i closed sui benchmark di ragionamento
Tre laboratori indipendenti pubblicano pesi liberi che pareggiano i risultati dei sistemi proprietari sui test di matematica e…