#evaluation
risultati
-
Non far correggere i compiti a Claude da solo: code review cross-provider con Codex
Un modello favorisce le proprie generazioni e non trova i propri errori. Ruben Broekx spiega come far revisionare…
-
Valutare un sistema RAG in produzione: dalla golden dataset alla CI
Una guida pratica per costruire una evaluation pipeline che intercetta fallimenti di retrieval, hallucination e drift prima che…
-
Real World VoiceEQ: misurare la qualità umana della voice AI
Hume AI e Hugging Face presentano Real World VoiceEQ, un benchmark che valuta oltre 40 modelli vocali su…
-
Prime Intellect rilascia Verifiers v1: taskset, harness e runtime componibili per l’RL agentico
Verifiers v1 scompone gli ambienti di reinforcement learning agentico in tre pezzi disaccoppiati, cosi’ che qualsiasi taskset possa…
-
La soglia di un agente non è una percentuale: è un prezzo
Perché fissare un ESCALATION_THRESHOLD = 0.90 uguale per ogni decisione è un errore, e come derivare la soglia…
-
Misurare la stabilita dei modelli econometrici, oltre l’accuratezza
Nel forecasting di serie storiche, la stabilita di un modello (come impara) e distinta dall’accuratezza (cosa impara) ma…
-
OpenAI: circa il 30% dei task di SWE-Bench Pro e rotto
Un audit di OpenAI stima che circa il 30% dei task di SWE-Bench Pro sia difettoso, tra test…
-
Perché gli LLM allucinano: cosa dice la ricerca
Le allucinazioni dei modelli linguistici non sono un bug occasionale ma una proprietà del modo in cui funzionano.…
-
olmo-eval: un banco di prova open source per valutare gli LLM durante lo sviluppo
AllenAI rilascia olmo-eval, un workbench open source per valutare i modelli linguistici durante il loop di sviluppo. Cos’è,…