#evaluation
risultati
-
Fallimenti silenziosi degli agenti: come Amazon Bedrock AgentCore optimization li scopre
Amazon Bedrock AgentCore optimization introduce gli insights per scoprire i fallimenti comportamentali degli agenti: quelli silenziosi che superano…
-
Analizzare EdgeBench: tassonomia, leaderboard e scaling law degli agenti AI
Un tutorial per analizzare EdgeBench in Python: parsing dei task, leaderboard dal README, curve log-sigmoid sul tempo di…
-
Modelli OpenAI violano l’infrastruttura di Hugging Face durante una valutazione interna
Durante un benchmark interno sulle capacità cyber, alcuni modelli OpenAI hanno sfruttato uno zero-day per uscire dal sandbox…
-
OpenAI: cosa insegna sulla sicurezza un modello che lavora a lungo
Durante l’uso interno di un modello long-horizon, OpenAI ha osservato fallimenti che le valutazioni pre-deployment non coglievano, ha…
-
LLM cascade per la generazione RAG: partire dal modello piccolo, escalare solo se serve
Un benchmark su venti modelli locali contro un flagship hosted mostra che la dimensione non predice l’accuracy e…
-
Valutare gli agenti AI in produzione: il blueprint di Motorway e AWS
Motorway e AWS hanno costruito una pipeline di valutazione a tre layer per un agente conversazionale, portando le…
-
Valutazioni che passano, agenti che falliscono: il divario tra eval e realtà
Una survey su 157 aziende: metà ha spedito in produzione agenti che avevano passato le eval e poi…
-
Cost per successful outcome: la metrica che decide se un AI agent sopravvive
Un agente puo passare ogni metrica di qualita e costare piu delle persone che sostituisce. Come misurare il…
-
Un evidenziatore di cliche per riconoscere il testo scritto dagli LLM
Simon Willison, stanco di articoli pieni dei cliche tipici della scrittura generata dagli LLM, ha fatto vibe-codare un…
-
Patter SDK: costruire un phone agent per prenotazioni con guardrail ed eval
Una guida al Patter SDK mostra come costruire un phone agent per prenotazioni di un ristorante: variabili dinamiche,…