Gli LLM agentici tendono a fallire sempre negli stessi modi. Un gruppo di ricerca di Stanford ha ricondotto questi errori a capacità riutilizzabili mancanti e ha costruito TRACE (Turning Recurrent Agent failures into Capability-targeted training Environments), rilasciato open source con licenza MIT. Il tema conta perché propone un modo più efficiente di spendere il budget di training rispetto a RL/SFT con reward sparse o dati sintetici non mirati.
L’osservazione di base è che i fallimenti non sono casuali: un piccolo insieme di deficit spiega la maggior parte delle traiettorie fallite, quindi ogni deficit ricorrente può diventare un segnale di training denso e verificabile.
Come funziona
La pipeline è automatizzata in quattro passi, ciascuno guidato da un agente LLM su prompt in markdown. La contrastive capability analysis divide le rollout in successi e fallimenti ed etichetta ogni coppia traiettoria-capacità; una capacità viene tenuta solo se contrastiva e ad alta copertura (gap δ = 0,20 e coverage ρ = 0,10). La targeted environment synthesis costruisce un ambiente sintetico per ogni capacità, con task generati proceduralmente da seed casuali e reward algoritmiche, senza label umane o LLM judge. Il capability adapter training allena un adapter LoRA per capacità con GRPO, mantenendo il modello base congelato. Infine la MoE composition compone gli adapter in un Mixture-of-Experts con gate a livello di token, allenando solo i gate: a inference ogni token viene instradato top-1 a un singolo adapter.
Su τ²-Bench l’analisi ha recuperato quattro deficit stabili su dieci run: structured data reasoning, multi-step task completion, precondition verification e tool calling precision.
I risultati
TRACE è stato testato su due backbone e due benchmark: τ²-Bench (50 task airline e 114 retail) e SWE-bench Verified (500 issue GitHub reali, Pass@1). Su Qwen3-30B-A3B, TRACE porta τ²-Bench da 32,9% a 48,2% e SWE-bench Verified da 26,0% a 41,0%, superando i baseline esterni più forti GEPA e SWE-RL rispettivamente di +8,6 e +8,4 punti, con meno di un quarto delle rollout. Su Qwen3.6-27B raggiunge il 73,2% Pass@1 su SWE-bench Verified, sopra GPT-5.2-Codex (72,8%) nella leaderboard pubblica.
- Il contrasto tra traiettorie riuscite e fallite fa emergere deficit addestrabili, non generiche etichette di errore.
- Ogni adapter LoRA aggiunge circa 1,6B parametri (5,3% del backbone); il gate MoE appena 491.760 parametri.
- La composizione con routing a token batte il miglior singolo adapter di oltre sette punti.
Fonte: Stanford Researchers Introduce TRACE — https://www.marktechpost.com/2026/07/13/stanford-researchers-introduce-trace/
Hai qualcosa da aggiungere? Unisciti alla discussione.