Articoli
firmati da questo autore
-
LLM cascade per la generazione RAG: partire dal modello piccolo, escalare solo se serve
Un benchmark su venti modelli locali contro un flagship hosted mostra che la dimensione non predice l’accuracy e che la leva più forte è…
-
Databricks introduce gli spend controls per l’AI in Unity AI Gateway
Unity AI Gateway aggiunge budget alert proattivi su utenti, workspace, use case e account per contenere la spesa AI prima che diventi un rischio.…
-
Come la FDA ha portato una piattaforma AI all’85% di utilizzo quotidiano
La FDA ha costruito su Databricks una piattaforma AI governata per i suoi 16.000 dipendenti, passata da meno dell’1% all’85% di adozione in circa…
-
Agentic retrieval su Amazon Bedrock: quando il single-shot non basta
La nuova API AgenticRetrieveStream delle Bedrock Managed Knowledge Bases decompone le domande multi-parte, itera e valuta la sufficienza. Su MuSiQue, +20% di recall assoluto.
-
Non hai ricevuto il modello AI che hai pagato: il routing rompe l’identità del modello
Il routing a livello di richiesta ha reso il model ID un identificatore legale, ma nessuno ha deciso cosa identifichi. Substitution, degradation, drift e…
-
Valutare gli agenti AI in produzione: il blueprint di Motorway e AWS
Motorway e AWS hanno costruito una pipeline di valutazione a tre layer per un agente conversazionale, portando le risposte sbagliate da 1 su 8…
-
Perché aggiungere più agenti AI ha reso il nostro sistema più lento
Scalando gli agenti LLM la latency saliva e arrivavano i timeout. La colpa non era di OpenAI: era il lavoro CPU dopo ogni risposta…
-
RAG: la maggior parte delle “allucinazioni” sono errori di extraction
Nel RAG il modello legge il contesto: se la risposta è sbagliata è quasi sempre un errore di extraction, non un’allucinazione. Sette pattern per…
-
Agentic AI in produzione: per l’85% delle aziende manca la data foundation
Il nuovo “Agentic AI readiness index 2026” di Fivetran dice che l’85% delle aziende esegue agenti su una data foundation non pronta. Non è…
-
Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026
Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la VRAM tra pesi, KV cache e…