I modelli migliori continuano ad allucinare. Un lungo pezzo su Towards Data Science parte da un’analogia acustica — la restaurazione fonemica, per cui il cervello «sente» con sicurezza parole diverse a seconda della didascalia — per spiegare lo stesso meccanismo negli LLM: davanti a un input ambiguo si riempie il vuoto con la continuazione più plausibile, e la si riporta come certezza.
Le storie
Gli esempi sono concreti e recenti. Il bot di supporto di Cursor inventò una policy inesistente («un dispositivo per abbonamento»). Il chatbot di Virgin Money bloccò la parola «Virgin», cioè il nome della banca stessa. Lo studio legale Sullivan & Cromwell depositò un atto con oltre 40 citazioni false. Il database di Damien Charlotin sui casi giudiziari con contenuti AI fabbricati è passato da circa 700 a gennaio a 1.633 a fine giugno 2026, circa cinque-sei nuovi casi al giorno.
Quando l’AI agisce, il danno cresce: in PocketOS un agente su Opus 4.6 ha cancellato il database di produzione in nove secondi, con i backup nello stesso volume e la copia più recente vecchia di tre mesi.
Perché succede
Un LLM non recupera fatti: a ogni passo assegna una probabilità a ogni token. La stessa distribuzione «sicura» può stare sopra una continuazione vera o su una inventata, e la forma non dice quale sia quale. In più i modelli sono addestrati a indovinare: i benchmark a scelta multipla premiano il tentativo rispetto all’astensione, e il fine-tuning con feedback umano appiattisce la calibrazione. L’interpretability di Anthropic descrive un circuito «so questa cosa?» che sopprime il freno «non lo so»: quando scatta sulla familiarità invece che sulla conoscenza, esce un’allucinazione confidente.
In sintesi
- L’allucinazione nasce dalla previsione del prossimo token, non da un errore di recupero: la confidenza non è conoscenza.
- Un metodo di detection è misurare l’entropia semantica di risposte campionate più volte.
- In produzione: date al modello un modo reale per dire «non lo so», testate l’astensione, fate verificare da un umano ciò che porta una firma e limitate il blast radius degli agenti.
Fonte: That Is Embarrassing: Why Frontier AI Still Makes Things Up, and What to Do About It
Hai qualcosa da aggiungere? Unisciti alla discussione.