La premessa è che una GPU spende gran parte dell’energia non a fare conti, ma a spostare numeri: prelevare i pesi dalla memoria, portarli all’unità di calcolo, riportare indietro il risultato. Su questo sfondo torna un’idea vecchia quanto il calcolo digitale: usare circuiti analogici, con tensioni e correnti continue, per le moltiplicazioni matriciali che dominano l’inference.
Un’analisi di Ferran Alia su Towards Data Science ricostruisce il meccanismo e — cosa più utile — lo simula, mostrando esattamente dove si rompe.
Il meccanismo
Nell’analog in-memory computing (AIMC) i pesi sono conduttanze fisiche in una griglia di celle di memoria, spesso phase-change memory o resistive RAM. Si applica l’input come tensione e due leggi della fisica fanno il resto: la legge di Ohm calcola ogni moltiplicazione, la legge di Kirchhoff sulle correnti calcola l’accumulazione. Un intero prodotto matrice-vettore in un solo passo fisico, senza bus.
C’è un’ironia al centro del campo, che l’articolo non nasconde: la moltiplicazione è essenzialmente gratis, ma input e output devono attraversare il confine tra analogico e digitale, e in pratica ADC e DAC si mangiano spesso la fetta più grossa di energia e area, più della crossbar stessa.
Il contesto energetico è quello che rende l’idea di nuovo attraente: Gartner stima la domanda di potenza dei data center globali in crescita da 104 gigawatt nel 2025 a 132 nel 2026, fino a circa 290 gigawatt entro il 2030, con i workload di AI generativa indicati come driver principale.
Dove si rompe
Qui l’articolo fa la cosa giusta: invece di citare claim, simula. Aggiungendo a una moltiplicazione matriciale il rumore di programmazione, il rumore di lettura e una quantizzazione ADC a 4 bit, l’errore relativo supera l’8% su un singolo layer, prima di qualunque effetto di composizione su una rete profonda.
Su una rete addestrata normalmente e valutata attraverso un layer analogico simulato, la degradazione non è graduale: sotto una deviazione standard del rumore di circa 0,1 l’accuratezza quasi non si muove, poi crolla — 83% a 0,2, 64% a 0,4, vicino al caso a 0,8. Non è una tassa lieve sull’accuratezza, è una soglia.
La risposta della ricerca non è solo hardware più silenzioso: è addestrare la rete iniettando il rumore del target durante il training. Ripetendo l’esperimento, a rumore zero i due modelli sono statisticamente identici, ma a deviazione standard 0,6 il modello addestrato normalmente è crollato al 39% mentre quello noise-aware tiene il 61%. Nessuno dei due è immune, ma uno degrada come un sistema progettato per quella condizione.
Cosa tenere
La riga che conta per chi valuta: l’hardware analogico sembra credibile per l’inference, soprattutto edge, non per il training, dove le richieste di precisione della backpropagation restano un problema aperto. Il track record commerciale è misto — IBM resta prevalentemente in modalità ricerca, EnCharge AI dichiara circa 20 volte meno energia rispetto a chip digitali comparabili, ma il claim è ancora largamente pre-commerciale.
In sintesi
- L’AIMC elimina il movimento dei dati, ma ADC e DAC si riprendono buona parte del risparmio.
- Il rumore non degrada l’accuratezza in modo graduale: c’è una soglia oltre la quale la rete crolla.
- Il noise-injection training non costa nulla su hardware pulito e limita molto i danni su hardware rumoroso.
Hai qualcosa da aggiungere? Unisciti alla discussione.