Un team dell’University of Michigan ha presentato NeuroVFM, un foundation model visuale generalista per il neuroimaging, descritto in un lavoro pubblicato su Nature Medicine. L’idea di partenza affronta un limite noto: i modelli generici imparano soprattutto da dati web, dove le immagini cliniche di MRI e CT quasi non compaiono, anche perché contengono tratti facciali identificabili. Di conseguenza i modelli generici rendono poco sui compiti di brain imaging.
NeuroVFM è addestrato su 5,24 milioni di volumi clinici MRI e CT, provenienti da 566.915 studi del dataset UM-NeuroImages, raccolti in oltre due decenni di attività ordinaria. Gli autori chiamano questo approccio “health system learning”: il modello impara da dati non curati generati durante le normali operazioni cliniche, evitando il collo di bottiglia dei report radiologici accoppiati.
Come funziona Vol-JEPA
Alla base c’è Vol-JEPA, un algoritmo self-supervised e solo-visione che estende i metodi I-JEPA e V-JEPA alle immagini mediche volumetriche. Invece di ricostruire i pixel, predice rappresentazioni in uno spazio latente: non servono etichette, testo dei report né decoder voxel. Ogni volume 3D è tokenizzato in patch e diviso in un piccolo contesto visibile e un target mascherato più ampio; un teacher, media mobile esponenziale dello student, genera i latenti di riferimento.
Sui risultati, il team ha congelato ogni encoder e addestrato probe identiche. NeuroVFM raggiunge 92,68 di AUROC su CT e 92,49 su MRI come media macro su 156 compiti diagnostici, superando ogni baseline sull’endpoint aggregato. Poiché diversi baseline condividono lo stesso dato di addestramento, il confronto isola l’obiettivo: la predizione nello spazio latente batte sia la supervisione da report sia la ricostruzione voxel. Un run completo ha usato meno di 1.000 GPU hour.
Oltre alla diagnosi, il modello abilita generazione di referti, triage e predizioni ancorate alle regioni dell’immagine. In uno studio prospettico “silenzioso” di una settimana (n=1.155), NeuroVFM-LLaVA ha ottenuto 92,6% di accuratezza bilanciata nel triage contro 71,2% di GPT-5; la sensibilità però è stata dell’86,5%, con 21 casi critici su 155 non rilevati. Per questo gli autori lo inquadrano come supporto alle decisioni, non come screening autonomo. I pesi sono rilasciati con licenza non commerciale e il modello non è approvato dalla FDA.
In sintesi
- NeuroVFM impara da 5,24 milioni di volumi MRI e CT clinici non curati, senza supervisione da report.
- Vol-JEPA, self-supervised e solo-visione, raggiunge 92,68 AUROC su CT e 92,49 su MRI su 156 compiti.
- Utile come decision support: sensibilità dell’86,5% nel triage, pesi non commerciali e nessuna approvazione FDA.
Fonte: Meet NeuroVFM: A New Neuroimaging Foundation Model Trained With Vol-JEPA on Uncurated Clinical MRI and CT Volumes — marktechpost.com
Hai qualcosa da aggiungere? Unisciti alla discussione.