// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

BYOKG e GraphRAG per la ricerca farmaceutica su AWS

Un’architettura GraphRAG con Neptune Analytics, Bedrock e il toolkit open source BYOKG-RAG per interrogare in linguaggio naturale un grafo scientifico. Il pattern conta più delle percentuali.

AWS descrive un’architettura GraphRAG per la ricerca farmaceutica che combina un knowledge graph su Amazon Neptune Analytics con i modelli di Amazon Bedrock. Il problema di partenza è reale: nella drug discovery le informazioni sono sparse tra letteratura pubblicata (PubMed), note di laboratorio interne e database genomici, e questa frammentazione rallenta le connessioni tra dati e la generazione di ipotesi. AWS cita un tasso di successo del 5 percento nello screening iniziale e oltre sei mesi per tentativo. È un post di prodotto, quindi le metriche vanno prese con le pinze.

L’approccio

Il cuore è un pattern Bring Your Own Knowledge Graph (BYOKG): un grafo che integra entità scientifiche — malattie, autori, journal, chunk di journal, codici ICD-10 — costruito da fonti come il PMC Open Access Subset, la Disease Ontology e Amazon Comprehend Medical per il linking ICD-10-CM. Su questo grafo, il toolkit open source BYOKG-RAG di awslabs abilita il natural language querying: si fa una domanda in inglese e si ottiene una risposta ancorata a citazioni e percorsi di traversal nel grafo.

Lato codice, il notebook di esempio usa il pacchetto graphrag-toolkit con il modello Claude 4.5 Sonnet su Bedrock. I componenti sono modulari: un generator basato su Bedrock, un KGLinker che interroga il grafo e genera le risposte, e un EntityLinker che usa un fuzzy string index per collegare il testo alle entità del grafo — utile in contesti healthcare rumorosi. La separazione tra inizializzazione LLM, interfaccia al grafo ed entity linking rende l’estensione ad altri domini più semplice.

Le metriche, con cautela

Qui il post AWS diventa entusiasta: cicli di ricerca da sei mesi a tre settimane (un +87 percento di efficienza), hit rate quintuplicato, e ancora 70 percento in meno di tempo di review, 85 percento di accesso ai dati più rapido, 90 percento di uso della conoscenza migliorato. Sono numeri di una singola implementazione, senza metodologia condivisa: interessanti come direzione, non come benchmark. Il costo dichiarato per l’ambiente demo è più concreto — ad esempio 0,48 dollari all’ora per il grafo Neptune Analytics a 16 mNCU.

Il valore trasferibile, al netto del marketing, è il pattern: un grafo che rende esplicite le relazioni e un layer RAG che restituisce risposte tracciabili con citazioni e percorsi. Per chi lavora su dati con integrità e auditabilità stringenti, la parte sui citation path è più rilevante delle percentuali.

In sintesi

  • GraphRAG con Neptune Analytics e Bedrock più il toolkit open source BYOKG-RAG per querying in linguaggio naturale su un grafo scientifico.
  • Stack: graphrag-toolkit, Claude 4.5 Sonnet, componenti modulari (KGLinker, EntityLinker con fuzzy matching).
  • Metriche promozionali da una sola implementazione; il pattern con citation path e traversal è la parte davvero utile.

Fonte: Powering scientific discovery: BYOKG and GraphRAG for intelligent pharmaceutical research

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma