// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Multi-dataset Topics in Amazon QuickSight: un semantic layer su più dataset

In public preview, i multi-dataset Topics di QuickSight permettono di collegare fino a 12 dataset in un unico Topic e lasciare che l’agente di chat generi i join tra tabelle a partire dalle relazioni definite.

Amazon QuickSight introduce in public preview i multi-dataset Topics, una funzione che cambia il modo in cui si costruisce il semantic layer per la natural language query (NLQ). Fino a oggi QuickSight rappresentava un dataset come un’unica tabella appiattita: se la sorgente conteneva più tabelle, bisognava unirle a monte nella fase di data preparation. Con i multi-dataset Topics si possono invece aggiungere fino a 12 dataset a un singolo Topic, definire le relazioni tra loro e lasciare che l’agente di chat attraversi quelle relazioni per rispondere alle domande. I dati restano normalizzati e la governance rimane centralizzata.

Come funziona

Il Topic è il livello semantico tra i dati grezzi e gli utenti di business: raccoglie metadati, regole di business, relazioni e contesto che il motore NLQ usa per tradurre le domande in query analitiche. L’architettura si articola su quattro livelli: le sorgenti dati (in public preview il supporto si estende dal solo SPICE anche al Direct Query verso Amazon Redshift, Athena, S3 Tables, Snowflake e Databricks), l’arricchimento di ogni dataset con descrizioni di colonna, sinonimi e tipi semantici, il Topic multi-dataset con relazioni e custom instructions, e infine il consumo tramite chat e analysis sheet.

Quando un utente pone una domanda che tocca più dataset, il motore esegue quattro passi: interpreta l’intento mappando i termini alle colonne, attraversa il grafo delle relazioni per individuare il percorso di join più breve, genera la query SQL con le clausole JOIN e le aggregazioni appropriate, e presenta il risultato come tabella o visualizzazione. Il processo è trasparente: l’SQL generato resta ispezionabile per verificare quali dataset e join sono stati usati.

Cosa serve per iniziare

Le relazioni si definiscono caricando un file JSON che mappa le chiavi di join tra coppie di dataset, seguendo il pattern star schema con una fact table centrale collegata a dimension table condivise; AWS raccomanda di evitare join circolari e relazioni many-to-many. Le custom instructions agiscono come regole di business persistenti, ad esempio per definire un anno fiscale che parte dal 1 aprile o per fissare la formula del “return rate”. La sicurezza row-level e column-level resta applicata a livello di dataset, quindi i controlli di accesso vengono preservati attraverso il semantic layer.

  • Un Topic può contenere fino a 12 dataset e non può mescolare dataset SPICE e Direct Query.
  • L’arricchimento con descrizioni, sinonimi e tipi semantici è la base che rende le risposte accurate e non solo funzionanti.
  • Gli enriched dataset si possono creare in Quick oppure importare tramite AWS Glue Data Catalog e Databricks Unity Catalog.

Fonte: Build a unified semantic layer across datasets with multi-dataset Topics in Amazon QuickSight — https://aws.amazon.com/blogs/machine-learning/build-a-unified-semantic-layer-across-datasets-with-multi-dataset-topics-in-amazon-quick/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma