La maggior parte dei data stack è nata per portare i dati in un warehouse, trasformarli per l’analytics e ottimizzare il reporting. Un modello sensato quando il consumatore dei dati era l’essere umano. Gli AI agent cambiano le richieste: hanno bisogno di dati freschi dai sistemi dove accadono le cose e di usarli in ambienti diversi — analytics engine, runtime ML, sistemi vettoriali, workflow applicativi. Il contesto non può vivere in un solo tool: deve essere portabile, governato e riusabile.
Il problema pratico è che un campo chiamato “revenue” non dice a un agent se include rimborsi, tasse o sconti, e una tabella “customer” non spiega quali account siano attivi o a rischio. Gli umani colmano questi vuoti con l’esperienza; un agent ha bisogno che il contesto sia esplicito. Da qui l’idea di un semantic layer portabile, in cui metriche, entità e definizioni sono scritte una volta, governate centralmente e riusate ovunque.
Su questa base Fivetran e dbt Labs hanno introdotto Agents Schema, uno standard aperto per rendere il contesto di business leggibile dagli agent. I team designano uno schema nel proprio warehouse o lake come layer di contesto condiviso, che gli agent possono interrogare prima di agire. Invece di far indovinare all’agent quale tabella usare o come è definita una metrica, Agents Schema mette queste informazioni in un posto standard e scopribile.
Definizioni di metriche, semantic model, lineage di dbt e documentazione di business vivono come normali tabelle SQL dentro lo schema. I metadata provengono dai sistemi che già li possiedono e vengono pubblicati nello schema condiviso tramite GitHub Actions open-source. L’esempio della fonte è chiaro: alla domanda “qual è il nostro MRR di questo mese?”, l’agent prima interroga l’Agents Schema per trovare la definizione di MRR, il modello dbt e il lineage dietro di essa, poi scrive SQL sulle tabelle giuste usando le stesse definizioni degli analisti.
A supporto, Fivetran cita il proprio Managed Data Lake Service, che atterra i dati in S3 o ADLS in formato Apache Iceberg e Delta Lake con registrazione nei catalog (Apache Polaris, Unity Catalog, AWS Glue, BigQuery Metastore, OneLake), mentre dbt porta il layer di trasformazione e semantica versionato e testato.
In sintesi
- Agents Schema è uno schema condiviso dove definizioni di metriche, semantica, lineage e documentazione diventano interrogabili dagli agent.
- I metadata restano nei sistemi che li possiedono e vengono pubblicati nello schema via GitHub Actions open-source.
- L’obiettivo è dare agli agent lo stesso contesto governato su cui lavorano gli analisti, riducendo le assunzioni sbagliate.
Fonte: How Agents Schema brings trusted business context to AI
Hai qualcosa da aggiungere? Unisciti alla discussione.