#data engineering
risultati
-
La seconda ETL pipeline: separare esecuzione e orchestrazione con Kestra, Docker e PostgreSQL
Costruire una pipeline di ingestion RSS non per leggere feed, ma per imparare le decisioni architetturali che trasformano…
-
DuckLake: come l’architettura a tre componenti semplifica il lakehouse
DuckLake mette catalog e metadata in un database SQL invece di sparpagliarli su object storage. Ecco come funzionano…
-
Redpanda, Kafka e Confluent a confronto: cosa cambia davvero
Un confronto tra Apache Kafka, Confluent e Redpanda: latenza, footprint operativo, ecosistema e le nuove architetture diskless che…
-
sqlite-utils 4.0: migrazioni di schema, transazioni annidate e compound foreign key
La prima major release di sqlite-utils dal 2020 introduce le schema migration, le transazioni annidate con db.atomic() e…
-
Amazon Quick: portare il business context dentro i dataset con Dataset Enrichment
Amazon Quick sposta il contesto di business dai legacy Topics direttamente nei metadati del dataset con Dataset Enrichment.…
-
AWS Glue supporta Spark Connect nelle interactive sessions
AWS Glue supporta nativamente Apache Spark Connect: si sviluppa PySpark in locale nel proprio IDE e si esegue…
-
Dai job agli asset: il modello di maturità dell’orchestrazione dati
Dagster propone un modello di maturità dell’orchestrazione: dalle pipeline job-centriche alle piattaforme asset-aware. Perché spostare il focus dai…
-
Il tuo AI non è rotto: è il data model che non regge
Il salto tra un proof of concept brillante e un sistema AI in produzione vive nei dati. dbt…
-
Cos’è Confluent e in cosa si differenzia da Apache Kafka
Apache Kafka è il motore, Confluent è l’auto completa. Spieghiamo in modo semplice cosa aggiunge Confluent a Kafka…
-
L’ingegnere dei dati non è un idraulico
Perché la metafora delle «pipeline» impoverisce il ruolo e perché serve una narrazione migliore per attrarre talento.