// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Databricks Runtime 19 è in general availability

DBR 19 è GA su Apache Spark 4.2.0. Attenzione ai behavioral change: Python UDF con Arrow di default, solo JDK 21 e watermark real-time modificato.

Databricks Runtime 19 e la variante per Machine Learning sono ora in general availability, basati su Apache Spark 4.2.0. Con l’arrivo della 19, Databricks Runtime 18 passa in long-term support. Vale la pena leggere le note oltre il titolo, perché ci sono cambi di comportamento che possono rompere job esistenti.

Il cambio più rilevante alla GA riguarda le Python UDF: le UDF Python regolari usano ora la serializzazione basata su Arrow per default. È una buona notizia per le prestazioni, ma può alterare la type-coercion rispetto alle release precedenti; per ripristinare il comportamento storico si imposta spark.databricks.execution.pythonUDF.arrow.enabled a false. Sempre lato performance, la 19 introduce il pushdown TopN (ORDER BY ... LIMIT) per il fine-grained access control su dedicated compute e aggiorna parquet-java alla 1.17.0.

Dalle fasi Beta arrivano altri behavioral change da tenere d’occhio prima dell’upgrade. JDK 17 è stato rimosso: la 19 supporta solo JDK 21, quindi i cluster che usano JNAME=zulu17-ca-amd64 devono rimuovere la variabile. La property pipelines.pipelineId diventa riservata: impostarla manualmente genera un errore. In real-time mode, il watermark di event-time è ora traslato di +1 ms, così i record il cui event time coincide con il watermark corrente vengono trattenuti invece che scartati. Infine, la deserializzazione dei checkpoint DStream richiede una allowlist esplicita di classi custom.

Sul fronte novità di Spark 4.2.0, l’elenco è utile per chi scrive SQL e pipeline: l’espressione is_valid_variant, la sintassi INSERT INTO ... REPLACE ON/USING per upsert, la gestione delle transazioni sui catalog Data Source v2 (write multi-tabella atomici), TABLESAMPLE SYSTEM con pushdown, CREATE VIEW e ALTER VIEW sui catalog DSv2 e le funzioni quantile KLL basate su Apache DataSketches.

Come ambiente di sistema, la 19 gira su Ubuntu 24.04 LTS con Java Zulu 21, Scala 2.13.16, Python 3.12.3 e Delta Lake 4.2.0. La raccomandazione pratica è la solita: leggere i behavioral change e testare UDF Python e job in real-time mode su un cluster 19 prima di migrare la produzione.

In sintesi

  • Databricks Runtime 19 è GA su Apache Spark 4.2.0; la 18 passa a LTS.
  • Le Python UDF usano Arrow per default: possibile impatto sulla type-coercion.
  • Attenzione a JDK 21-only, property riservate e watermark real-time prima dell’upgrade.

Fonte: Databricks Runtime 19: July 23, 2026 — https://docs.databricks.com/aws/en/release-notes/runtime/19#databricks-runtime-19-july-23-2026

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma