// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

AWS Glue supporta Spark Connect nelle interactive sessions

AWS Glue supporta nativamente Apache Spark Connect: si sviluppa PySpark in locale nel proprio IDE e si esegue sul backend Spark serverless di Glue, contro i dati reali.

AWS ha aggiunto il supporto nativo ad Apache Spark Connect nelle interactive sessions di AWS Glue. Il punto pratico è semplice: sviluppi in locale, dentro il tuo IDE, ma esegui il codice PySpark sul backend Spark serverless di Glue, contro i dati reali. Finora chi usava Glue tendeva a spezzare il lavoro in due: sviluppo locale su pochi dati e poi passaggio alle interactive sessions per validare scaling e tuning sull’intero dataset. Spark Connect prova a chiudere questa distanza.

Spark Connect, introdotto in Spark 3.4, disaccoppia il client Spark dal server tramite un protocollo gRPC leggero. Invece di far girare il driver program sul cluster, il tuo IDE comunica con un server Spark remoto attraverso un thin client. Da qui il vantaggio operativo: sviluppo locale, esecuzione remota, senza installare kernel specializzati o gestire l’infrastruttura del cluster.

Cosa cambia nel workflow

Il supporto arriva su qualsiasi ambiente che parli l’API remote() di PySpark: VS Code, PyCharm, JupyterLab, i notebook di Amazon SageMaker Unified Studio o normali applicazioni Python. L’esecuzione resta serverless — Glue provisiona e gestisce il cluster e paghi solo le DPU consumate mentre la sessione è attiva. In SageMaker Unified Studio la creazione della sessione, il recupero dell’endpoint e il refresh del token sono automatici: selezioni la connessione Glue (Spark) e l’oggetto spark è già disponibile.

Per ambienti senza SDK — container custom, funzioni AWS Lambda, toolchain non-Python — si usa Boto3 con l’API di basso livello: create_session con SessionType=SPARK_CONNECT, attesa dello stato READY, poi get_session_endpoint per ottenere l’URL sc:// e un token temporaneo da passare a SparkSession.builder.remote(). La sessione si provisiona in circa 30 secondi.

Un dettaglio da non ignorare: i token di autenticazione scadono dopo 30 minuti. In SageMaker Unified Studio il refresh è gestito in automatico; altrove serve un thread in background che riconnetta prima della scadenza. Sul fronte monitoring, la Spark Live UI aggiunge un tab Connect dedicato, accanto a Jobs, Stages, Executors e SQL.

Per iniziare

Servono AWS Glue 5.1 (Apache Spark 3.5.6), PySpark 3.5.6 installato in locale (pip install pyspark==3.5.6) e i permessi IAM glue:CreateSession, glue:GetSession, glue:GetSessionEndpoint. Attenzione al VPC: se ti connetti tramite endpoint VPC, va aggiunto il nuovo endpoint com.amazonaws.{region}.glue.sessions, perché gli endpoint Glue esistenti non coprono il traffico Spark Connect.

  • Sviluppo locale, esecuzione remota: stesso IDE per prototipo e produzione, senza kernel dedicati.
  • Serverless invariato: paghi le DPU della sessione, il cluster lo gestisce Glue.
  • Vincoli operativi: token a 30 minuti e configurazione VPC dedicata sono i due punti da presidiare.

Fonte: Introducing Apache Spark Connect support in AWS Glue interactive sessions — https://aws.amazon.com/blogs/big-data/introducing-apache-spark-connect-support-in-aws-glue-interactive-sessions/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma