// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Gestire i log su OpenSearch con data streams e ISM

Data streams e Index State Management su Amazon OpenSearch Service automatizzano rollover, retention e tiering dei dati time series, riducendo latenza, lavoro manuale e costi.

I workload di time series su Amazon OpenSearch Service tendono a un problema noto: indici singoli sovraccarichi che fanno crescere la latenza delle query, degradano le performance e alzano i costi. La combinazione di data streams e Index State Management (ISM) automatizza il ciclo di vita del dato e ottimizza performance e spesa.

Un data stream è un layer di astrazione che offre un endpoint di scrittura unico e coerente, gestendo dietro le quinte più backing index. Invece di scrivere sui singoli indici, l’applicazione scrive sullo stream, che instrada i dati sull’indice giusto. Quando un backing index invecchia o cresce oltre le soglie definite, ISM esegue automaticamente il rollover e può spostare i dati più vecchi su tier di storage diversi.

I passi principali

Il tutorial usa un database di web server log come esempio, tramite la Dev Tools Console di OpenSearch Dashboards. Prima si crea una policy ISM con due stati (hot e warm): nella demo il rollover scatta a 1.000 documenti e la transizione a warm dopo 2 minuti (valori dichiarati solo dimostrativi). Poi si definisce un index template che associa il pattern degli indici alla policy e mappa il campo timestamp richiesto dallo stream. Quindi si crea il data stream vero e proprio e si verifica, con la chiamata di explain, che la policy sia associata e abilitata.

Per popolare i dati, l’articolo carica log di esempio in un indice standard e poi li reindicizza sul data stream con uno script che scarta i documenti privi di timestamp valido. Da lì si monitora la creazione dei backing index — ISM valuta gli indici ogni 5 minuti per default — e si verifica la transizione da hot a warm, oltre a una search finale per confermare l’ingestione.

Per chi fa data engineering l’approccio è indicato quando si ingeriscono log, metriche, tracce o eventi IoT append-only e immutabili, con milioni di documenti al giorno e requisiti di retention lunga. Il beneficio pratico è triplice: query più performanti grazie a indici più piccoli e distribuiti nel tempo, meno overhead operativo perché rollover e retention sono automatici, e costi più bassi spostando i dati vecchi su UltraWarm senza perdere l’accesso allo storico.

In sintesi

  • I data streams offrono un endpoint di scrittura unico su più backing index; ISM automatizza rollover, retention e tiering.
  • Il setup passa da policy ISM, index template con campo timestamp e creazione dello stream, verificabili via API di explain.
  • Ideale per time series append-only ad alto volume: meno latenza, meno lavoro manuale, costi ridotti con UltraWarm.

Fonte: Efficient log management with Amazon OpenSearch Service data streams — https://aws.amazon.com/blogs/big-data/efficient-log-management-with-amazon-opensearch-service-data-streams/

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma