Intrati in legatura

Schița de curs

Fundamentele NiFi și ale fluxului de date

  • Date în mișcare vs date în repaus: concepte și provocări
  • Arhitectura NiFi: nuclee, flow controller, provenance și bulletin
  • Componente cheie: procesoare, conexiuni, controllere și provenance

Contextul Big Data și integrarea

  • Rolul NiFi în ecosistemele Big Data (Hadoop, Kafka, stocare în cloud)
  • Prezentare generală a HDFS, MapReduce și alternative moderne
  • Cazuri de utilizare: ingerarea fluxurilor, log shipping, pipeline-uri de evenimente

Instalare, configurare și configurarea clusterului

  • Instalarea NiFi pe un singur nod și în mod cluster
  • Configurarea clusterului: roluri de noduri, zookeeper și load balancing
  • Orchestrarea implementărilor NiFi: folosind Ansible, Docker sau Helm

Proiectarea și gestionarea fluxurilor de date

  • Rutarea, filtrarea, divizarea și îmbinarea fluxurilor
  • Configurarea procesoarelor (InvokeHTTP, QueryRecord, PutDatabaseRecord etc.)
  • Gestionarea operațiunilor de schemă, îmbogățire și transformare
  • Gestionarea erorilor, relațiile de reîncercare și backpressure

Scenarii de integrare

  • Conectarea la baze de date, sisteme de mesagerie, API-uri REST
  • Streaming către sisteme de analiză: Kafka, Elasticsearch sau stocare în cloud
  • Integrarea cu Splunk, Prometheus sau pipeline-uri de logging

Monitorizare, recuperare și provenance

  • Utilizarea UI NiFi, a metricilor și a vizualizatorului de provenance
  • Proiectarea recuperării autonome și a gestionării grațioase a erorilor
  • Backup, versionarea fluxurilor și managementul schimbărilor

Tuning de performanță și optimizare

  • Tuning JVM, heap, pool-uri de thread-uri și parametri de clustering
  • Optimizarea designului fluxurilor pentru a reduce blocajele
  • Izolarea resurselor, prioritizarea fluxurilor și controlul throughput-ului

Bune practici și guvernanță

  • Documentarea fluxurilor, standarde de denumire, design modular
  • Securitate: TLS, autentificare, controlul accesului, criptarea datelor
  • Controlul schimbărilor, versionarea, accesul bazat pe roluri, piste de audit

Depanare și răspuns la incidente

  • Probleme comune: deadlock-uri, memory leaks, erori de procesoare
  • Analiza log-urilor, diagnosticarea erorilor și investigarea cauzei rădăcină
  • Strategii de recuperare și rollback al fluxurilor

Laborator practic: Implementarea unui pipeline de date realist

  • Construirea unui flux end-to-end: ingerare, transformare, livrare
  • Implementarea gestionării erorilor, backpressure și scalare
  • Testarea performanței și tuning-ul pipeline-ului

Rezumat și pașii următori

Cerințe

  • Experiență cu linia de comandă Linux
  • Înțelegere de bază a rețelelor și a sistemelor de date
  • Expunere la concepte de data streaming sau ETL

Public țintă

  • Administratori de sistem
  • Ingineri de date
  • Dezvoltatori
  • Profesioniști DevOps
 21 Ore

Numărul de participanți


Pret per participant

Mărturii (7)

Cursuri viitoare

Categorii înrudite