Intrati in legatura

Schița de curs

Platforma Databricks și fundamentalele Lakehouse

  • Arhitectura și componentele Databricks Lakehouse
  • Organizarea spațiilor de lucru și a catalogelor

Spațiul de lucru Databricks și notebook-uri

  • Navigare în spațiul de lucru și dezvoltare bazată pe notebook-uri
  • Structurarea codului în notebook-uri reutilizabile

Arhitectura Apache Spark și execuție

  • Arhitectura runtime-ului Spark și modelul de execuție
  • Evaluarea leneșă (lazy evaluation) și DAG-ul job-urilor

DataFrames PySpark și API-ul DataFrame

  • Abstracțiile DataFrame și schemele de date
  • Operațiunile de bază ale DataFrame-ului și expresiile coloanelor

Traducerea SQL în DataFrames PySpark

  • Traducerea clauzelor SQL de bază în operațiuni cu DataFrame
  • Funkțiile ferestre (window functions) și agregările în PySpark

Lectura și scrierea datelor în Databricks

  • Citirea din surse comune de fișiere și baze de date
  • Scrierea și partționarea datelor în Lakehouse

Delta Lake și gestionarea tabelelor

  • Tabele Delta și tranzacții ACID
  • Time travel (parcurs temporal) și evoluția schemei

Pattern-uri pentru curățarea și transformarea datelor

  • Curățarea datelor și conversia tipurilor de date
  • Construirea logicii de transformare reutilizabile

Funkții definite de utilizator (UDF) și cod modular

  • Python UDFs și pandas UDFs
  • Modularizarea logicii procedurale în funcții

Tuning-ul performanței și optimizare

  • Strategii de partizionare și cache
  • Identificarea colților de gât (bottlenecks) cu interfața Spark UI

Fundamentalele Structured Streaming

  • Modele de procesare batch versus streaming
  • DataFrame-uri în flux și agregări de bază

Job-uri Databricks și orchestrarea fluxurilor de lucru

  • Planificarea notebook-urilor ca job-uri și sarcini
  • Construirea unor fluxuri de lucru multi-etap cu dependențe

Unity Catalog și guvernanta datelor

  • Arhitectura Unity Catalog și spațiile de nume (namespaces)
  • Controlul accesului și liniajul datelor (data lineage)

Testare, depanare și practici pentru producție

  • Testarea unitară a logicii PySpark
  • Standarde de calitate a codului și depanare

Cazuri de utilizare end-to-end în servicii financiare

  • Construirea unui pipeline ETL bancar end-to-end
  • Traducerea proceselor SQL vechi (legacy) în PySpark

Migrarea încărcăturilor de lucru SQL în PySpark

  • Strategii de migrare și pattern-uri de planificare
  • Conversia incrementala a fluxurilor de lucru SQL în PySpark

Cerințe

  • Experiență în programare Python, inclusiv funcții și tipuri de date
  • Înțelegerea SQL, inclusiv uniuni (joins), agregări și subinterogări
  • Nu sunt necesare experiențe anterioare cu Databricks sau PySpark

Public țintă

  • Ingineri de date, analiști de date și profesioniști din domeniul datelor
  • Echipelor care migrează fluxurile de lucru existente bazate pe SQL către Databricks și PySpark
 35 Ore

Numărul de participanți


Pret per participant

Mărturii (1)

Cursuri viitoare

Categorii înrudite