Schița de curs
Platforma Databricks și fundamentalele Lakehouse
- Arhitectura și componentele Databricks Lakehouse
- Organizarea spațiilor de lucru și a catalogelor
Spațiul de lucru Databricks și notebook-uri
- Navigare în spațiul de lucru și dezvoltare bazată pe notebook-uri
- Structurarea codului în notebook-uri reutilizabile
Arhitectura Apache Spark și execuție
- Arhitectura runtime-ului Spark și modelul de execuție
- Evaluarea leneșă (lazy evaluation) și DAG-ul job-urilor
DataFrames PySpark și API-ul DataFrame
- Abstracțiile DataFrame și schemele de date
- Operațiunile de bază ale DataFrame-ului și expresiile coloanelor
Traducerea SQL în DataFrames PySpark
- Traducerea clauzelor SQL de bază în operațiuni cu DataFrame
- Funkțiile ferestre (window functions) și agregările în PySpark
Lectura și scrierea datelor în Databricks
- Citirea din surse comune de fișiere și baze de date
- Scrierea și partționarea datelor în Lakehouse
Delta Lake și gestionarea tabelelor
- Tabele Delta și tranzacții ACID
- Time travel (parcurs temporal) și evoluția schemei
Pattern-uri pentru curățarea și transformarea datelor
- Curățarea datelor și conversia tipurilor de date
- Construirea logicii de transformare reutilizabile
Funkții definite de utilizator (UDF) și cod modular
- Python UDFs și pandas UDFs
- Modularizarea logicii procedurale în funcții
Tuning-ul performanței și optimizare
- Strategii de partizionare și cache
- Identificarea colților de gât (bottlenecks) cu interfața Spark UI
Fundamentalele Structured Streaming
- Modele de procesare batch versus streaming
- DataFrame-uri în flux și agregări de bază
Job-uri Databricks și orchestrarea fluxurilor de lucru
- Planificarea notebook-urilor ca job-uri și sarcini
- Construirea unor fluxuri de lucru multi-etap cu dependențe
Unity Catalog și guvernanta datelor
- Arhitectura Unity Catalog și spațiile de nume (namespaces)
- Controlul accesului și liniajul datelor (data lineage)
Testare, depanare și practici pentru producție
- Testarea unitară a logicii PySpark
- Standarde de calitate a codului și depanare
Cazuri de utilizare end-to-end în servicii financiare
- Construirea unui pipeline ETL bancar end-to-end
- Traducerea proceselor SQL vechi (legacy) în PySpark
Migrarea încărcăturilor de lucru SQL în PySpark
- Strategii de migrare și pattern-uri de planificare
- Conversia incrementala a fluxurilor de lucru SQL în PySpark
Cerințe
- Experiență în programare Python, inclusiv funcții și tipuri de date
- Înțelegerea SQL, inclusiv uniuni (joins), agregări și subinterogări
- Nu sunt necesare experiențe anterioare cu Databricks sau PySpark
Public țintă
- Ingineri de date, analiști de date și profesioniști din domeniul datelor
- Echipelor care migrează fluxurile de lucru existente bazate pe SQL către Databricks și PySpark
Mărturii (1)
Mi-a plăcut că a fost practic. Am adorat să aplic cunoștințele teoretice cu exemple practice.
Aurelia-Adriana - Allianz Services Romania
Curs - Python and Spark for Big Data (PySpark)
Tradus de catre o masina