Intrati in legatura

Schița de curs

Introducere, Obiective și Strategia de Migrare

  • Obiectivele cursului, alinierea profilului participantului și criteriile de succes
  • Aproachări de migrare la nivel de înaltă vară și considerări privind riscurile
  • Configurarea workspaces, repository-uri și a seturilor de date pentru laboratoare

Ziua 1 — Fundamentele migrării și Arhitectură

  • Concepte Lakehouse, prezentarea Delta Lake și arhitectura Databricks
  • Diferențele SMP vs MPP și implicațiile pentru migrare
  • Design Medallion (Bronze→Silver→Gold) și prezentarea Unity Catalog

Laborator Ziua 1 — Traducerea unei proceduri stocate

  • Migrare practică a unei proceduri stocate de exemplu către un notebook
  • Maparea tabelor temporare și a cursorilor pe transformări DataFrame
  • Validarea și compararea cu ieșirea originală

Ziua 2 — Delta Lake avansat & Ingestion Incremental

  • Tranzacții ACID, jurnale de commit, versioning și time travel
  • Auto Loader, pattern-uri MERGE INTO, upserts și evoluția schemelor
  • OPTIMIZE, VACUUM, Z-ORDER, partționare și optimizarea stocării

Laborator Ziua 2 — Ingestion & Optimizare Incrementală

  • Implementarea ingestiei cu Auto Loader și a workflow-urilor MERGE
  • Aplicarea OPTIMIZE, Z-ORDER și VACUUM; validarea rezultatelor
  • Măsurarea îmbunătățirilor de performanță la citire/scriere

Ziua 3 — SQL în Databricks, Performanță & Debugging

  • Funcționalități SQL analitice: funcții de fereastră, funcții de ordin superior, procesare JSON/array
  • Citirea Spark UI, DAG-uri, shuffles, stages, tasks și diagnosticarea gâturilor de sticlă
  • Pattern-uri de tuning a interogărilor: broadcast joins, hints, caching și reducerea spill-urilor

Laborator Ziua 3 — Refactor SQL & Tuning Performanță

  • Refactorarea unui proces SQL greu într-un Spark SQL optimizat
  • Utilizarea tracelor din Spark UI pentru identificarea și repararea problemelor de skew și shuffle
  • Benchmarking înainte/după și documentarea pașilor de tuning

Ziua 4 — PySpark tactic: Înlocuirea Logicii Procedurale

  • Modelul de execuție Spark: driver, executors, evaluare lazy și strategii de partitionare
  • Transformarea buclelor și cursorilor în operații DataFrame vectorizate
  • Modularizare, UDF-uri/pandas UDF-uri, widgets și biblioteci reutilizabile

Laborator Ziua 4 — Refactor Scripturi Procedurale

  • Refactorarea unui script ETL procedural în notebook-uri PySpark modulare
  • Introducerea parametrizării, a testelor de tip unit și a funcțiilor reutilizabile
  • Code review și aplicarea checklist-ului de best practices

Ziua 5 — Orchestare, Pipeline End-to-End & Best Practices

  • Databricks Workflows: designul job-urilor, dependențe între task-uri, trigger-e și gestionarea erorilor
  • Design de pipeline-uri Medallion incrementale cu reguli de calitate și validarea schemelor
  • Integrare cu Git (GitHub/Azure DevOps), CI și strategii de testing pentru logica PySpark

Laborator Ziua 5 — Construirea unui Pipeline Complet End-to-End

  • Asamblarea pipeline-ului Bronze→Silver→Gold orchestrat cu Workflows
  • Implementarea logging, auditing, retries și validări automate
  • Rularea completă a pipeline-ului, validarea ieșirilor și pregătirea notelor de deployment

Operationalizare, Governance & Pregătirea pentru Producție

  • Best practices pentru governance Unity Catalog, liniaj și controlul accesului
  • Costuri, dimensionarea clusterelor, autoscaling și pattern-uri de concurență pentru job-uri
  • Checklist-uri de deployment, strategii de rollback și crearea runbook-urilor

Recapitulare Finală, Transfer de Cunoștințe și Pași Următori

  • Prezentări ale participanților privind lucrarea de migrare și lecțiile învățate
  • Analiza golurilor, activități recomandate de follow-up și transmiterea materialelor de training
  • Referințe, căi de învățare suplimentare și opțiuni de suport

Cerințe

  • Înțelegerea conceptelor de data engineering
  • Experiență cu SQL și proceduri stocate (Synapse / SQL Server)
  • Familiaritate cu conceptele de orchestrare ETL (ADF sau similar)

Audiență

  • Manageri tehnologici cu profil de data engineering
  • Data engineers care migrează logica procedurală OLAP către pattern-uri Lakehouse
  • Ingineri de platformă responsabilizate cu adoptarea Databricks
 35 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite