Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Introducere, Obiective și Strategia de Migrare
- Obiectivele cursului, alinierea profilului participantului și criteriile de succes
- Aproachări de migrare la nivel de înaltă vară și considerări privind riscurile
- Configurarea workspaces, repository-uri și a seturilor de date pentru laboratoare
Ziua 1 — Fundamentele migrării și Arhitectură
- Concepte Lakehouse, prezentarea Delta Lake și arhitectura Databricks
- Diferențele SMP vs MPP și implicațiile pentru migrare
- Design Medallion (Bronze→Silver→Gold) și prezentarea Unity Catalog
Laborator Ziua 1 — Traducerea unei proceduri stocate
- Migrare practică a unei proceduri stocate de exemplu către un notebook
- Maparea tabelor temporare și a cursorilor pe transformări DataFrame
- Validarea și compararea cu ieșirea originală
Ziua 2 — Delta Lake avansat & Ingestion Incremental
- Tranzacții ACID, jurnale de commit, versioning și time travel
- Auto Loader, pattern-uri MERGE INTO, upserts și evoluția schemelor
- OPTIMIZE, VACUUM, Z-ORDER, partționare și optimizarea stocării
Laborator Ziua 2 — Ingestion & Optimizare Incrementală
- Implementarea ingestiei cu Auto Loader și a workflow-urilor MERGE
- Aplicarea OPTIMIZE, Z-ORDER și VACUUM; validarea rezultatelor
- Măsurarea îmbunătățirilor de performanță la citire/scriere
Ziua 3 — SQL în Databricks, Performanță & Debugging
- Funcționalități SQL analitice: funcții de fereastră, funcții de ordin superior, procesare JSON/array
- Citirea Spark UI, DAG-uri, shuffles, stages, tasks și diagnosticarea gâturilor de sticlă
- Pattern-uri de tuning a interogărilor: broadcast joins, hints, caching și reducerea spill-urilor
Laborator Ziua 3 — Refactor SQL & Tuning Performanță
- Refactorarea unui proces SQL greu într-un Spark SQL optimizat
- Utilizarea tracelor din Spark UI pentru identificarea și repararea problemelor de skew și shuffle
- Benchmarking înainte/după și documentarea pașilor de tuning
Ziua 4 — PySpark tactic: Înlocuirea Logicii Procedurale
- Modelul de execuție Spark: driver, executors, evaluare lazy și strategii de partitionare
- Transformarea buclelor și cursorilor în operații DataFrame vectorizate
- Modularizare, UDF-uri/pandas UDF-uri, widgets și biblioteci reutilizabile
Laborator Ziua 4 — Refactor Scripturi Procedurale
- Refactorarea unui script ETL procedural în notebook-uri PySpark modulare
- Introducerea parametrizării, a testelor de tip unit și a funcțiilor reutilizabile
- Code review și aplicarea checklist-ului de best practices
Ziua 5 — Orchestare, Pipeline End-to-End & Best Practices
- Databricks Workflows: designul job-urilor, dependențe între task-uri, trigger-e și gestionarea erorilor
- Design de pipeline-uri Medallion incrementale cu reguli de calitate și validarea schemelor
- Integrare cu Git (GitHub/Azure DevOps), CI și strategii de testing pentru logica PySpark
Laborator Ziua 5 — Construirea unui Pipeline Complet End-to-End
- Asamblarea pipeline-ului Bronze→Silver→Gold orchestrat cu Workflows
- Implementarea logging, auditing, retries și validări automate
- Rularea completă a pipeline-ului, validarea ieșirilor și pregătirea notelor de deployment
Operationalizare, Governance & Pregătirea pentru Producție
- Best practices pentru governance Unity Catalog, liniaj și controlul accesului
- Costuri, dimensionarea clusterelor, autoscaling și pattern-uri de concurență pentru job-uri
- Checklist-uri de deployment, strategii de rollback și crearea runbook-urilor
Recapitulare Finală, Transfer de Cunoștințe și Pași Următori
- Prezentări ale participanților privind lucrarea de migrare și lecțiile învățate
- Analiza golurilor, activități recomandate de follow-up și transmiterea materialelor de training
- Referințe, căi de învățare suplimentare și opțiuni de suport
Cerințe
- Înțelegerea conceptelor de data engineering
- Experiență cu SQL și proceduri stocate (Synapse / SQL Server)
- Familiaritate cu conceptele de orchestrare ETL (ADF sau similar)
Audiență
- Manageri tehnologici cu profil de data engineering
- Data engineers care migrează logica procedurală OLAP către pattern-uri Lakehouse
- Ingineri de platformă responsabilizate cu adoptarea Databricks
35 Ore