Această cursă practică de trei zile se concentrează pe construirea și optimizarea sarcinilor de procesare a datelor eficiente, folosind PySpark, Pandas și Polars în medii bazate pe Kubernetes.
Participanții își vor dezvolta o înțelegere practică a modului în care aplicațiile Spark se execută pe Kubernetes și cum deciziile de configurare la nivelul aplicației influențează performanța, scalabilitatea, consumul de resurse și costurile. Cursa acoperă zonele cheie de optimizare, inclusiv dimensionarea executorilor, alocarea memoriei, alocarea dinamică, strategiile de partizionare, comportamentul shuffle, problemele cu fișierele mici și procesarea eficientă a fișierelor Parquet.
Cursa abordează, de asemenea, provocările comune apărute la lucrul cu Pandas, inclusiv limitările de memorie și erorile „out-of-memory”, și introduce Polars ca alternativă de performanță ridicată pentru anumite sarcini de procesare a datelor. Prin exerciții hands-on, participanții vor diagnostica problemele de performanță și de memorie, vor compara diferite strategii de configurare și vor aplica tehnici de optimizare în scenarii realiste de ETL și machine learning.
Accentul pus în tot parcursul cursului este pe luarea de decizii practice: înțelegerea modului de a identifica punctele de blocaj (bottlenecks), de a selecta instrumentul potrivit, de a configura Spark eficient și de a echilibra performanța cu consumul de resurse al infrastructurii și costurile asociate.
Citește mai mult...