Curs de pregatire Integrarea Big Data cu Talend
Talend Open Studio for Big Data este un instrument open source ETL pentru procesarea datelor mari. Include un mediu de dezvoltare pentru a interacționa cu sursele și destinațiile de date mari și pentru a rula job-uri fără a fi nevoie să scrii cod.
Acest training condus de un instructor, live (online sau la fața locului), este destinat persoanelor tehnice care doresc să implementeze Talend Open Studio for Big Data pentru a simplifica procesul de citire și procesare a datelor mari.
La finalul acestui training, participanții vor putea:
- Instala și configura Talend Open Studio for Big Data.
- Să se conecteze la sisteme de date mari precum Cloudera, HortonWorks, MapR, Amazon EMR și Apache.
- Să înțeleagă și să configureze componentele și conectorii de date mari din Open Studio.
- Să configureze parametri pentru a genera automat cod MapReduce.
- Să utilizeze interfața drag-and-drop a Open Studio pentru a rula job-uri Hadoop.
- Să creeze prototipuri de fluxuri de date mari.
- Să automatizeze proiecte de integrare a datelor mari.
Formatul cursului
- Prelegere interactivă și discuții.
- Multe exerciții și practică.
- Implementare practică într-un mediu de laborator live.
Opțiuni de personalizare a cursului
- Pentru a solicita un training personalizat pentru acest curs, vă rugăm să ne contactați pentru a aranja.
Schița de curs
Introducere
Prezentare generală a caracteristicilor și arhitecturii "Open Studio for Big Data"
Configurarea Open Studio for Big Data
Navigarea în interfața de utilizator
Înțelegerea componentelor și conectorilor de date mari
Conectarea la un cluster Hadoop
Citirea și scrierea datelor
Procesarea datelor cu Hive și MapReduce
Analiza rezultatelor
Îmbunătățirea calității datelor mari
Construirea unui flux de date mari
Gestionarea utilizatorilor, grupurilor, rolurilor și proiectelor
Implementarea Open Studio în producție
Monitorizarea Open Studio
Depanarea
Rezumat și concluzii
Cerințe
- Înțelegerea bazelor de date relaționale
- Înțelegerea depozitelor de date
- Înțelegerea conceptelor ETL (Extract, Transform, Load)
Publicul țintă
- Profesioniști în business intelligence
- Profesioniști în baze de date
- Dezvoltatori SQL
- Dezvoltatori ETL
- Arhitecți de soluții
- Arhitecți de date
- Profesioniști în depozitarea datelor
- Administratori și integratori de sisteme
Cursurile publice necesita 5+ participanti
Curs de pregatire Integrarea Big Data cu Talend - Rezervare
Curs de pregatire Integrarea Big Data cu Talend - Solicitare
Integrarea Big Data cu Talend - Cerere de consultanta
Mărturii (1)
Exerciții practice. Clasa ar fi trebuit să dureze 5 zile, dar cele 3 zile au ajutat la clarificarea multor întrebări pe care le aveam din cauza lucrului cu NiFi.
James - BHG Financial
Curs - Apache NiFi for Administrators
Tradus de catre o masina
Cursuri viitoare
Cursuri înrudite
Apache Iceberg Avansat
21 OreAceastă formare condusă de un instructor, în direct Moldova (online sau la fața locului), este destinată profesioniștilor avansați în domeniul datelor care doresc să optimizeze fluxurile de procesare a datelor, să asigure integritatea datelor și să implementeze soluții robuste de tip data lakehouse, capabile să gestioneze complexitatea aplicațiilor moderne de big data.
La finalul acestei formări, participanții vor putea:
- Să înțeleagă în profunzime arhitectura Iceberg, inclusiv gestionarea metadatelor și structura fișierelor.
- Să configureze Iceberg pentru performanță optimă în diverse medii și să îl integreze cu multiple motoare de procesare a datelor.
- Să gestioneze tabele Iceberg la scară largă, să efectueze schimbări complexe de scheme și să gestioneze evoluția partițiilor.
- Să stăpânească tehnici de optimizare a performanței interogărilor și a eficienței scanării datelor pentru seturi de date mari.
- Să implementeze mecanisme pentru a asigura consistența datelor, a gestiona garanțiile tranzacționale și a gestiona eșecurile în medii distribuite.
Fundamentele Apache Iceberg
14 OreAceastă formare condusă de un instructor, în format live Moldova (online sau la fața locului), este destinată profesioniștilor din domeniul datelor de nivel începător care doresc să dobândească cunoștințele și abilitățile necesare pentru a utiliza eficient Apache Iceberg în gestionarea seturilor de date la scară mare, asigurarea integrității datelor și optimizarea fluxurilor de procesare a datelor.
La finalul acestei formări, participanții vor putea:
- Să înțeleagă pe deplin arhitectura, caracteristicile și beneficiile Apache Iceberg.
- Să învețe despre formatele de tabele, partiționarea, evoluția schemei și capacitățile de călătorie în timp.
- Să instaleze și să configureze Apache Iceberg în diferite medii.
- Să creeze, să gestioneze și să manipuleze tabele Iceberg.
- Să înțeleagă procesul de migrare a datelor din alte formate de tabele către Iceberg.
Analiza Big Data cu Google Colab și Apache Spark
14 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului), este destinat specialiștilor în știința datelor și inginerilor de nivel intermediar care doresc să utilizeze Google Colab și Apache Spark pentru procesarea și analiza datelor mari.
La finalul acestui training, participanții vor putea:
- Să configureze un mediu de big data folosind Google Colab și Spark.
- Să proceseze și să analizeze seturi mari de date eficient cu Apache Spark.
- Să vizualizeze datele mari într-un mediu colaborativ.
- Să integreze Apache Spark cu instrumente bazate pe cloud.
Apache NiFi pentru Administratori
21 OreApache NiFi este o platformă open-source bazată pe fluxuri pentru integrarea datelor și procesarea evenimentelor. Permite rutarea, transformarea și medierea automată a datelor în timp real între sisteme disparate, cu o interfață web și control detaliat.
Acest training condus de un instructor, live (pe fața locului sau la distanță), este destinat administratorilor și inginerilor de nivel intermediar care doresc să implementeze, să gestioneze, să securizeze și să optimizeze fluxurile de date NiFi în medii de producție.
La finalul acestui training, participanții vor putea:
- Să instaleze, să configureze și să întrețină clustere Apache NiFi.
- Să proiecteze și să gestioneze fluxuri de date din diverse surse și destinații.
- Să implementeze automatizarea fluxurilor, rutarea și logica de transformare.
- Să optimizeze performanța, să monitorizeze operațiunile și să depaneze problemele.
Formatul Cursului
- Prelegere interactivă cu discuții despre arhitectura din lumea reală.
- Laboratoare practice: construirea, implementarea și gestionarea fluxurilor.
- Exerciții bazate pe scenarii într-un mediu de laborator live.
Opțiuni de Personalizare a Cursului
- Pentru a solicita un training personalizat pentru acest curs, vă rugăm să ne contactați pentru a aranja.
PySpark și Învățarea Automată
21 OreAcest training oferă o introducere practică în construirea fluxurilor de lucru scalabile pentru procesarea datelor și Învățarea Automată folosind PySpark. Participanții învață cum funcționează Apache Spark în ecosistemele moderne de Big Data și cum să proceseze eficient seturi mari de date folosind principiile calculului distribuit.
Fundamentele Apache Spark
21 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului) este destinat inginerilor care doresc să configureze și să implementeze sistemul Apache Spark pentru procesarea unor volume foarte mari de date.
La finalul acestui training, participanții vor putea:
- Instala și configura Apache Spark.
- Procesarea și analiza rapidă a unor seturi de date foarte mari.
- Înțelege diferența dintre Apache Spark și Hadoop MapReduce și când să folosească fiecare.
- Integrarea Apache Spark cu alte instrumente de învățare automată.
Administrarea Apache Spark
35 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului) este destinat administratorilor de sisteme de la nivel începător până la intermediar care doresc să implementeze, să întrețină și să optimizeze clustere Spark.
La finalul acestui training, participanții vor fi capabili să:
- Instaleze și configureze Apache Spark în diverse medii.
- Gestioneze resursele clusterului și monitorizeze aplicațiile Spark.
- Optimizeze performanța clusterelor Spark.
- Implementeze măsuri de securitate și asigure o disponibilitate ridicată.
- Depaneze și rezolve probleme comune în Spark.
Apache Spark în Cloud
21 OreCurba de învățare a Apache Spark crește lent la început, fiind necesar un efort considerabil pentru a obține primele rezultate. Acest curs își propune să treacă peste această parte dificilă inițială. După parcurgerea acestui curs, participanții vor înțelege elementele de bază ale Apache Spark, vor face distincția clară între RDD și DataFrame, vor învăța API-urile Python și Scala, vor înțelege executoarele și sarcinile, etc. De asemenea, urmând cele mai bune practici, acest curs se concentrează puternic pe implementarea în cloud, Databricks și AWS. Studenții vor înțelege, de asemenea, diferențele dintre AWS EMR și AWS Glue, unul dintre cele mai recente servicii Spark ale AWS.
PUBLICUL ȚINTĂ:
Inginer de date, DevOps, Specialist în Știința Datelor
Python și Spark pentru Big Data (PySpark)
21 OreÎn acest training condus de un instructor, în format live în Moldova, participanții vor învăța cum să folosească Python și Spark împreună pentru a analiza date mari, lucrând la exerciții practice.
La finalul acestui training, participanții vor fi capabili să:
- Învețe cum să folosească Spark cu Python pentru a analiza date mari.
- Lucreze la exerciții care imită cazuri din lumea reală.
- Folosească diverse instrumente și tehnici pentru analiza datelor mari folosind PySpark.
Python, Spark și Hadoop pentru Big Data
21 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului), este destinat dezvoltatorilor care doresc să utilizeze și să integreze Spark, Hadoop și Python pentru a procesa, analiza și transforma seturi de date mari și complexe.
La finalul acestui training, participanții vor putea:
- Să configureze mediul necesar pentru a începe procesarea datelor mari cu Spark, Hadoop și Python.
- Să înțeleagă caracteristicile, componentele de bază și arhitectura Spark și Hadoop.
- Să învețe cum să integreze Spark, Hadoop și Python pentru procesarea datelor mari.
- Să exploreze instrumentele din ecosistemul Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka și Flume).
- Să construiască sisteme de recomandare bazate pe filtrare colaborativă asemănătoare cu cele de la Netflix, YouTube, Amazon, Spotify și Google.
- Să utilizeze Apache Mahout pentru a scala algoritmii de învățare automată.
Stratio: Modulele Rocket și Intelligence cu PySpark
14 OreStratio este o platformă centrată pe date care integrează date masive, inteligență artificială și guvernanță într-o singură soluție. Modulele sale Rocket și Intelligence permit explorarea, transformarea și analiza avansată a datelor în mediile de întreprindere.
Acest training condus de un instructor, live (online sau la fața locului), este destinat profesioniștilor de date de nivel intermediar care doresc să utilizeze eficient modulele Rocket și Intelligence din Stratio cu PySpark, concentrându-se pe structuri repetitive, funcții definite de utilizator și logică avansată a datelor.
La finalul acestui training, participanții vor putea:
- Naviga și lucrează în platforma Stratio folosind modulele Rocket și Intelligence.
- Aplică PySpark în contextul ingerării, transformării și analizei datelor.
- Folosește bucle și logică condițională pentru a controla fluxurile de date și sarcinile de inginerie a caracteristicilor.
- Creează și gestionează funcții definite de utilizator (UDF) pentru operațiuni reutilizabile de date în PySpark.
Formatul cursului
- Prelegere interactivă și discuții.
- Multe exerciții și practică.
- Implementare practică într-un mediu live-lab.
Opțiuni de personalizare a cursului
- Pentru a solicita un training personalizat pentru acest curs, vă rugăm să ne contactați pentru a aranja.
Centrul de Administrare Talend (TAC)
14 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului), este destinat administratorilor de sistem, oamenilor de știință de date și analiștilor de afaceri care doresc să configureze Centrul de Administrare Talend pentru a implementa și gestiona rolurile și sarcinile organizației.
La finalul acestui training, participanții vor putea:
- Instala și configura Centrul de Administrare Talend.
- Înțelege și implementa elementele fundamentale ale managementului Talend.
- Construi, implementa și rula proiecte sau sarcini de afaceri în Talend.
- Monitoriza securitatea seturilor de date și dezvolta rutine de afaceri bazate pe cadrul TAC.
- Obține o înțelegere mai largă a aplicațiilor de date mari.
Talend Data Stewardship
14 OreAcest training condus de un instructor, live în Moldova (online sau la fața locului), este destinat analiștilor de date de la nivel începător până la intermediar, care doresc să-și aprofundeze înțelegerea și abilitățile în gestionarea și îmbunătățirea calității datelor folosind Talend Data Stewardship.
La finalul acestui training, participanții vor fi capabili să:
- Dobândească o înțelegere comprehensivă a rolului gestionării datelor în menținerea calității acestora.
- Folosească Talend Data Stewardship pentru gestionarea sarcinilor legate de calitatea datelor.
- Creeze, aloce și gestioneze sarcini în Talend Data Stewardship, inclusiv personalizarea fluxurilor de lucru.
- Folosească capacitățile de raportare și monitorizare ale instrumentului pentru a urmări calitatea datelor și eforturile de gestionare a acestora.
Talend Open Studio for ESB
21 OreÎn cadrul acestui training condus de un instructor, desfășurat live în Moldova, participanții vor învăța cum să folosească Talend Open Studio for ESB pentru a crea, conecta, media și gestiona servicii și interacțiunile acestora.
La finalul acestui training, participanții vor putea
- Integra, îmbunătăți și livra tehnologii ESB ca pachete unice în diverse medii de implementare.
- Înțelege și utilizează componentele cele mai folosite ale Talend Open Studio.
- Integra orice aplicație, bază de date, API sau servicii web.
- Integra fără probleme sisteme și aplicații eterogene.
- Încorpora biblioteci de cod Java existente pentru a extinde proiectele.
- Folosi componente și cod din comunitate pentru a extinde proiectele.
- Integra rapid sisteme, aplicații și surse de date într-un mediu Eclipse cu drag-and-drop.
- Reduce timpul de dezvoltare și costurile de întreținere prin generarea de cod optimizat și reutilizabil.