Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore
Schița de curs
Proiectarea unei arhitecturi AIOps deschise
- Prezentarea generală a componentelor cheie din pipeline-urile AIOps deschise
- Fluxul de date de la ingerare la alertare
- Compararea instrumentelor și strategia de integrare
Colectarea și agregarea datelor
- Ingerarea datelor time-series cu Prometheus
- Capturarea logurilor cu Logstash și Beats
- Normalizarea datelor pentru corelarea între surse
Construirea dashboard-urilor de observabilitate
- Vizualizarea metricilor cu Grafana
- Construirea dashboard-urilor Kibana pentru analiza logurilor
- Folosirea interogărilor Elasticsearch pentru a extrage insight-uri operaționale
Detectarea anomaliilor și predicția incidentelor
- Exportarea datelor de observabilitate către pipeline-uri Python
- Antrenarea modelelor ML pentru detectarea outlier-ilor și forecasting
- Implementarea modelelor pentru inferență live în pipeline-ul de observabilitate
Alertare și automatizare cu instrumente deschise
- Crearea regulilor de alertă Prometheus și rutarea prin Alertmanager
- Declanșarea scripturilor sau a fluxurilor API pentru răspuns automat
- Folosirea instrumentelor de orchestrare open-source (de exemplu, Ansible, Rundeck)
Considerații de integrare și scalabilitate
- Gestionarea ingestiei de volum mare și a retenției pe termen lung
- Securitatea și controlul accesului în stack-uri open-source
- Scalarea independentă a fiecărui strat: ingerare, procesare, alertare
Aplicații reale și extensii
- Studii de caz: optimizarea performanței, prevenirea downtime-ului și optimizarea costurilor
- Extinderea pipeline-urilor cu instrumente de tracing sau grafuri de servicii
- Cele mai bune practici pentru rularea și întreținerea AIOps în producție
Rezumat și pașii următori
Cerințe
- Experiență cu instrumente de observabilitate precum Prometheus sau ELK
- Cunoștințe practice de Python și fundamente de machine learning
- Înțelegerea operațiunilor IT și a fluxurilor de alertare
Public țintă
- Ingineri avansați de site reliability (SRE)
- Ingineri de date care lucrează în operațiuni
- Lideri de platforme DevOps și arhitecți de infrastructură