Intrati in legatura

Schița de curs

Introducere în AIOps predictiv

  • Privire de ansamblu asupra analiticii predictive în operațiunile IT
  • Surse de date pentru predicție (loguri, metrici, evenimente)
  • Concepte cheie în prognoza seriilor temporale și tipare de anomalii

Proiectarea modelelor de predicție a incidentelor

  • Etichetarea incidentelor istorice și a comportamentului sistemului
  • Alegerea și antrenarea modelelor (de exemplu, LSTM, Random Forest, AutoML)
  • Evaluarea performanței modelului și gestionarea rezultatelor fals pozitive

Colectarea datelor și feature engineering

  • Ingestia și alinierea datelor de log și metrici pentru intrarea în model
  • Extragerea de feature-uri din date structurate și nestructurate
  • Gestionarea zgomotului și a datelor lipsă în pipeline-urile operaționale

Automatizarea analizei cauzei principale (RCA)

  • Corelarea bazată pe graf a serviciilor și infrastructurii
  • Utilizarea ML pentru a deduce cauzele principale probabile din lanțurile de evenimente
  • Vizualizarea RCA cu dashboard-uri conștiente de topologie

Remedierea și automatizarea fluxurilor de lucru

  • Integrarea cu platforme de automatizare (de exemplu, Ansible, Rundeck)
  • Declanșarea rollback-urilor, repornirilor sau redirecționării traficului
  • Auditarea și documentarea intervențiilor automate

Scalarea pipeline-urilor AIOps inteligente

  • MLOps pentru observability: reantrenare și versionare a modelelor
  • Rularea predicțiilor în timp real pe noduri distribuite
  • Cele mai bune practici pentru implementarea AIOps în medii de producție

Studii de caz și aplicații practice

  • Analiza datelor reale de incident folosind modele AIOps predictive
  • Implementarea pipeline-urilor RCA cu date sintetice și de producție
  • Revizuirea cazurilor de utilizare din industrie: întreruperi cloud, instabilitate microservicii, degradări de rețea

Rezumat și pașii următori

Cerințe

  • Experiență cu sisteme de monitorizare precum Prometheus sau ELK
  • Cunoștințe practice de Python și machine learning de bază
  • Familiaritate cu fluxurile de gestionare a incidentelor

Audiență

  • Site reliability engineers (SRE) seniori
  • Arhitecți de automatizare IT
  • Lideri de platforme DevOps și observability
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite