Intrati in legatura

Schița de curs

Peisajul observațional al IA

  • De la panouri de control la conversații: tranziția către observabilitatea augmentată cu IA.
  • Capacitățile LLM relevante pentru observabilitate: rezumare, raționament, potrivire de tipare.
  • Modele arhitecturale: incorporarea IA în stive existente de observabilitate.

Interogarea telemetriei în limbaj natural

  • Text-to-PromQL: traducerea limbajului natural în interogări de monitorizare.
  • Interogare NL pentru jurnalele din Elasticsearch, OpenSearch și Loki.
  • Generarea SQL din limbaj natural pentru telemetrie structurată.
  • Construirea unui agent asistent de interogare cu utilizare de instrumente și conștientizare a contextului.

Analiza jurnalelor impulsionată de LLM

  • Analiză automată și structurare a jurnalelor cu LLM-uri.
  • Detecția anomaliilor în fluxurile de jurnale utilizând similaritatea de tipărire (embedding).
  • Clusterizarea jurnalelor și descoperirea de tipare la scară largă.
  • Generarea de explicații ușor de citit pentru om pornind de la secvențe brute de jurnale.

Alertare inteligentă și enricerea incidentelor

  • Corelarea alertelor și deduplicarea cu înțelegere semantică.
  • Colectarea automată a contextului incidentului din book-uri de rulare (runbooks), incidente anterioare și documentație.
  • Rutarea inteligentă a alertelor bazată pe înțelegerea conținutului și expertiza echipei.
  • Reducerea oboseții prin alerte cu reducerea zgomotului impulsionată de IA.

Analiza cauzei rădăcină asistată de IA

  • Generarea ipotezelor din corelarea telemetriei multi-sursă.
  • Lanțul de dovezi: conectarea simptomelor între metrici, jurnale și tracing-uri.
  • O rezolvare ghidată cu sesiuni interactive de diagnosticare IA.
  • Construirea unui agent pentru analiza cauzei rădăcină cu investigare progresivă.

Răspuns automat la incidente și comunicare

  • Generarea de rezumate ale incidentelor și actualizări de status din telemetrie.
  • Schimbarea automată a post-mortem cu reconstrucția cronologiei.
  • Comunicarea către părțile interesate, adaptată pentru audiențe tehnice și executive.
  • Sugestii de book-uri de rulare (runbook) și recomandări automate de remediere.

ML pentru observabilitate

  • Predicția seriei temporale pentru planificarea capacității și predicția anomaliilor.
  • Modele fundamentale pentru detecția zero-shot a anomaliilor pe metrici.
  • Hartarea dependențelor serviciilor și descoperirea topologiei bazate pe tipărituri (embedding).
  • Pregătirea și deplasarea de modele ML ușoare alături de fluxurile de lucru de observabilitate.

Deplasarea în producție și etică

  • Lățimea de bandă și considerațiile de cost pentru observabilitatea IA în timp real.
  • Confidențialitatea datelor: asigurarea faptului că LLM-urile nu scurg telemetrie sensibilă.
  • Supravegherea umană: când diagnosticarea IA necesită validare din partea operatorului.
  • Măsurarea impactului: MTTD, MTTR și metricile experienței de gardă (on-call).

Cerințe

  • Experiență cu instrumente de observabilitate precum Prometheus, Grafana, Datadog sau OpenTelemetry.
  • Cunoștințe despre gestionarea jurnalelor și concepte de metrici.
  • Scriptare Python de bază pentru procesarea datelor.

Public țintă

  • Ingineri SRE și de observabilitate care adoptă instrumente îmbogățite cu IA.
  • Ingineri de platformă care construiesc fluxuri de lucru de monitorizare de nouă generație.
  • Lideri DevOps care evaluează integrarea LLM în fluxurile de lucru pentru incident.
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite