Intrati in legatura

Schița de curs

Introducere în AI-ul agentiv pentru operațiuni

  • De la runbook-uri statice la agenți raționali: evoluția automatizării IT
  • Anatomia agentului: bucla de raționament, utilizarea instrumentelor, memorie și planificare
  • Când să automatizați versus când să păstrați omul în bucla decizională

Cadruri și arhitecturi de agenți

  • Modeluri single-agent: ReAct, Plan-and-Execute și bucle de apelare a instrumentelor
  • Arhitecturi multi-agent: tipuri supervisor, ierarhice și de „swarm”
  • Compararea cadrelor: LangGraph, CrewAI, AutoGen și agenți custom
  • Construirea primului agent operațional: interogare monitorizare, diagnosticare, propunere soluții

Integrarea instrumentelor pentru operațiuni IT

  • Conectarea agenților la API-urile Prometheus, Grafana, Datadog și PagerDuty
  • Interogarea jurnalelor cu agenți: integrare Elasticsearch, Loki și Splunk
  • Utilizarea instrumentelor de infrastructură: kubectl, Terraform, Ansible prin acțiuni de agent
  • Proiectarea interfațelor de instrumente sigure cu validarea parametrilor și idempotență

Automatizarea răspunsului la incidente

  • Triaj automat al incidentelor: clasificarea severității și rutarea
  • Generarea ipotezelor despre cauza de bază și colectarea dovezilor
  • Remediere automată: acțiuni de repornire, scalare, revenire („rollback”) și preluare a controlului („failover”)
  • Construirea unui agent de runbook pentru incidente cu niveluri progresive de autonomie

Siguranță, „guardrails” și omul în bucla decizională

  • Clasificarea acțiunilor: doar citire, risc mic, risc mare și distructive
  • Porți de aprobare și politici de escaladare pentru operațiuni critice
  • Modeluri de „guardrails”: liste de permisiuni pentru acțiuni, limite pentru rază de impact („blast radius”) și garanții de „rollback”
  • Urmărirea auditului și proveniența deciziilor pentru conformitate

Orchestare multi-agent pentru incidente complexe

  • Coordinarea agenților specialiști: agent de triaj, agent de diagnostic, agent de remediere
  • Comunicarea între agenți și gestionarea contextului partajat
  • Rezolvarea conflictelor atunci când agenții propun acțiuni contradictorii
  • Simulare end-to-end a unui incident major cu răspuns multi-agent

Observabilitate și evaluare

  • Urmărirea lanțurilor de raționament ale agenților pentru depanare și audit
  • Evaluarea calității deciziilor agenților: precizie, acoperire („recall”), timp până la rezolvare
  • Bucle de feedback: învățare din intervențiile operatorilor și rezultate
  • Urmărirea costurilor și economie de tokeni pentru agenți operaționali

Implementare în producție și operațiuni

  • Implementarea agenților ca servicii: API-uri, webhooks și task-uri programate
  • Rularea graduală a autonomiei: de la mod shadow la remediere complet automată
  • Runbook pentru eșecurile agentului: ce se întâmplă când agentul însuși dă erori
  • Construirea argumentului de afaceri și măsurarea ROI pentru operațiuni autonome

Cerințe

  • Experiență în operațiuni IT, DevOps sau practici SRE.
  • Cunoaștere a scriptării Python și a API-urilor REST.
  • Înțelegere de bază a capacităților LLM și a ingineriei de prompturi.

Publicul țintă

  • Ingineri SRE și DevOps care explorează automatizarea bazată pe AI.
  • Ingineri de platformă care construiesc infrastructură auto-vindecătoare.
  • Responsabili de operațiuni IT care evaluează AI-ul agentiv pentru gestionarea incidentelor.
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite