Intrati in legatura

Schița de curs

Introducere în Învățarea prin Întărire și AI Agentic

  • Luarea de decizii în condiții de incertitudine și planificare secvențială
  • Componentele cheie ale RL: agenți, medii, stări și recompense
  • Rolul RL în sistemele AI adaptive și agentice

Procese de Decizie Markov (MDPs)

  • Definiția formală și proprietățile MDPs
  • Funcții de valoare, ecuații Bellman și programare dinamică
  • Evaluarea, îmbunătățirea și iterația politicilor

Învățarea prin Întărire fără Model

  • Învățarea Monte Carlo și Învățarea Diferențială Temporală (TD)
  • Q-learning și SARSA
  • Practică: implementarea metodelor tabulare de RL în Python

Învățarea Profundă prin Întărire

  • Combinarea rețelelor neuronale cu RL pentru aproximarea funcțiilor
  • Rețele Deep Q (DQN) și reluarea experienței
  • Arhitecturi Actor-Critic și gradienti de politică
  • Practică: antrenarea unui agent folosind DQN și PPO cu Stable-Baselines3

Strategii de Explorare și Modelarea Recompenselor

  • Echilibrarea explorării vs. exploatării (ε-greedy, UCB, metode de entropie)
  • Proiectarea funcțiilor de recompensă și evitarea comportamentelor nedorite
  • Modelarea recompenselor și învățarea pe bază de curriculum

Subiecte Avansate în RL și Luarea de Decizii

  • Învățarea prin întărire multi-agent și strategii cooperative
  • Învățarea prin întărire ierarhică și cadrul opțiunilor
  • RL offline și învățarea prin imitație pentru implementări mai sigure

Medii de Simulare și Evaluare

  • Utilizarea OpenAI Gym și a mediilor personalizate
  • Spații de acțiune continue vs. discrete
  • Metrici pentru performanța, stabilitatea și eficiența eșantionării agenților

Integrarea RL în Sisteme AI Agentice

  • Combinarea raționamentului și RL în arhitecturi agentice hibride
  • Integrarea învățării prin întărire cu agenți care folosesc instrumente
  • Considerații operaționale pentru scalare și implementare

Proiect Final

  • Proiectează și implementează un agent de învățare prin întărire pentru o sarcină simulată
  • Analizează performanța antrenării și optimizează hiperparametrii
  • Demonstrează comportament adaptiv și luare de decizii într-un context agentic

Rezumat și Pași Următori

Cerințe

  • Competență avansată în programarea Python
  • Înțelegere solidă a conceptelor de învățare automată și învățare profundă
  • Familiaritate cu algebra liniară, probabilități și metode de bază de optimizare

Publicul țintă

  • Ingineri de învățare prin întărire și cercetători AI aplicați
  • Dezvoltatori de robotică și automatizare
  • Echipe de inginerie care lucrează la sisteme AI adaptive și agentice
 28 Ore

Numărul de participanți


Pret per participant

Mărturii (3)

Cursuri viitoare

Categorii înrudite