Intrati in legatura

Schița de curs

Infrastructura EXO ca Cod

  • Prezentare generală a modelelor de implementare EXO: clusteruri single-node, multi-node și RDMA
  • Automatizarea instalării dependențelor (Xcode, uv, Node.js, Rust) cu gestionarea configurației
  • Utilizarea Nix flakes pentru construcții EXO reproducibile și medii de dezvoltare
  • Scrierea playbook-uri Ansible sau scripturi shell pentru furnizarea fără intervenție a clusterelor

Construcții Reproducibile și Integrare CI

  • Fixarea dependențelor și construirea dashboard-ului în pipeline-uri CI
  • Rularea testelor de fum EXO în GitHub Actions sau GitLab CI runners
  • Crearea de imagini aurii și fluxuri de lucru bazate pe snapshot-uri pentru VM-uri macOS și Linux
  • Versionarea cardurilor de modele personalizate alături de codul aplicației

Descoperirea Clusterului și Automatizarea Rețelei

  • Configurarea mDNS și DNS static pentru descoperirea fiabilă a nodurilor libp2p
  • Automatizarea creării profilurilor de rețea și gestionarea podului Thunderbolt pe macOS
  • Utilizarea namespace-urilor personalizate (EXO_LIBP2P_NAMESPACE) pentru a separa clusterele dev, staging și prod
  • Reguli de firewall și segmentarea rețelei pentru medii multi-tenant

Gestionarea Stocării și Ciclului de Viață al Modelelor

  • Proiectarea strategiilor EXO_MODELS_DIRS și EXO_MODELS_READ_ONLY_DIRS
  • Montarea partajărilor NFS sau SAN ca depozite de modele read-only pentru furnizare rapidă
  • Colectarea gunoiului din cache-uri învechite și politici de păstrare a ponderilor versionate
  • Automatizarea descărcării prealabile a modelelor și verificărilor de sănătate înainte de actualizări

Monitorizare și Alertare

  • Trimiterea jurnalelor EXO către înregistrări centralizate (ELK, Loki sau Splunk)
  • Construirea dashboard-urilor Grafana din ieșirea EXO_TRACING_ENABLED
  • Alertarea la schimbări de membri ai clusterului, evenimente OOM și creșteri de latență a inferenței
  • Corelarea telemetriei hardware macmon cu regresiile de performanță ale modelelor

Actualizare, Revenire și Recuperare la Dezastru

  • Stabilirea actualizărilor binare EXO într-un nod canary înainte de implementarea pe întreaga flotă
  • Revenire la nivel de model: comutarea între versiunile cuantificate fără re-descărcare
  • Backup și restaurarea stării clusterului, namespace-urilor personalizate și a ponderilor din cache
  • Documentarea runbook-urilor de recuperare pentru scenarii de reconstrucție totală a clusterului

Întărirea Securității și Conformitate

  • Aplicarea TLS la nivelul proxy-ului invers (nginx, traefik) pentru dashboard și API
  • Implementarea limitării ratei API și a listei albe IP pentru endpoint-urile EXO
  • Izolarea clusterelor cu VLAN-uri și politici de rețea zero-trust
  • Auditarea accesului și menținerea unui inventar al modelelor și versiunilor implementate

Cerințe

  • Experiență în practici DevOps (CI/CD, IaC, orchestrator de containere)
  • Familiaritate cu administrarea sistemelor macOS sau Linux și gestionarea pachetelor
  • Înțelegerea conceptelor de rețea, DNS și stocare

Public țintă

  • Ingineri DevOps
  • Arhitecți de infrastructură
  • SRE responsabili de sarcini AI on-premise
 21 Ore

Numărul de participanți


Pret per participant

Mărturii (2)

Cursuri viitoare

Categorii înrudite