Intrati in legatura

Schița de curs

Fundamentele Implementării Tencent Hunyuan în Producție

  • Scurtă prezentare a scenariilor de exploatare a modelelor Tencent Hunyuan
  • Caracteristicile producției pentru modele mari și MoE
  • Principalele obstacole privind latența, productivitatea și costurile
  • Definirea obiectivelor de nivel de serviciu (SLO) pentru sarcinile de lucru ale inferenței

Arhitectura Implementării și Fluxul de Serviere

  • Componentele esențiale ale stack-ului de inferență în producție
  • Alegerea între modelele de implementare containerizate, on-premise și cloud
  • Fundamentele încărcării modelelor, rutei cererilor și alocării GPU
  • Proiectarea pentru fiabilitate și simplitate operațională

Oprimizarea Latenței în Practică

  • Utilizarea motoarelor de inferență optimizate, precum TensorRT, acolo unde este cazul
  • Concepte legate de cache-ul KV și ajustarea practică a acestuia
  • Reducerea întârzierilor de pornire, încălzire (warmup) și răspuns
  • Măsurarea timpului până la primul token și vitezei de generare a token-urilor

Productivitate, Batching și Eficiența GPU

  • Strategii de batching continuu și în loturi pentru cereri
  • Gestionarea concurenței și a comportamentului cozilor
  • Îmbunătățirea utilizării GPU-urilor fără a afecta experiența utilizatorului
  • Gestionarea cererilor cu context lung și sarcini de lucru mixte

Cuantificare și Control al Costurilor

  • Importanța cuantificării pentru servirea în producție
  • Echivalările practice între FP16, INT8 și alte opțiuni comune de precizie
  • Găsirea echilibrului dintre calitatea modelului, latență și costurile infrastructurii
  • Crearea unei liste de verificare simple pentru optimizarea costurilor

Operațiuni, Monitorizare și Revizuirea Pregătirii

  • Trigger-ele pentru auto-scaling ale serviciilor de inferență
  • Monitorizarea latenței, productivității, utilizării cache-ului și sănătății GPU
  • Fundamentele logării, alertării și răspunsului la incidente
  • Revizuirea unei implementări de referință și crearea unui plan de îmbunătățire

Cerințe

  • Cunoștințe de bază privind implementarea și fluxurile de lucru ale inferenței pentru modelele lingvistice mari (LLM)
  • Experiență cu containere, infrastructură cloud sau on-premise și servicii bazate pe API
  • Cunoștințe practice de Python sau sarcini de inginerie a sistemului

Public țintă

  • Ingineri ML care implementează LLM-uri în producție
  • Ingineri platformă responsabili pentru serviciile de inferență bazate pe GPU
  • Arhitecți de soluții care proiectează platforme scalabile de serviere AI
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite