Intrati in legatura

Schița de curs

Suveranitate AI și Implementare Locală a LLM

  • Riscurile modelelor LLM în cloud: reținerea datelor, antrenarea pe intrări, jurisdicție străină.
  • Arhitectura Ollama: server de modele, registru și API compatibil OpenAI.
  • Comparație cu vLLM, llama.cpp și Text Generation Inference.
  • Licențierea modelelor: termenii Llama, Mistral, Qwen și Gemma.

Instalare și Configurare Hardware

  • Instalarea Ollama pe Linux cu suport CUDA și ROCm.
  • Fallback CPU-only și optimizare AVX/AVX2.
  • Implementare Docker și mapare volum persistent.
  • Configurație multi-GPU și strategii de alocare VRAM.

Gestionarea Modelelor

  • Descărcarea modelelor din registrul Ollama: ollama pull llama3.
  • Importarea modelelor GGUF din HuggingFace și TheBloke.
  • Niveluri de cuantizare: compromisuri Q4_K_M, Q5_K_M, Q8_0.
  • Schimbarea modelelor și limite de încărcare concurentă a modelelor.

Fișiere Modelfile Personalizate

  • Sintaxa scrierii Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Ajustarea temperaturii, top_p și repeat_penalty.
  • Inginerie prompturi de sistem pentru comportament specific rolului.
  • Crearea și publicarea modelelor personalizate în registrul local.

Integrare API

  • Endpoint OpenAI-compatibil /v1/chat/completions.
  • Răspunsuri în flux și mod JSON.
  • Integrare cu LangChain, LlamaIndex și aplicații personalizate.
  • Autentificare și limitare a ratei cu proxy invers.

Optimizare Performanță

  • Dimensionarea ferestrei de context și gestionarea cache KV.
  • Inferență în lot și gestionarea cererilor paralele.
  • Alocarea firelor CPU și conștientizare NUMA.
  • Monitorizarea utilizării GPU și presiunea memoriei.

Securitate și Conformitate

  • Izolarea rețelei pentru endpointurile de servire a modelelor.
  • Filtrarea intrărilor și conducte de moderare a ieșirilor.
  • Jurnalizarea auditului prompturilor și completărilor.
  • Proveniența modelelor și verificarea hash.

Cerințe

  • Cunoștințe intermediare de administrare Linux și containere.
  • Înțelegere de nivel înalt a modelelor de învățare automată și transformatoare.
  • Familiaritate cu API-uri REST și JSON.

Publicul țintă

  • Ingineri și dezvoltatori AI care înlocuiesc API-uri cloud LLM.
  • Organizații cu sensibilitate a datelor care împiedică utilizarea modelelor în cloud.
  • Echipe guvernamentale și de apărare care necesită modele lingvistice air-gapped.
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite