Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Suveranitate AI și Implementare Locală a LLM
- Riscurile modelelor LLM în cloud: reținerea datelor, antrenarea pe intrări, jurisdicție străină.
- Arhitectura Ollama: server de modele, registru și API compatibil OpenAI.
- Comparație cu vLLM, llama.cpp și Text Generation Inference.
- Licențierea modelelor: termenii Llama, Mistral, Qwen și Gemma.
Instalare și Configurare Hardware
- Instalarea Ollama pe Linux cu suport CUDA și ROCm.
- Fallback CPU-only și optimizare AVX/AVX2.
- Implementare Docker și mapare volum persistent.
- Configurație multi-GPU și strategii de alocare VRAM.
Gestionarea Modelelor
- Descărcarea modelelor din registrul Ollama: ollama pull llama3.
- Importarea modelelor GGUF din HuggingFace și TheBloke.
- Niveluri de cuantizare: compromisuri Q4_K_M, Q5_K_M, Q8_0.
- Schimbarea modelelor și limite de încărcare concurentă a modelelor.
Fișiere Modelfile Personalizate
- Sintaxa scrierii Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajustarea temperaturii, top_p și repeat_penalty.
- Inginerie prompturi de sistem pentru comportament specific rolului.
- Crearea și publicarea modelelor personalizate în registrul local.
Integrare API
- Endpoint OpenAI-compatibil /v1/chat/completions.
- Răspunsuri în flux și mod JSON.
- Integrare cu LangChain, LlamaIndex și aplicații personalizate.
- Autentificare și limitare a ratei cu proxy invers.
Optimizare Performanță
- Dimensionarea ferestrei de context și gestionarea cache KV.
- Inferență în lot și gestionarea cererilor paralele.
- Alocarea firelor CPU și conștientizare NUMA.
- Monitorizarea utilizării GPU și presiunea memoriei.
Securitate și Conformitate
- Izolarea rețelei pentru endpointurile de servire a modelelor.
- Filtrarea intrărilor și conducte de moderare a ieșirilor.
- Jurnalizarea auditului prompturilor și completărilor.
- Proveniența modelelor și verificarea hash.
Cerințe
- Cunoștințe intermediare de administrare Linux și containere.
- Înțelegere de nivel înalt a modelelor de învățare automată și transformatoare.
- Familiaritate cu API-uri REST și JSON.
Publicul țintă
- Ingineri și dezvoltatori AI care înlocuiesc API-uri cloud LLM.
- Organizații cu sensibilitate a datelor care împiedică utilizarea modelelor în cloud.
- Echipe guvernamentale și de apărare care necesită modele lingvistice air-gapped.
14 Ore