Intrati in legatura
 Durata 21 ore

Schița de curs

Introducere în AI multimodal și Ollama

  • Prezentare generală a învățării multimodale
  • Provocări cheie în integrarea viziune-limbaj
  • Capabilitățile și arhitectura Ollama

Configurarea mediului Ollama

  • Instalarea și configurarea Ollama
  • Lucrul cu implementarea locală a modelelor
  • Integrarea Ollama cu Python și Jupyter

Lucrul cu intrări multimodale

  • Integrarea textului și a imaginilor
  • Încorporarea audio și a datelor structurate
  • Proiectarea pipeline-urilor de preprocesare

Aplicații de înțelegere a documentelor

  • Extragerea informațiilor structurate din PDF-uri și imagini
  • Combinarea OCR cu modelele de limbaj
  • Construirea fluxurilor de lucru inteligente pentru analiza documentelor

Visual Question Answering (VQA)

  • Configurarea seturilor de date și a benchmark-urilor VQA
  • Antrenarea și evaluarea modelelor multimodale
  • Construirea aplicațiilor VQA interactive

Proiectarea agenților multimodali

  • Principiile proiectării agenților cu raționament multimodal
  • Combinarea percepției, limbajului și acțiunii
  • Implementarea agenților pentru cazuri de utilizare din lumea reală

Integrare avansată și optimizare

  • Fine-tuning pentru modelele multimodale cu Ollama
  • Optimizarea performanței de inferență
  • Considerații de scalabilitate și implementare

Rezumat și pașii următori

Cerințe

  • Înțelegere solidă a conceptelor de machine learning
  • Experiență cu framework-uri de deep learning precum PyTorch sau TensorFlow
  • Familiaritate cu procesarea limbajului natural și computer vision

Public țintă

  • Ingineri de machine learning
  • Cercetători AI
  • Dezvoltatori de produse care integrează fluxuri de lucru vizuale și text

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite