Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore
Schița de curs
Introducere în Multimodalitatea Gemini 3
- Capabilități pe text, imagini, audio și video
- Selecția modelului și prezentarea generală a endpoint-urilor
- Concepte cheie în raționamentul multimodal
Lucrul cu Text și Inputuri Structurate
- Strategii de prompting pentru generarea de text
- Metadata, ferestre de context și embeddings
- Orchestrarea bazată pe text a sarcinilor multimodale
Înțelegerea Imaginilor și Fluxuri de Lucru Vizuale
- Analiza și interpretarea imaginilor cu Gemini 3
- Crearea de instrumente de căutare vizuală și etichetare
- Construirea interacțiunilor image-to-text și text-to-image
Procesarea Inputurilor Audio
- Fluxuri de lucru pentru recunoașterea vorbirii și transcriere
- Detectarea și interpretarea evenimentelor audio
- Integrarea audio cu inputuri text și vizuale
Inteligență Video și Analiza Scenelor
- Raționament video cadru cu cadru și continuu
- Construirea instrumentelor de rezumare și extragere a momentelor cheie
- Automatizare bazată pe video și fluxuri de lucru pentru conținut
Proiectarea Arhitecturilor de Aplicații Multimodale
- Combinarea mai multor tipuri de input într-un singur pipeline
- Considerații privind latența, costul și calculul
- Cele mai bune practici pentru sisteme multimodale scalabile
Prototiparea Aplicațiilor Multimodale
- Crearea hands-on a prototipurilor multimodale
- Iterație rapidă cu prompt engineering
- Testarea și rafinarea fluxurilor de experiență utilizator
Implementarea Soluțiilor Multimodale
- Strategii de deployment și setup al mediului
- Monitorizarea performanței în lumea reală
- Considerații de securitate și conformitate
Rezumat și Pașii Următori
Cerințe
- Înțelegerea conceptelor moderne de AI
- Experiență cu Python sau JavaScript
- Familiaritate cu REST APIs
Audiență
- Designeri
- Creatori de conținut
- Echipe tehnice de produs
Mărturii (1)
Flow, atmosferă și tematică a prezentării
Lukasz Kowalczyk - Allegro Sp. z o.o.
Curs - Google Gemini AI for Data Analysis
Tradus de catre o masina