Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 14 ore (2 zile)
Schița de curs
Prezentare generală a tehnologiilor de recunoaștere a vorbirii
- Istoria și evoluția recunoașterii vorbirii
- Modele acustice, modele de limbaj și decodare
- Arhitecturi moderne: RNN-uri, transformere și Whisper
Elementele de bază ale preprocesării audio și transcrierii
- Gestionarea formatelor audio și a ratelor de eșantionare
- Curățarea, tăierea și segmentarea audio
- Generarea textului din audio: în timp real vs. batch
Practică hands-on cu Whisper și alte API-uri
- Instalarea și utilizarea OpenAI Whisper
- Apelarea API-urilor cloud (Google, Azure) pentru transcriere
- Compararea performanței, latenței și costurilor
Limba, accentele și adaptarea la domeniu
- Lucrul cu mai multe limbi și accente
- Vocabulare personalizate și toleranța la zgomot
- Gestionarea limbajului juridic, medical sau tehnic
Formatarea ieșirii și integrarea
- Adăugarea de marcaje temporale, punctuație și etichete pentru vorbitori
- Exportul în formate text, SRT sau JSON
- Integrarea transcrierilor în aplicații sau baze de date
Laboratoare de implementare a cazurilor de utilizare
- Transcrierea întâlnirilor, interviurilor sau podcasturilor
- Sisteme de comandă voce-text
- Subtitrări în timp real pentru fluxuri video/audio
Evaluare, limitări și etică
- Metrici de acuratețe și benchmarking al modelelor
- Bias și echitate în modelele de vorbire
- Considerații privind confidențialitatea și conformitatea
Rezumat și pașii următori
Cerințe
- Înțelegerea conceptelor generale despre AI și machine learning
- Familiaritatea cu formatele și instrumentele pentru fișiere audio sau media
Publicul țintă
- Data scientists și ingineri AI care lucrează cu date vocale
- Dezvoltatori de software care construiesc aplicații bazate pe transcriere
- Organizații care explorează recunoașterea vorbirii pentru automatizare