Intrati in legatura
 Durata 14 ore (2 zile)

Schița de curs

Prezentare generală a tehnologiilor de recunoaștere a vorbirii

  • Istoria și evoluția recunoașterii vorbirii
  • Modele acustice, modele de limbaj și decodare
  • Arhitecturi moderne: RNN-uri, transformere și Whisper

Elementele de bază ale preprocesării audio și transcrierii

  • Gestionarea formatelor audio și a ratelor de eșantionare
  • Curățarea, tăierea și segmentarea audio
  • Generarea textului din audio: în timp real vs. batch

Practică hands-on cu Whisper și alte API-uri

  • Instalarea și utilizarea OpenAI Whisper
  • Apelarea API-urilor cloud (Google, Azure) pentru transcriere
  • Compararea performanței, latenței și costurilor

Limba, accentele și adaptarea la domeniu

  • Lucrul cu mai multe limbi și accente
  • Vocabulare personalizate și toleranța la zgomot
  • Gestionarea limbajului juridic, medical sau tehnic

Formatarea ieșirii și integrarea

  • Adăugarea de marcaje temporale, punctuație și etichete pentru vorbitori
  • Exportul în formate text, SRT sau JSON
  • Integrarea transcrierilor în aplicații sau baze de date

Laboratoare de implementare a cazurilor de utilizare

  • Transcrierea întâlnirilor, interviurilor sau podcasturilor
  • Sisteme de comandă voce-text
  • Subtitrări în timp real pentru fluxuri video/audio

Evaluare, limitări și etică

  • Metrici de acuratețe și benchmarking al modelelor
  • Bias și echitate în modelele de vorbire
  • Considerații privind confidențialitatea și conformitatea

Rezumat și pașii următori

Cerințe

  • Înțelegerea conceptelor generale despre AI și machine learning
  • Familiaritatea cu formatele și instrumentele pentru fișiere audio sau media

Publicul țintă

  • Data scientists și ingineri AI care lucrează cu date vocale
  • Dezvoltatori de software care construiesc aplicații bazate pe transcriere
  • Organizații care explorează recunoașterea vorbirii pentru automatizare

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite