Intrati in legatura

Schița de curs

Introducere

Această secțiune oferă o introducere generală despre când să folosești „machine learning”, ce ar trebui luat în considerare și ce înseamnă totul, inclusiv avantajele și dezavantajele. Tipuri de date (structurate/nestructurate/statice/în flux), validitatea/volumul datelor, analize bazate pe date vs. analize bazate pe utilizator, modele statistice vs. modele de machine learning, provocări ale învățării nesupravegheate, compromisul bias-varianță, iterație/evaluare, abordări de validare încrucișată, supervizat/nesupervizat/învățare prin consolidare.

SUBIECTE PRINCIPALE

1. Înțelegerea metodei naive Bayes

  • Concepte de bază ale metodelor bayesiene
  • Probabilitate
  • Probabilitate comună
  • Probabilitate condiționată cu teorema lui Bayes
  • Algoritmul naive Bayes
  • Clasificarea naive Bayes
  • Estimatorul Laplace
  • Utilizarea caracteristicilor numerice cu naive Bayes

2. Înțelegerea arborilor de decizie

  • Divide et impera
  • Algoritmul de arbore de decizie C5.0
  • Alegerea celei mai bune divizări
  • Tăierea arborelui de decizie

3. Înțelegerea rețelelor neuronale

  • De la neuronii biologici la cei artificiali
  • Funcții de activare
  • Topologia rețelei
  • Numărul de straturi
  • Direcția de circulație a informației
  • Numărul de noduri din fiecare strat
  • Antrenarea rețelelor neuronale cu backpropagation
  • Deep Learning

4. Înțelegerea Support Vector Machines

  • Clasificare cu hiperplane
  • Găsirea marjei maxime
  • Cazul datelor separabile liniar
  • Cazul datelor neseparabile liniar
  • Utilizarea kernelurilor pentru spații non-liniare

5. Înțelegerea clusteringului

  • Clusteringul ca sarcină de machine learning
  • Algoritmul k-means pentru clustering
  • Utilizarea distanței pentru a atribui și actualiza clustere
  • Alegerea numărului potrivit de clustere

6. Măsurarea performanței pentru clasificare

  • Lucrul cu datele de predicție pentru clasificare
  • O privire mai atentă asupra matricelor de confuzie
  • Utilizarea matricelor de confuzie pentru a măsura performanța
  • Dincolo de acuratețe – alte măsuri de performanță
  • Statistica kappa
  • Sensibilitate și specificitate
  • Precizie și recall
  • Măsura F
  • Vizualizarea compromisurilor de performanță
  • Curbe ROC
  • Estimarea performanței viitoare
  • Metoda holdout
  • Validare încrucișată
  • Eșantionare bootstrap

7. Reglarea modelelor stock pentru performanțe mai bune

  • Utilizarea caret pentru reglarea automată a parametrilor
  • Crearea unui model simplu reglat
  • Personalizarea procesului de reglare
  • Îmbunătățirea performanței modelului cu meta-learning
  • Înțelegerea ansamblurilor
  • Bagging
  • Boosting
  • Random forests
  • Antrenarea random forests
  • Evaluarea performanței random forest

SUBIECTE SECUNDARE

8. Înțelegerea clasificării folosind cei mai apropiați vecini

  • Algoritmul kNN
  • Calcularea distanței
  • Alegerea unui k potrivit
  • Pregătirea datelor pentru utilizarea cu kNN
  • De ce este algoritmul kNN leneș?

9. Înțelegerea regulilor de clasificare

  • Separă și cucerește
  • Algoritmul One Rule
  • Algoritmul RIPPER
  • Reguli din arbori de decizie

10. Înțelegerea regresiei

  • Regresie liniară simplă
  • Estimarea prin metoda celor mai mici pătrate
  • Corelații
  • Regresie liniară multiplă

11. Înțelegerea arborilor de regresie și a arborilor model

  • Adăugarea regresiei la arbori

12. Înțelegerea regulilor de asociere

  • Algoritmul Apriori pentru învățarea regulilor de asociere
  • Măsurarea interesului regulilor – suport și încredere
  • Construirea unui set de reguli cu principiul Apriori

Extra

  • Spark/PySpark/MLlib și bandiți multi-arm

Cerințe

Cunoștințe de Python

 21 Ore

Numărul de participanți


Pret per participant

Mărturii (7)

Cursuri viitoare

Categorii înrudite