ML Atlas

Dział 03 · 26 haseł

Uczenie nadzorowane

Regresja liniowa i logistyczna, k najbliższych sąsiadów, drzewa, lasy i boosting: modele, które uczą się z par „przykład → odpowiedź”.

  1. Czym jest uczenie maszynoweUczenie maszynowe to budowanie programów, które regułę wyprowadzają z przykładów, zamiast dostać ją od programisty. Liczy się trafność na nowych danych.
  2. Uczenie nadzorowane a nienadzorowaneW uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.
  3. Regresja liniowa InteraktywneRegresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.
  4. Metoda najmniejszych kwadratów InteraktywneMetoda najmniejszych kwadratów dobiera parametry modelu tak, by suma kwadratów błędów była minimalna. Ma wzór zamknięty, ale jest wrażliwa na odstające punkty.
  5. Funkcja straty (loss) InteraktywneFunkcja straty to jedna liczba mierząca, jak bardzo przewidywania modelu odbiegają od prawdy na danych treningowych. Trening polega na jej minimalizowaniu.
  6. Regresja wielomianowa InteraktywneRegresja wielomianowa dopasowuje krzywą, dodając potęgi cech do zwykłej regresji liniowej. Wysoki stopień szybko prowadzi do przeuczenia i dzikich wahań.
  7. Regresja grzbietowa i lasso InteraktywneRidge i lasso to regresja liniowa z karą za duże wagi. Ridge kurczy wszystkie współczynniki, lasso część z nich zeruje i w ten sposób wybiera cechy.
  8. Regularyzacja L1 czy L2L1 (Lasso) zeruje część wag i sama wybiera cechy, L2 (Ridge) zmniejsza wszystkie wagi, nie zerując żadnej. L1 służy przy wielu zbędnych cechach.
  9. Regresja logistyczna InteraktywneRegresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.
  10. Granica decyzyjna InteraktywneGranica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.
  11. Metoda k najbliższych sąsiadów (kNN) InteraktywneMetoda kNN klasyfikuje nowy punkt głosem k najbliższych przykładów treningowych. Jest prosta i elastyczna, ale wrażliwa na skalę cech i ich liczbę.
  12. Naiwny klasyfikator Bayesa InteraktywneNaiwny Bayes liczy prawdopodobieństwo klasy z twierdzenia Bayesa, zakładając niezależność cech. Klasyfikuje nieźle, ale jego pewność bywa mocno zawyżona.
  13. Drzewo decyzyjne InteraktywneDrzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.
  14. Zysk informacyjny i gain podziału InteraktywneGain to ocena pytania w drzewie: o ile grupy po podziale są bardziej jednorodne niż przed nim. XGBoost liczy go z gradientów i hesjanów straty, z karami λ i γ.
  15. Przycinanie drzew decyzyjnych InteraktywnePrzycinanie usuwa z drzewa decyzyjnego gałęzie, które dopasowują szum zamiast reguły. Drzewo jest mniejsze, czytelniejsze i zwykle lepiej uogólnia.
  16. Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.
  17. Bagging (agregacja bootstrapowa) InteraktywneBagging uczy wiele kopii modelu na losowych próbkach bootstrapowych i uśrednia ich przewidywania. Zmniejsza wariancję niestabilnych modeli, nie obciążenie.
  18. Las losowy InteraktywneLas losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.
  19. AdaBoostAdaBoost uczy proste klasyfikatory po kolei, za każdym razem zwiększając wagę przykładów, na których poprzednie się myliły, i łączy je w ważone głosowanie.
  20. Wzmacnianie gradientowe InteraktywneWzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.
  21. Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.
  22. Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.
  23. XGBoost, LightGBM i CatBoost InteraktywneXGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.
  24. XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.
  25. Maszyna wektorów nośnych (SVM) InteraktywneSVM szuka granicy, która oddziela klasy z jak największym marginesem. Decydują o niej tylko punkty przy granicy, a jądra pozwalają kreślić granice krzywe.
  26. Sztuczka jądrowaSztuczka jądrowa pozwala modelowi liniowemu działać w ogromnej przestrzeni cech bez jej liczenia: wystarczy funkcja, która zwraca iloczyny skalarne.

Inne działy

01 Podstawy02 Dane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy