ML Atlas

Ścieżka nauki · średni · 13 kroków · ok. 50 min

Dane tabelaryczne i Kaggle

Od surowej tabeli do mocnego wyniku w konkursie: eksploracja, braki, kodowanie, cechy, walidacja, boosting, strojenie, ensembling i pułapki tablicy wyników.

  1. Eksploracyjna analiza danych (EDA)4 min

    EDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.

  2. Brakujące wartości i imputacja4 min

    Brak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.

  3. Kodowanie zmiennych kategorycznych4 min

    Model liczy na liczbach, więc kategorie trzeba zakodować. One-hot nie wprowadza fałszywego porządku, kodowanie liczbami tak, a target encoding grozi wyciekiem.

  4. Inżynieria cech4 min

    Inżynieria cech to tworzenie nowych zmiennych z wiedzy o problemie: proporcji, progów, interakcji. Daje prostemu modelowi kształty, których sam nie zbuduje.

  5. Walidacja krzyżowa4 min

    Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.

  6. Wyciek danych (data leakage)4 min

    Wyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.

  7. Las losowy4 min

    Las losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.

  8. Wzmacnianie gradientowe4 min

    Wzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.

  9. XGBoost, LightGBM i CatBoost4 min

    XGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.

  10. Strojenie hiperparametrów4 min

    Strojenie hiperparametrów to wybór ustawień modelu, których algorytm nie uczy się sam, na podstawie walidacji. Wynik zwycięzcy jest zawsze nieco zawyżony.

  11. Zespoły modeli i stacking3 min

    Zespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.

  12. Lokalna CV a ranking publiczny4 min

    Ranking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.

  13. Jak pracować w konkursach Kaggle3 min

    Praca na Kaggle to pętla: zrozum metrykę, zbuduj walidację podobną do testu, wyślij prosty baseline, ulepszaj według lokalnej CV, nie rankingu publicznego.

Inne ścieżki

Uczenie maszynowe od zeraJak uczy się sieć neuronowaModele językowe i transformeryJak uczciwie ocenić model