Ścieżka nauki · średni · 13 kroków · ok. 50 min
Dane tabelaryczne i Kaggle
Od surowej tabeli do mocnego wyniku w konkursie: eksploracja, braki, kodowanie, cechy, walidacja, boosting, strojenie, ensembling i pułapki tablicy wyników.
- Eksploracyjna analiza danych (EDA)4 min
EDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.
- Brakujące wartości i imputacja4 min
Brak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.
- Kodowanie zmiennych kategorycznych4 min
Model liczy na liczbach, więc kategorie trzeba zakodować. One-hot nie wprowadza fałszywego porządku, kodowanie liczbami tak, a target encoding grozi wyciekiem.
- Inżynieria cech4 min
Inżynieria cech to tworzenie nowych zmiennych z wiedzy o problemie: proporcji, progów, interakcji. Daje prostemu modelowi kształty, których sam nie zbuduje.
- Walidacja krzyżowa4 min
Walidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.
- Wyciek danych (data leakage)4 min
Wyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.
- Las losowy4 min
Las losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.
- Wzmacnianie gradientowe4 min
Wzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.
- XGBoost, LightGBM i CatBoost4 min
XGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.
- Strojenie hiperparametrów4 min
Strojenie hiperparametrów to wybór ustawień modelu, których algorytm nie uczy się sam, na podstawie walidacji. Wynik zwycięzcy jest zawsze nieco zawyżony.
- Zespoły modeli i stacking3 min
Zespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.
- Lokalna CV a ranking publiczny4 min
Ranking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.
- Jak pracować w konkursach Kaggle3 min
Praca na Kaggle to pętla: zrozum metrykę, zbuduj walidację podobną do testu, wyślij prosty baseline, ulepszaj według lokalnej CV, nie rankingu publicznego.