Dział 02 · 23 hasła
Dane i cechy
Skąd się biorą dane, jak je czyścić, skalować i zamieniać w cechy — i jak dane potrafią oszukać model, zanim zacznie się uczyć.
- Typy danych w uczeniu maszynowymTyp danych mówi, jakie operacje na zmiennej mają sens: liczbowe, porządkowe, nominalne, tekst, obrazy i czas wymagają innego przygotowania dla modelu.
- Eksploracyjna analiza danych (EDA) InteraktywneEDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.
- Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.
- Brakujące wartości i imputacja InteraktywneBrak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.
- Wykrywanie wartości odstającychWartość odstająca to obserwacja daleka od reszty: błąd albo rzadki, prawdziwy przypadek. Reguły IQR, z-score i Isolation Forest mówią tylko, co nietypowe.
- Skalowanie cech (standaryzacja) InteraktywneStandaryzacja sprowadza każdą cechę do średniej 0 i odchylenia 1. Bez niej cechy o dużej skali dominują gradient i odległości, a jeden learning rate nie pasuje.
- Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.
- Kodowanie zmiennych kategorycznychModel liczy na liczbach, więc kategorie trzeba zakodować. One-hot nie wprowadza fałszywego porządku, kodowanie liczbami tak, a target encoding grozi wyciekiem.
- Inżynieria cechInżynieria cech to tworzenie nowych zmiennych z wiedzy o problemie: proporcji, progów, interakcji. Daje prostemu modelowi kształty, których sam nie zbuduje.
- Cechy wielomianowe i interakcje InteraktywneCechy wielomianowe to potęgi i iloczyny zmiennych. Pozwalają modelowi liniowemu wyrażać krzywe i interakcje, ale ich liczba rośnie lawinowo.
- Selekcja cech InteraktywneSelekcja cech zostawia podzbiór zmiennych: by uprościć model, przyspieszyć go i zmniejszyć szum. Wykonana poza walidacją krzyżową daje fałszywie wysokie wyniki.
- Cechy z tekstu: worek słów i TF-IDF InteraktywneTF-IDF zamienia tekst na wektor wag słów: słowo jest ważne, gdy często pada w dokumencie, a rzadko w całym zbiorze. Prosty, mocny start dla klasyfikacji.
- Obrazy jako tablice liczb InteraktywneDla komputera obraz to tablica liczb: jasności pikseli w kanałach kolorów. Spłaszczenie do wektora gubi sąsiedztwo pikseli, z którego korzystają sieci CNN.
- Dane szeregów czasowychW szeregu czasowym kolejność niesie informację, a sąsiednie wartości są zależne. Losowy podział przecieka przyszłością i daje fałszywie dobre wyniki.
- Zbiór treningowyZbiór treningowy to przykłady z poprawnymi odpowiedziami, na których model dopasowuje wagi. Model zakłada, że nowe dane mają ten sam rozkład i proporcje klas.
- Podział na zbiór treningowy i testowyZbiór testowy to dane, których model nie widział, więc mierzy działanie na nowych przypadkach. Podział ma naśladować użycie: losowo, warstwowo lub w czasie.
- Błąd doboru próbyBłąd doboru próby powstaje, gdy dane nie reprezentują populacji, na której model ma działać. Więcej takich danych nie pomoże — model uczy się złego świata.
- Niezrównoważone klasyGdy jedna klasa jest rzadka, trafność kłamie, a model domyślnie ją ignoruje. Pomagają właściwe metryki, wagi klas, zmiana progu decyzji i ostrożny resampling.
- Wagi klasWagi klas mnożą stratę przykładu przez współczynnik zależny od klasy, zwykle odwrotność jej częstości. Pomyłka na klasie rzadkiej kosztuje w treningu więcej.
- SMOTE i resampling klasSMOTE tworzy syntetyczne przykłady rzadkiej klasy między jej sąsiadami. Przesuwa granicę decyzji podobnie jak wagi klas, ale psuje kalibrację prawdopodobieństw.
- Augmentacja danychAugmentacja tworzy nowe przykłady przez przekształcenia, które nie zmieniają etykiety, np. przesunięcia. Uczy model niezmienniczości bez zbierania danych.
- Szum w etykietachSzum w etykietach to błędnie oznaczone przykłady treningowe. Elastyczne modele je zapamiętują i tracą trafność; pomaga regularyzacja i szukanie złych etykiet.
- Korelacja pozorna (spurious correlation)Korelacja pozorna to cecha, która w danych treningowych przypadkiem idzie w parze z etykietą, choć nie ma z nią związku. Trening ją wykorzysta, nowe dane nie.