ML Atlas

Dział 02 · 23 hasła

Dane i cechy

Skąd się biorą dane, jak je czyścić, skalować i zamieniać w cechy — i jak dane potrafią oszukać model, zanim zacznie się uczyć.

  1. Typy danych w uczeniu maszynowymTyp danych mówi, jakie operacje na zmiennej mają sens: liczbowe, porządkowe, nominalne, tekst, obrazy i czas wymagają innego przygotowania dla modelu.
  2. Eksploracyjna analiza danych (EDA) InteraktywneEDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.
  3. Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.
  4. Brakujące wartości i imputacja InteraktywneBrak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.
  5. Wykrywanie wartości odstającychWartość odstająca to obserwacja daleka od reszty: błąd albo rzadki, prawdziwy przypadek. Reguły IQR, z-score i Isolation Forest mówią tylko, co nietypowe.
  6. Skalowanie cech (standaryzacja) InteraktywneStandaryzacja sprowadza każdą cechę do średniej 0 i odchylenia 1. Bez niej cechy o dużej skali dominują gradient i odległości, a jeden learning rate nie pasuje.
  7. Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.
  8. Kodowanie zmiennych kategorycznychModel liczy na liczbach, więc kategorie trzeba zakodować. One-hot nie wprowadza fałszywego porządku, kodowanie liczbami tak, a target encoding grozi wyciekiem.
  9. Inżynieria cechInżynieria cech to tworzenie nowych zmiennych z wiedzy o problemie: proporcji, progów, interakcji. Daje prostemu modelowi kształty, których sam nie zbuduje.
  10. Cechy wielomianowe i interakcje InteraktywneCechy wielomianowe to potęgi i iloczyny zmiennych. Pozwalają modelowi liniowemu wyrażać krzywe i interakcje, ale ich liczba rośnie lawinowo.
  11. Selekcja cech InteraktywneSelekcja cech zostawia podzbiór zmiennych: by uprościć model, przyspieszyć go i zmniejszyć szum. Wykonana poza walidacją krzyżową daje fałszywie wysokie wyniki.
  12. Cechy z tekstu: worek słów i TF-IDF InteraktywneTF-IDF zamienia tekst na wektor wag słów: słowo jest ważne, gdy często pada w dokumencie, a rzadko w całym zbiorze. Prosty, mocny start dla klasyfikacji.
  13. Obrazy jako tablice liczb InteraktywneDla komputera obraz to tablica liczb: jasności pikseli w kanałach kolorów. Spłaszczenie do wektora gubi sąsiedztwo pikseli, z którego korzystają sieci CNN.
  14. Dane szeregów czasowychW szeregu czasowym kolejność niesie informację, a sąsiednie wartości są zależne. Losowy podział przecieka przyszłością i daje fałszywie dobre wyniki.
  15. Zbiór treningowyZbiór treningowy to przykłady z poprawnymi odpowiedziami, na których model dopasowuje wagi. Model zakłada, że nowe dane mają ten sam rozkład i proporcje klas.
  16. Podział na zbiór treningowy i testowyZbiór testowy to dane, których model nie widział, więc mierzy działanie na nowych przypadkach. Podział ma naśladować użycie: losowo, warstwowo lub w czasie.
  17. Błąd doboru próbyBłąd doboru próby powstaje, gdy dane nie reprezentują populacji, na której model ma działać. Więcej takich danych nie pomoże — model uczy się złego świata.
  18. Niezrównoważone klasyGdy jedna klasa jest rzadka, trafność kłamie, a model domyślnie ją ignoruje. Pomagają właściwe metryki, wagi klas, zmiana progu decyzji i ostrożny resampling.
  19. Wagi klasWagi klas mnożą stratę przykładu przez współczynnik zależny od klasy, zwykle odwrotność jej częstości. Pomyłka na klasie rzadkiej kosztuje w treningu więcej.
  20. SMOTE i resampling klasSMOTE tworzy syntetyczne przykłady rzadkiej klasy między jej sąsiadami. Przesuwa granicę decyzji podobnie jak wagi klas, ale psuje kalibrację prawdopodobieństw.
  21. Augmentacja danychAugmentacja tworzy nowe przykłady przez przekształcenia, które nie zmieniają etykiety, np. przesunięcia. Uczy model niezmienniczości bez zbierania danych.
  22. Szum w etykietachSzum w etykietach to błędnie oznaczone przykłady treningowe. Elastyczne modele je zapamiętują i tracą trafność; pomaga regularyzacja i szukanie złych etykiet.
  23. Korelacja pozorna (spurious correlation)Korelacja pozorna to cecha, która w danych treningowych przypadkiem idzie w parze z etykietą, choć nie ma z nią związku. Trening ją wykorzysta, nowe dane nie.

Inne działy

01 Podstawy03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy