Dane referencyjne · 442 wierszy · 10 cech
Diabetes (progresja cukrzycy)
442 pacjentów z cukrzycą: wiek, płeć, BMI, ciśnienie krwi i sześć pomiarów z krwi, a jako cel — miara postępu choroby rok później. Zbiór z pracy Efrona i in. o regresji LARS.
Dlaczego ten zbiór
Klasyczny zbiór do regresji: pokazuje regresję liniową, regularyzację (Ridge, Lasso) i to, jak mało wyjaśnia pojedyncza cecha.
Podgląd
| age | sex | bmi | bp | s1 | s2 | s3 | s4 | s5 | s6 | target |
|---|---|---|---|---|---|---|---|---|---|---|
| 59 | 2 | 32,1 | 101 | 157 | 93,2 | 38 | 4 | 4,86 | 87 | 151 |
| 48 | 1 | 21,6 | 87 | 183 | 103,2 | 70 | 3 | 3,89 | 69 | 75 |
| 72 | 2 | 30,5 | 93 | 156 | 93,6 | 41 | 4 | 4,67 | 85 | 141 |
| 24 | 1 | 25,3 | 84 | 198 | 131,4 | 40 | 5 | 4,89 | 89 | 206 |
| 50 | 1 | 23 | 101 | 192 | 125,4 | 52 | 4 | 4,29 | 80 | 135 |
| 23 | 1 | 22,6 | 89 | 139 | 64,8 | 61 | 2 | 4,19 | 68 | 97 |
| 36 | 2 | 22 | 90 | 160 | 99,6 | 50 | 3 | 3,95 | 82 | 138 |
| 66 | 2 | 26,2 | 114 | 255 | 185 | 56 | 4,55 | 4,25 | 92 | 63 |
Kolumny
| Kolumna | Znaczenie | Typ | Braki | Zakres / najczęstsze |
|---|---|---|---|---|
age | wiek | liczba | 0 | 19 – 79 (średnia 48,52) |
sex | płeć | kategorie (liczby) | 0 | 1, 2 |
bmi | wskaźnik masy ciała | liczba | 0 | 18 – 42,2 (średnia 26,38) |
bp | średnie ciśnienie krwi | liczba | 0 | 62 – 133 (średnia 94,65) |
s1 | cholesterol całkowity | liczba | 0 | 97 – 301 (średnia 189,14) |
s2 | LDL | liczba | 0 | 41,6 – 242,4 (średnia 115,44) |
s3 | HDL | liczba | 0 | 22 – 99 (średnia 49,79) |
s4 | stosunek cholesterolu do HDL | liczba | 0 | 2 – 9,09 (średnia 4,07) |
s5 | log trójglicerydów | liczba | 0 | 3,26 – 6,11 (średnia 4,64) |
s6 | glukoza | liczba | 0 | 58 – 124 (średnia 91,26) |
target | postęp choroby po roku | liczba | 0 | 25 – 346 (średnia 152,13) |
Źródło i licencja
Efron, B., Hastie, T., Johnstone, I., Tibshirani, R. (2004). Least angle regression. Annals of Statistics 32(2). Licencja: free for research and teaching (distributed with scikit-learn). Strona zbioru.
Hasła, w których pojawia się ten zbiór
Pochodna InteraktywnePochodna mówi, jak szybko zmienia się wynik funkcji przy małej zmianie wejścia. W ML wskazuje, w którą stronę i jak mocno poprawić parametr modelu.Cechy wielomianowe i interakcje InteraktywneCechy wielomianowe to potęgi i iloczyny zmiennych. Pozwalają modelowi liniowemu wyrażać krzywe i interakcje, ale ich liczba rośnie lawinowo.Regresja liniowa InteraktywneRegresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.Metoda najmniejszych kwadratów InteraktywneMetoda najmniejszych kwadratów dobiera parametry modelu tak, by suma kwadratów błędów była minimalna. Ma wzór zamknięty, ale jest wrażliwa na odstające punkty.Regresja wielomianowa InteraktywneRegresja wielomianowa dopasowuje krzywą, dodając potęgi cech do zwykłej regresji liniowej. Wysoki stopień szybko prowadzi do przeuczenia i dzikich wahań.Regresja grzbietowa i lasso InteraktywneRidge i lasso to regresja liniowa z karą za duże wagi. Ridge kurczy wszystkie współczynniki, lasso część z nich zeruje i w ten sposób wybiera cechy.Regularyzacja L1 czy L2L1 (Lasso) zeruje część wag i sama wybiera cechy, L2 (Ridge) zmniejsza wszystkie wagi, nie zerując żadnej. L1 służy przy wielu zbędnych cechach.Wzmacnianie gradientowe InteraktywneWzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.Bagging czy boostingBagging uśrednia niezależne, złożone modele i zmniejsza wariancję. Boosting składa po kolei proste modele i zmniejsza obciążenie, ale łatwiej uczy się szumu.Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.Metryki regresji: MAE, RMSE, R² InteraktywneMAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.Jak wybrać metrykę oceny modeluMetrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.Learning rate (współczynnik uczenia) InteraktywneLearning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.Regularyzacja (L2, dropout, early stopping) InteraktywneRegularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.