Dane referencyjne · 178 wierszy · 13 cech
Wine (wina z Piemontu)
178 win z trzech odmian winorośli z tego samego regionu Włoch, opisanych 13 wynikami analizy chemicznej (alkohol, kwas jabłkowy, fenole, intensywność koloru…).
Dlaczego ten zbiór
Trzynaście cech w zupełnie różnych skalach: bez standaryzacji odległości i PCA są zdominowane przez jedną kolumnę. Dobry do PCA i kNN.
Podgląd
| alcohol | malic_acid | ash | alcalinity_of_ash | magnesium | total_phenols | flavanoids | nonflavanoid_phenols | proanthocyanins | color_intensity | hue | od280/od315_of_diluted_wines | proline | target |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 14,23 | 1,71 | 2,43 | 15,6 | 127 | 2,8 | 3,06 | 0,28 | 2,29 | 5,64 | 1,04 | 3,92 | 1065 | 0 |
| 13,2 | 1,78 | 2,14 | 11,2 | 100 | 2,65 | 2,76 | 0,26 | 1,28 | 4,38 | 1,05 | 3,4 | 1050 | 0 |
| 13,16 | 2,36 | 2,67 | 18,6 | 101 | 2,8 | 3,24 | 0,3 | 2,81 | 5,68 | 1,03 | 3,17 | 1185 | 0 |
| 14,37 | 1,95 | 2,5 | 16,8 | 113 | 3,85 | 3,49 | 0,24 | 2,18 | 7,8 | 0,86 | 3,45 | 1480 | 0 |
| 13,24 | 2,59 | 2,87 | 21 | 118 | 2,8 | 2,69 | 0,39 | 1,82 | 4,32 | 1,04 | 2,93 | 735 | 0 |
| 14,2 | 1,76 | 2,45 | 15,2 | 112 | 3,27 | 3,39 | 0,34 | 1,97 | 6,75 | 1,05 | 2,85 | 1450 | 0 |
| 14,39 | 1,87 | 2,45 | 14,6 | 96 | 2,5 | 2,52 | 0,3 | 1,98 | 5,25 | 1,02 | 3,58 | 1290 | 0 |
| 14,06 | 2,15 | 2,61 | 17,6 | 121 | 2,6 | 2,51 | 0,31 | 1,25 | 5,05 | 1,06 | 3,58 | 1295 | 0 |
Kolumny
| Kolumna | Znaczenie | Typ | Braki | Zakres / najczęstsze |
|---|---|---|---|---|
alcohol | liczba | 0 | 11,03 – 14,83 (średnia 13) | |
malic_acid | liczba | 0 | 0,74 – 5,8 (średnia 2,34) | |
ash | liczba | 0 | 1,36 – 3,23 (średnia 2,37) | |
alcalinity_of_ash | liczba | 0 | 10,6 – 30 (średnia 19,49) | |
magnesium | liczba | 0 | 70 – 162 (średnia 99,74) | |
total_phenols | liczba | 0 | 0,98 – 3,88 (średnia 2,3) | |
flavanoids | liczba | 0 | 0,34 – 5,08 (średnia 2,03) | |
nonflavanoid_phenols | liczba | 0 | 0,13 – 0,66 (średnia 0,36) | |
proanthocyanins | liczba | 0 | 0,41 – 3,58 (średnia 1,59) | |
color_intensity | liczba | 0 | 1,28 – 13 (średnia 5,06) | |
hue | liczba | 0 | 0,48 – 1,71 (średnia 0,96) | |
od280/od315_of_diluted_wines | liczba | 0 | 1,27 – 4 (średnia 2,61) | |
proline | liczba | 0 | 278 – 1680 (średnia 746,89) | |
target | odmiana: 0, 1 lub 2 | kategorie (liczby) | 0 | 0, 1, 2 |
Źródło i licencja
Aeberhard, S., Forina, M. (1991). Wine. UCI Machine Learning Repository. Licencja: CC BY 4.0. Strona zbioru.
Hasła, w których pojawia się ten zbiór
Skalowanie cech (standaryzacja) InteraktywneStandaryzacja sprowadza każdą cechę do średniej 0 i odchylenia 1. Bez niej cechy o dużej skali dominują gradient i odległości, a jeden learning rate nie pasuje.Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Las losowy czy gradient boostingGradient boosting po dostrojeniu bywa o włos dokładniejszy, las losowy jest odporniejszy na złe ustawienia. Na małych danych różnice giną zwykle w szumie.XGBoost, LightGBM czy CatBoostPo dostrojeniu XGBoost, LightGBM i CatBoost dają niemal identyczne wyniki. Różnią się ustawieniami domyślnymi, obsługą kategorii, szybkością i ekosystemem.Maszyna wektorów nośnych (SVM) InteraktywneSVM szuka granicy, która oddziela klasy z jak największym marginesem. Decydują o niej tylko punkty przy granicy, a jądra pozwalają kreślić granice krzywe.Sztuczka jądrowaSztuczka jądrowa pozwala modelowi liniowemu działać w ogromnej przestrzeni cech bez jej liczenia: wystarczy funkcja, która zwraca iloczyny skalarne.Zbiór treningowy, walidacyjny i testowy InteraktywneTrening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.Walidacja krzyżowa InteraktywneWalidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.Warianty walidacji krzyżowej InteraktywneWariant walidacji krzyżowej musi naśladować sposób, w jaki model spotka nowe dane: warstwowanie dla klas, grupy dla pacjentów, porządek czasu dla prognoz.Strojenie hiperparametrówStrojenie hiperparametrów to wybór ustawień modelu, których algorytm nie uczy się sam, na podstawie walidacji. Wynik zwycięzcy jest zawsze nieco zawyżony.K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.Analiza głównych składowych (PCA) InteraktywnePCA obraca układ współrzędnych tak, by pierwsze osie łapały jak najwięcej zmienności danych. Pozwala zastąpić wiele skorelowanych cech kilkoma nowymi.Pułapki PCA InteraktywnePCA łatwo zepsuć: brak standaryzacji, mylenie wariancji z ważnością, wyciek danych, nadinterpretacja ładunków i liniowość tam, gdzie struktura jest zakrzywiona.Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.Przekleństwo wymiarowości InteraktywneWraz z liczbą wymiarów przestrzeń pustoszeje wykładniczo, a odległości między punktami stają się prawie równe. Metody oparte na sąsiedztwie tracą sens.Zjawisko Hughesa InteraktywnePrzy stałej liczbie przykładów dokładność klasyfikatora najpierw rośnie z liczbą cech, a potem spada, bo parametrów do oszacowania przybywa szybciej niż danych.