Dane referencyjne · 344 wierszy · 6 cech
Palmer Penguins (pingwiny z Antarktydy)
344 pingwiny trzech gatunków (Adelie, Chinstrap, Gentoo) z trzech wysp archipelagu Palmera: długość i grubość dzioba, długość płetwy, masa ciała i płeć.
Dlaczego ten zbiór
Nowoczesny następca Iris: realne braki danych, cechy w bardzo różnych skalach (gramy kontra milimetry) — świetny do pokazania standaryzacji, klastrowania i klasyfikacji.
Podgląd
| species | island | bill_length_mm | bill_depth_mm | flipper_length_mm | body_mass_g | sex |
|---|---|---|---|---|---|---|
| Adelie | Torgersen | 39,1 | 18,7 | 181 | 3750 | MALE |
| Adelie | Torgersen | 39,5 | 17,4 | 186 | 3800 | FEMALE |
| Adelie | Torgersen | 40,3 | 18 | 195 | 3250 | FEMALE |
| Adelie | Torgersen | brak | brak | brak | brak | brak |
| Adelie | Torgersen | 36,7 | 19,3 | 193 | 3450 | FEMALE |
| Adelie | Torgersen | 39,3 | 20,6 | 190 | 3650 | MALE |
| Adelie | Torgersen | 38,9 | 17,8 | 181 | 3625 | FEMALE |
| Adelie | Torgersen | 39,2 | 19,6 | 195 | 4675 | MALE |
Kolumny
| Kolumna | Znaczenie | Typ | Braki | Zakres / najczęstsze |
|---|---|---|---|---|
species | gatunek — cel | kategoria | 0 | Adelie (152), Gentoo (124), Chinstrap (68) |
island | wyspa | kategoria | 0 | Biscoe (168), Dream (124), Torgersen (52) |
bill_length_mm | długość dzioba (mm) | liczba | 2 | 32,1 – 59,6 (średnia 43,92) |
bill_depth_mm | grubość dzioba (mm) | liczba | 2 | 13,1 – 21,5 (średnia 17,15) |
flipper_length_mm | długość płetwy (mm) | liczba | 2 | 172 – 231 (średnia 200,92) |
body_mass_g | masa ciała (g) | liczba | 2 | 2700 – 6300 (średnia 4201,75) |
sex | płeć | kategoria | 11 | MALE (168), FEMALE (165) |
Źródło i licencja
Gorman, K., Williams, T., Fraser, W. (2014). PLoS ONE 9(3); Horst, A., Hill, A., Gorman, K. (2020). palmerpenguins R package. Licencja: CC0 1.0. Strona zbioru.
Hasła, w których pojawia się ten zbiór
Zmienne losowe i rozkładyZmienna losowa przypisuje liczbę wynikowi losowego zjawiska, a jej rozkład mówi, jak prawdopodobne są poszczególne wartości. To most między danymi a modelem.Rozkład normalnyRozkład normalny to symetryczna krzywa dzwonowa opisana średnią i odchyleniem standardowym. Pojawia się tam, gdzie wynik jest sumą wielu drobnych wpływów.Wartość oczekiwana i wariancjaWartość oczekiwana to średnia, wokół której skupia się zmienna losowa, a wariancja mierzy, jak szeroko wartości rozrzucają się wokół tej średniej.Kowariancja i korelacja InteraktywneKowariancja mówi, czy dwie zmienne rosną razem, ale zależy od jednostek. Korelacja to kowariancja przeskalowana do zakresu od −1 do 1.Przedział ufności InteraktywnePrzedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.Testowanie hipotez i wartość p InteraktywneTest hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.Entropia i dywergencja KLEntropia mierzy średnią niepewność rozkładu w bitach. Dywergencja KL mówi, ile bitów tracimy, opisując dane rozkładem Q zamiast prawdziwego rozkładu P.Eksploracyjna analiza danych (EDA) InteraktywneEDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.Normalizacja czy standaryzacjaNormalizacja min-max ściska cechę do przedziału 0–1, standaryzacja daje średnią 0 i odchylenie 1. Ważniejsze od wyboru metody jest to, by w ogóle skalować.Uczenie nadzorowane a nienadzorowaneW uczeniu nadzorowanym model dostaje przykłady z poprawnymi odpowiedziami, w nienadzorowanym tylko surowe dane i sam szuka w nich struktury.Granica decyzyjna InteraktywneGranica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.Metoda k najbliższych sąsiadów (kNN) InteraktywneMetoda kNN klasyfikuje nowy punkt głosem k najbliższych przykładów treningowych. Jest prosta i elastyczna, ale wrażliwa na skalę cech i ich liczbę.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Trafność czy zbalansowana trafnośćTrafność liczy odsetek wszystkich poprawnych odpowiedzi, a zbalansowana trafność uśrednia recall każdej klasy. Przy rzadkiej klasie tylko ta druga widzi kłopot.Uczenie nienadzorowane InteraktywneUczenie bez etykiet: algorytm sam szuka w danych grup, ukrytych kierunków i nietypowych punktów. Wynik zależy od kryterium i od tego, jak opiszesz dane.K-means InteraktywneK-means dzieli punkty na k grup: każdy punkt trafia do najbliższego środka, a środki przesuwają się do średniej swojej grupy. Zwraca k grup, nawet gdy ich brak.Pułapki metody k-średnich InteraktywneK-średnich zawsze zwróci k grup, nawet bez sensu. Psują go skale cech, złe ziarno startowe, wydłużone i nierówne skupiska oraz źle dobrane k.Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.Klasteryzacja hierarchicznaKlasteryzacja hierarchiczna łączy punkty krok po kroku w coraz większe grupy i rysuje z tego drzewo – dendrogram. Liczbę grup wybierasz dopiero na końcu.DBSCAN — klasteryzacja gęstościowaDBSCAN łączy w grupy obszary gęsto upakowanych punktów, a rzadkie punkty oznacza jako szum. Znajduje skupiska dowolnego kształtu bez podawania ich liczby.K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.Mieszanina gaussowska i algorytm EMMieszanina gaussowska zakłada, że dane pochodzą z kilku rozkładów normalnych. Algorytm EM na zmianę zgaduje przynależność punktów i poprawia rozkłady.Wszystkie modele są błędneKażdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.Błąd ekologicznyZależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.Prawo BenfordaW wielu zbiorach liczb pierwszą cyfrą jest 1 w około 30% przypadków, a 9 tylko w 5%. Kiedy prawo Benforda działa, dlaczego i kiedy zawodzi.Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.