ML Atlas

Dane referencyjne · 150 wierszy · 4 cech

Iris (irysy Fishera)

150 kwiatów irysa z trzech gatunków (setosa, versicolor, virginica), po 50 z każdego, z czterema pomiarami: długość i szerokość działki kielicha oraz płatka. Zbiór Ronalda Fishera z 1936 roku.

Dlaczego ten zbiór

Mały, czysty i dwuwymiarowo „widoczny”: setosa oddziela się jedną prostą, versicolor i virginica nachodzą na siebie. Idealny do klasyfikacji, klastrowania i PCA.

Podgląd

sepal length (cm)sepal width (cm)petal length (cm)petal width (cm)target
5,13,51,40,20
4,931,40,20
4,73,21,30,20
4,63,11,50,20
53,61,40,20
5,43,91,70,40
4,63,41,40,30
53,41,50,20

Kolumny

KolumnaZnaczenieTypBrakiZakres / najczęstsze
sepal length (cm)długość działki kielichaliczba04,3 – 7,9 (średnia 5,84)
sepal width (cm)szerokość działki kielichaliczba02 – 4,4 (średnia 3,06)
petal length (cm)długość płatkaliczba01 – 6,9 (średnia 3,76)
petal width (cm)szerokość płatkaliczba00,1 – 2,5 (średnia 1,2)
targetgatunek: 0 setosa, 1 versicolor, 2 virginicakategorie (liczby)00, 1, 2

Źródło i licencja

Fisher, R. A. (1936). The use of multiple measurements in taxonomic problems. Annals of Eugenics 7(2). UCI Machine Learning Repository. Licencja: CC BY 4.0. Strona zbioru.

Hasła, w których pojawia się ten zbiór

Wektory i przestrzenie wektoroweWektor to uporządkowana lista liczb, którą można dodawać i skalować. W ML każdy przykład jest punktem w przestrzeni cech, a podobieństwo staje się odległością.Iloczyn skalarny i podobieństwo kosinusowe InteraktywneIloczyn skalarny mierzy, jak bardzo dwa wektory wskazują w tę samą stronę. Podzielony przez ich długości daje podobieństwo kosinusowe od −1 do 1.Macierze jako przekształceniaMacierz to przepis na przekształcenie przestrzeni: obraca, rozciąga, rzutuje. Mnożenie macierzy przez wektor przenosi punkt, a warstwa sieci robi to samo.Wektory i wartości własne InteraktywneWektor własny to kierunek, który macierz tylko rozciąga, nie obracając go. Wartość własna mówi, jak mocno. Na tym opiera się PCA i analiza dynamiki.Regresja logistyczna czy drzewo decyzyjneRegresja logistyczna wygrywa, gdy wpływ cech jest w miarę liniowy i potrzebne są wiarygodne prawdopodobieństwa. Drzewo wygrywa przy progach i interakcjach.Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.Klasteryzacja hierarchicznaKlasteryzacja hierarchiczna łączy punkty krok po kroku w coraz większe grupy i rysuje z tego drzewo – dendrogram. Liczbę grup wybierasz dopiero na końcu.K-średnich czy DBSCANK-średnich dzieli dane na k zwartych, kulistych grup i przypisuje każdy punkt. DBSCAN szuka gęstych obszarów dowolnego kształtu i odrzuca punkty-szum.Perceptron (sztuczny neuron)Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.Twierdzenie o zbieżności perceptronuJeśli dane są liniowo separowalne z marginesem γ, perceptron znajdzie granicę bezbłędną po co najwyżej (R/γ)² poprawkach, niezależnie od liczby przykładów.