ML Atlas

Dział 11 · 45 haseł

Prawa i prawdy

Twierdzenia, paradoksy i twarde prawdy uczenia maszynowego: No Free Lunch, kompromis obciążenie–wariancja, Simpson, Goodhart, klątwa wymiarowości i inne.

  1. Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.
  2. Kompromis obciążenie–wariancja InteraktywneBłąd modelu na nowych danych rozkłada się na obciążenie, wariancję i szum. Prostszy model ma większe obciążenie, bogatszy — większą wariancję.
  3. Podwójne zejście (double descent) InteraktywneBłąd testowy rośnie, gdy model ledwo mieści dane treningowe, a potem znów spada, gdy parametrów jest znacznie więcej niż przykładów.
  4. Przekleństwo wymiarowości InteraktywneWraz z liczbą wymiarów przestrzeń pustoszeje wykładniczo, a odległości między punktami stają się prawie równe. Metody oparte na sąsiedztwie tracą sens.
  5. Zjawisko Hughesa InteraktywnePrzy stałej liczbie przykładów dokładność klasyfikatora najpierw rośnie z liczbą cech, a potem spada, bo parametrów do oszacowania przybywa szybciej niż danych.
  6. Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.
  7. Wszystkie modele są błędneKażdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.
  8. Śmieci na wejściu, śmieci na wyjściuModel nie będzie lepszy niż dane, z których się uczy: błędne etykiety, stronnicza próbka i zbędne cechy przechodzą wprost do predykcji. Dlaczego tak jest.
  9. Wyciek danych (data leakage) InteraktywneWyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.
  10. Prawo Goodharta InteraktywneGdy miara staje się celem, przestaje być dobrą miarą. W ML optymalizowanie zastępczej metryki rozjeżdża ją z tym, na czym naprawdę nam zależy.
  11. Przeuczenie do tablicy wyników InteraktywnePoprawianie modelu pod wynik na publicznej tablicy dopasowuje go do szumu tej małej próbki. Na zbiorze prywatnym wynik spada, a ranking się tasuje.
  12. Klątwa zwycięzcy InteraktywneWynik kandydata wybranego jako najlepszy na tych samych danych jest zawyżony, bo wybór faworyzuje korzystny szum pomiaru. Na nowych danych szczęście znika.
  13. Selekcja na szumnym pomiarze InteraktywneZysk z selekcji to pozorna przewaga wybranych pomnożona przez rzetelność pomiaru. Gdy miara to głównie szum, wybór najlepszych nagradza szczęście.
  14. Paradoks dokładnościPrzy niezbalansowanych klasach model, który zawsze przewiduje klasę większościową, ma wysoką dokładność i jest bezużyteczny. Dlaczego i czym to mierzyć.
  15. Prawo wielkich liczb InteraktywneŚrednia z coraz większej liczby niezależnych prób zbliża się do wartości oczekiwanej. Wyjaśniamy, dlaczego tak jest i czego to prawo nie obiecuje.
  16. Centralne twierdzenie graniczne InteraktywneSuma lub średnia wielu niezależnych wartości ma w przybliżeniu rozkład normalny, nawet gdy pojedyncze wartości są skrajnie skośne. Skąd to się bierze.
  17. Prawo małych liczbLudzie oczekują, że mała próbka będzie wiernym obrazem populacji. Tymczasem małe próbki częściej dają skrajne wyniki, z których wyciągamy fałszywe wnioski.
  18. Regresja do średniej InteraktywneSkrajny wynik w jednym pomiarze zwykle oznacza też skrajne szczęście, więc kolejny pomiar wypada bliżej średniej. Dlaczego to zjawisko myli badaczy.
  19. Błąd zaniedbania stopy bazowej InteraktywneTrafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.
  20. Błąd prokuratora InteraktywneMylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.
  21. Paradoks Simpsona InteraktywneZależność widoczna w całych danych może zniknąć albo się odwrócić po podziale na grupy. Przykład rekrutacji w Berkeley w 1973 roku i wyjaśnienie dlaczego.
  22. Kwartet Anscombe’a InteraktywneCztery zbiory o identycznych średnich, wariancjach, korelacji i prostej regresji wyglądają na wykresie zupełnie inaczej. Dlaczego statystyki nie wystarczą.
  23. Paradoks BerksonaGdy do próbki trafiają tylko obiekty spełniające jakiś warunek, niezależne cechy zaczynają wyglądać na ujemnie skorelowane. Skąd to się bierze.
  24. Błąd przeżywalnościWnioski wyciągane tylko z tych, którzy przetrwali selekcję, są zniekształcone, bo nie widać tych, którzy odpadli. Samoloty Walda i pasażerowie Titanica.
  25. Błąd ekologicznyZależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.
  26. Korelacja to nie przyczynowośćDwie zmienne mogą iść w parze, bo łączy je wspólna przyczyna, odwrotny kierunek wpływu, selekcja albo przypadek. Jak to rozpoznać i co z tym zrobić.
  27. Paradoks SteinaPrzy trzech lub więcej szacowanych średnich ściągnięcie wszystkich w stronę wspólnego punktu daje mniejszy łączny błąd niż osobne średnie. Wyjaśniamy dlaczego.
  28. Prawo BenfordaW wielu zbiorach liczb pierwszą cyfrą jest 1 w około 30% przypadków, a 9 tylko w 5%. Kiedy prawo Benforda działa, dlaczego i kiedy zawodzi.
  29. Prawo ZipfaCzęstość słowa jest w przybliżeniu odwrotnie proporcjonalna do jego miejsca w rankingu: drugie jest o połowę rzadsze od pierwszego. Co to znaczy dla NLP.
  30. Zasada Pareto (80/20)W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.
  31. Wymiar Vapnika–Czerwonenkisa (VC)Wymiar VC to największa liczba punktów, którym rodzina modeli potrafi nadać dowolne etykiety. Im jest większy, tym więcej danych trzeba do pewnej generalizacji.
  32. Nierówność HoeffdingaŚrednia z n niezależnych ograniczonych pomiarów rzadko odbiega od wartości oczekiwanej. Szansa odchylenia o ε maleje wykładniczo z n·ε².
  33. Twierdzenie CoveraProblem klasyfikacji przeniesiony nieliniowo do przestrzeni o wyższym wymiarze staje się z dużym prawdopodobieństwem liniowo separowalny.
  34. Twierdzenie o zbieżności perceptronuJeśli dane są liniowo separowalne z marginesem γ, perceptron znajdzie granicę bezbłędną po co najwyżej (R/γ)² poprawkach, niezależnie od liczby przykładów.
  35. Twierdzenie o uniwersalnej aproksymacjiSieć z jedną warstwą ukrytą i dostatecznie wieloma neuronami może dowolnie dokładnie przybliżyć każdą funkcję ciągłą na ograniczonym obszarze.
  36. Efekt RashomonWiele różnych modeli osiąga prawie identyczną dokładność, a mimo to opowiada odmienne historie o tym, które cechy są ważne i jak działa świat.
  37. Mądrość tłumu i twierdzenie Condorceta InteraktywneWiększość niezależnych głosujących, z których każdy ma rację częściej niż w połowie przypadków, myli się coraz rzadziej. Na tym opierają się zespoły modeli.
  38. Hipoteza rozmaitościDane wysokowymiarowe, jak obrazy czy dźwięk, skupiają się blisko powierzchni o znacznie niższym wymiarze. Dlatego uczenie z nich jest w ogóle wykonalne.
  39. Hipoteza losu na loteriiDuża losowa sieć zawiera małą podsieć, która trenowana od tych samych wag startowych dorównuje całej sieci. Dobrze potwierdzone w małej skali, sporne w dużej.
  40. Prawa skalowania modeliBłąd dużych modeli maleje jak potęga liczby parametrów, danych i obliczeń. Chinchilla: ok. 20 tokenów na parametr. Ekstrapolacja tych praw jest ryzykowna.
  41. Gorzka lekcja (Sutton)W historii AI ogólne metody skalujące się z obliczeniami wygrywały z ręcznie wbudowaną wiedzą ludzką. To interpretacja historii, nie twierdzenie, i ma krytyków.
  42. Paradoks MoravecaTo, co ludziom przychodzi bez wysiłku — widzenie, chodzenie, chwytanie — okazuje się dla maszyn najtrudniejsze, a to, co trudne dla ludzi, bywa dla nich łatwe.
  43. Uczenie na skróty (shortcut learning)Model uczy się najprostszej reguły, która działa na danych treningowych — często przypadkowego śladu zamiast właściwej cechy — i zawodzi, gdy ten ślad znika.
  44. Zdolności emergentne modeliNiektóre umiejętności LLM wydają się pojawiać skokowo po przekroczeniu pewnej skali. Część tych skoków może być artefaktem metryki — to zjawisko sporne.
  45. Zapaść modelu (model collapse)Model trenowany kolejno na danych wygenerowanych przez poprzednie modele traci rzadkie przypadki i różnorodność, aż jego rozkład zapada się do wąskiego wycinka.

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka