ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Co oznacza brzytwa Ockhama w uczeniu maszynowym i czy prostszy model jest lepszy?

W skrócie

Spośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.

Co to jest

Spośród hipotez, które równie dobrze tłumaczą dane, należy wybrać najprostszą. Zasadę przypisuje się Williamowi Ockhamowi (XIV wiek); dla uczenia maszynowego ścisłą wersję dowiedli Anselm Blumer, Andrzej Ehrenfeucht, David Haussler i Manfred Warmuth w 1987 roku.

W uczeniu maszynowym „prostota” przybiera konkretne formy: mniej parametrów, płytsze drzewo, mniej cech, mniejsza norma wag, krótszy opis modelu. Praktyczna wersja brzmi: jeśli prosty i złożony model mają podobny wynik walidacyjny, wybierz prosty — będzie stabilniejszy, łatwiejszy do zrozumienia i mniej podatny na niespodzianki.

Trzeba jednak odróżnić dwie tezy. Pierwsza: „prostszy model ma mniejszą szansę na przypadkowe dopasowanie” — prawdziwa i udowodniona. Druga: „prostszy model jest bliżej prawdy” — fałszywa jako zasada ogólna. Świat bywa złożony.

Mechanizm — dlaczego tak działa

Wersja Blumera i in. opiera się na liczeniu. Jeśli hipotezę da się zapisać w k bitach, to takich hipotez jest co najwyżej 2^k. Im mniej kandydatów, tym mniejsze prawdopodobieństwo, że któryś z nich zgodzi się z danymi treningowymi przypadkiem. Krótki opis, który pasuje do wielu przykładów, z dużym prawdopodobieństwem uchwycił rzeczywistą regularność. Z tego samego rachunku wynika granica Hoeffdinga z poprawką na liczbę hipotez i wymiar VC.

Druga droga prowadzi przez statystykę bayesowską. Model złożony potrafi wyjaśnić wiele różnych zbiorów danych, więc rozkłada „prawdopodobieństwo” cienko. Model prosty stawia na niewiele wyników — jeśli dane akurat do nich pasują, dostaje wysoką wiarygodność brzegową. To tzw. automatyczna brzytwa Ockhama (MacKay, 2003).

Ograniczenia są poważne. Pedro Domingos w 1999 roku zebrał przykłady, w których złożone modele (komitety, lasy) generalizują lepiej niż proste, i argumentował, że prostota jest wartością samą w sobie (zrozumiałość), a nie gwarancją trafności. Duże sieci neuronowe mają miliony parametrów, a generalizują dobrze — liczba parametrów okazała się złą miarą „złożoności”. Wreszcie zasada „nie ma darmowego lunchu” przypomina, że preferencja prostoty to założenie o świecie, które nie zawsze jest spełnione.

Na przykładzie

Breast Cancer Wisconsin, drzewo decyzyjne, 10-krotna walidacja krzyżowa. Drzewo o głębokości 3 (8 liści) ma dokładność 0,937, o głębokości 4 (12 liści) — 0,942. Drzewo bez ograniczeń (22 liście) idealnie dopasowuje się do treningu (1,000), a w walidacji ma 0,923 — gorzej niż drzewo trzykrotnie mniejsze. Różnice między głębokościami 3–6 mieszczą się w odchyleniu standardowym wyników (około 0,035), więc brzytwa każe wybrać drzewo płytkie.

Diabetes (442 pacjentów, 10 cech): regresja liniowa ma w walidacji krzyżowej R² = 0,48. Dodanie wszystkich kwadratów i iloczynów cech (65 cech) obniża R² do 0,41, a wielomian 3. stopnia (285 cech) daje R² = −14,8 — gorzej niż przewidywanie średniej. Tu prostota wygrywa wyraźnie. Ale na Digits ten sam argument by zawiódł: SVM z jądrem RBF bije regresję logistyczną (0,98 wobec 0,97).

Dane: Breast Cancer Wisconsin (diagnostyka raka piersi) Digits (ręcznie pisane cyfry 8×8) Diabetes (progresja cukrzycy)

W praktyce

  • „Reguła jednego odchylenia standardowego”: wybierz najprostszy model, którego wynik walidacyjny jest w granicy jednego SE od najlepszego.
  • Narzędzia prostoty: max_depth, min_samples_leaf, ccp_alpha w drzewach; alpha w Ridge/Lasso; C w LogisticRegression.
  • Kryteria informacyjne (AIC, BIC) to formalna brzytwa dla modeli statystycznych — karzą liczbę parametrów.
  • Prostota to także liczba kroków przetwarzania: mniej ręcznych transformacji = mniej miejsc na błąd i wyciek.
  • Nie upraszczaj kosztem wyniku, który ma znaczenie biznesowe — brzytwa rozstrzyga remisy, nie wygrane.

Najczęstsze pytania

Czy prostszy model zawsze generalizuje lepiej?
Nie. Generalizuje lepiej, gdy złożony model dopasowuje szum zamiast struktury. Jeśli zależność jest naprawdę złożona i danych jest dużo, prostszy model będzie systematycznie niedouczony.
Jak zmierzyć prostotę modelu?
Nie ma jednej miary: liczba parametrów, długość opisu (MDL), wymiar VC, norma wag, liczba liści. Te miary potrafią się nie zgadzać — sieć z milionem parametrów może mieć małą normę i zachowywać się „prosto”.
Czy regularyzacja to brzytwa Ockhama?
W dużej mierze tak: kara za duże wagi to sformalizowana preferencja prostszych rozwiązań. Różnica polega na tym, że regularyzacja nie wybiera między gotowymi modelami, tylko przesuwa jeden model w stronę prostoty.

Źródła

  • Blumer A., Ehrenfeucht A., Haussler D., Warmuth M. K. (1987). Occam’s Razor. Information Processing Letters, 24(6), 377–380.
  • Domingos P. (1999). The Role of Occam’s Razor in Knowledge Discovery. Data Mining and Knowledge Discovery, 3(4), 409–425.
  • MacKay D. J. C. (2003). Information Theory, Inference, and Learning Algorithms. Cambridge University Press, rozdz. 28.
  • Hastie T., Tibshirani R., Friedman J. (2009). The Elements of Statistical Learning, 2nd ed. Springer, rozdz. 7.

Zobacz też