11 · Prawa i prawdy · 4 min czytania · aktualizacja
Czym jest efekt Rashomon w uczeniu maszynowym i dlaczego ważność cech bywa niestabilna?
W skrócie
Wiele różnych modeli osiąga prawie identyczną dokładność, a mimo to opowiada odmienne historie o tym, które cechy są ważne i jak działa świat.
Co to jest
Dla tych samych danych zwykle istnieje wiele istotnie różnych modeli o niemal tej samej trafności, więc dobry wynik nie wskazuje jednego „prawdziwego” wyjaśnienia. Nazwę zaproponował Leo Breiman w 2001 roku w artykule „Statistical Modeling: The Two Cultures”, nawiązując do filmu Akiry Kurosawy, w którym świadkowie tego samego zdarzenia opowiadają sprzeczne wersje.
Zbiór modeli, których błąd mieści się w małej tolerancji od najlepszego, nazywa się dziś zbiorem Rashomon. Modele z tego zbioru mogą korzystać z różnych cech, przypisywać im różną wagę i dawać różne prognozy dla poszczególnych osób — choć ich wyniki na zbiorze testowym są nie do odróżnienia.
Dla praktyka to ostrzeżenie: wykres ważności cech z jednego modelu jest opisem tego modelu, a nie danych. Jeśli inny, równie dobry model mówi coś innego, żaden z nich nie ma prawa do ostatniego słowa.
Mechanizm — dlaczego tak działa
Źródłem jest niedookreślenie. Skończony zbiór danych ogranicza model tylko w punktach, które widzieliśmy, a między nimi dopuszcza wiele zachowań. Gdy cechy są skorelowane, model może „przelać” zależność z jednej cechy na drugą bez straty jakości: klasa biletu, cena biletu i pokład niosą częściowo tę samą informację o zamożności pasażera.
Do tego dochodzą różne obciążenia indukcyjne algorytmów: regresja logistyczna preferuje efekty addytywne, drzewo — progi, kNN — lokalne podobieństwo. Każdy z nich wybiera inny punkt ze zbioru Rashomon. Nawet ten sam algorytm na innym podzbiorze danych lub z innym ziarnem losowości ląduje w innym miejscu tego zbioru.
Fisher, Rudin i Dominici (2019) zaproponowali, by zamiast ważności cechy w jednym modelu raportować jej przedział ważności po całym zbiorze Rashomon (model class reliance). D’Amour i in. (2022) pokazali to samo w dużych sieciach: modele różniące się tylko ziarnem losowości mają tę samą dokładność testową, ale zupełnie różnie zachowują się po przesunięciu rozkładu danych.
Efekt ma też jasną stronę. Duży zbiór Rashomon oznacza, że wśród równie dobrych modeli często istnieje model prosty i interpretowalny (Semenova, Rudin, Parr, 2022). Warto go poszukać, zamiast z góry wybierać czarną skrzynkę.
Na przykładzie
Titanic (891 pasażerów; cechy: klasa, płeć, wiek, rodzeństwo/małżonek, rodzice/dzieci, cena biletu). Sześć modeli ma w 5-krotnej walidacji krzyżowej dokładność od 0,79 do 0,83: regresja logistyczna 0,79, kNN 0,80, drzewo o głębokości 4 0,82, las losowy, SVM 0,83, gradient boosting 0,83. Wszystkie zgadzają się, że płeć jest najważniejsza (ważność permutacyjna 0,19–0,24). Dalej zgoda się kończy.
Na drugim miejscu regresja logistyczna, drzewo, kNN i gradient boosting stawiają klasę, las losowy — wiek, a SVM — liczbę rodziców/dzieci, którą regresja logistyczna uważa za niemal bez znaczenia (0,006). Cena biletu: w ważności opartej na nieczystości lasu losowego jest drugą cechą (0,25), a w ważności permutacyjnej regresji logistycznej, drzewa i SVM — około zera. Cztery drzewa o głębokości 4 wyuczone na próbkach bootstrapowych miały dokładność 0,79–0,84, a ważność ceny biletu wahała się w nich od 0,12 do 0,23.
Dane: Titanic
W praktyce
- Ważność cech licz dla kilku dobrych modeli i kilku ziaren losowości; raportuj zakres, nie pojedynczą liczbę.
permutation_importanceliczona na zbiorze testowym jest bardziej porównywalna między modelami niżfeature_importances_z drzew.- Przy skorelowanych cechach grupuj je i oceniaj ważność grupy, a nie pojedynczych kolumn.
- Jeśli prosty model (płytkie drzewo, regresja z kilkoma cechami) jest w zbiorze Rashomon, wybierz go do interpretacji.
- Nie wyciągaj wniosków przyczynowych z ważności cech — ani jednego modelu, ani całego zbioru.
Najczęstsze pytania
- Który z równie dobrych modeli mówi prawdę?
- Żaden nie ma uprzywilejowanej pozycji, jeśli dane nie pozwalają ich rozróżnić. Rozstrzygnąć mogą tylko nowe dane, eksperyment albo wiedza dziedzinowa o mechanizmie.
- Czy efekt Rashomon to to samo co niestabilność modelu?
- Są blisko spokrewnione. Niestabilność to zmiana modelu pod wpływem małej zmiany danych; efekt Rashomon to istnienie wielu różnych modeli o tej samej jakości. Niestabilność jest jednym ze sposobów, w jaki zbiór Rashomon ujawnia się w praktyce.
- Czy to problem tylko dla interpretacji?
- Nie. Modele z tego samego zbioru mogą dawać różne decyzje dla konkretnych osób (tzw. wielość predykcyjna), co ma znaczenie w kredytach czy medycynie, a także różnie zachowywać się na nowych danych.
Źródła
- Breiman L. (2001). Statistical Modeling: The Two Cultures. Statistical Science, 16(3), 199–231.
- Fisher A., Rudin C., Dominici F. (2019). All Models are Wrong, but Many are Useful: Learning a Variable’s Importance by Studying an Entire Class of Prediction Models Simultaneously. Journal of Machine Learning Research, 20(177), 1–81.
- D’Amour A. i in. (2022). Underspecification Presents Challenges for Credibility in Modern Machine Learning. Journal of Machine Learning Research, 23(226), 1–61.
- Semenova L., Rudin C., Parr R. (2022). On the Existence of Simpler Machine Learning Models. ACM FAccT 2022.