11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja
Co mówi prawo Goodharta i dlaczego optymalizowanie metryki psuje model?
W skrócie
Gdy miara staje się celem, przestaje być dobrą miarą. W ML optymalizowanie zastępczej metryki rozjeżdża ją z tym, na czym naprawdę nam zależy.
Co to jest
Gdy miara staje się celem, przestaje być dobrą miarą. W tej zwięzłej formie zasadę ujęła antropolożka Marilyn Strathern w 1997 roku, streszczając obserwację ekonomisty Charlesa Goodharta z 1975 roku: każda obserwowana prawidłowość statystyczna załamuje się, gdy zaczyna się na nią wywierać presję w celach kontroli.
W uczeniu maszynowym prawie zawsze optymalizujemy coś zastępczego (proxy): stratę logarytmiczną zamiast decyzji biznesowej, wynik na benchmarku zamiast ogólnej umiejętności, ocenę modelu nagrody zamiast prawdziwej preferencji człowieka. Dopóki optymalizacja jest słaba, miara i cel idą w parze. Im mocniej optymalizujemy, tym większa szansa, że znajdziemy sposób na poprawę miary, który nie poprawia celu — albo wręcz mu szkodzi.
Klasyczne przykłady z ML: agent uczenia ze wzmocnieniem, który zamiast wygrywać wyścig, krąży w kółko, zbierając punkty bonusowe; model językowy dostrojony do modelu nagrody, który uczy się długich, przymilnych odpowiedzi, bo te dostają wyższe noty.
Mechanizm — dlaczego tak działa
Miara to cel plus błąd: proxy = cel + ε. Gdy wybieramy rozwiązanie z najwyższym proxy spośród wielu kandydatów, wybieramy jednocześnie wysokie wartości celu i wysokie wartości błędu. Im więcej kandydatów przeszukujemy (silniejsza optymalizacja), tym większa część zmierzonego zysku pochodzi z błędu, a nie z celu. To efekt selekcji na zaszumionym pomiarze, ten sam co klątwa zwycięzcy.
David Manheim i Scott Garrabrant (2018) wyróżnili kilka wariantów. Wariant regresyjny: sama selekcja na szumie powoduje, że wybrani są gorsi, niż wskazuje miara. Wariant ekstremalny: przy skrajnych wartościach zależność między miarą a celem może wyglądać zupełnie inaczej niż w typowym zakresie. Wariant przyczynowy: optymalizujemy coś, co korelowało z celem, ale go nie powodowało. Wariant adwersarialny: ktoś (lub sam model) celowo wykorzystuje lukę w mierze.
Gdy błąd miary ma grube ogony — rzadkie, ale ogromne pomyłki — silna optymalizacja wybiera prawie wyłącznie te pomyłki. Gao, Schulman i Hilton (2023) zmierzyli to dla modeli nagrody w uczeniu modeli językowych: wraz z siłą optymalizacji ocena modelu nagrody rośnie cały czas, a prawdziwa jakość najpierw rośnie, a potem spada.
Na przykładzie
Symulacja: N kandydatów, każdy ma prawdziwą jakość z rozkładu normalnego, a mierzymy ją z błędem. Wybieramy kandydata o najwyższej mierze. Gdy błąd jest normalny (tej samej skali co jakość), przy 10 kandydatach wybrany ma miarę 2,17 i prawdziwą jakość 1,09; przy 100 — 3,55 i 1,77; przy 10 000 — 5,45 i 2,71. Prawdziwy zysk rośnie, ale tylko połowę tego, co obiecuje miara.
Gdy błąd ma grube ogony (rozkład t-Studenta z 2 stopniami swobody), obraz się odwraca. Przy 10 kandydatach: miara 4,0, jakość 0,72. Przy 100: miara 12,4, jakość 0,35. Przy 1000: miara 40, jakość 0,17. Przy 10 000: miara 119, jakość 0,05 — prawie zero. Im mocniej optymalizujemy, tym wyższa miara i tym gorszy rzeczywisty wybór. To prawo Goodharta w czystej postaci.
W praktyce
- Mierz kilka metryk naraz (np.
roc_auc,average_precision, kalibrację) i sprawdzaj, czy poprawa jednej nie jest okupiona pogorszeniem innych. - Utrzymuj odłożony zbiór testowy, na którym niczego nie optymalizujesz, i sprawdzaj go rzadko.
- W RLHF dodaje się karę KL względem modelu bazowego, aby ograniczyć siłę optymalizacji modelu nagrody.
- Regularnie oglądaj konkretne przykłady wyjść modelu — liczba nie pokaże, że model „oszukuje” metrykę.
- Gdy metryka zaczyna rosnąć podejrzanie szybko, najpierw szukaj luki w metryce, a dopiero potem świętuj.
Najczęstsze pytania
- Czy prawo Goodharta znaczy, że nie należy używać metryk?
- Nie. Znaczy, że metryka jest narzędziem diagnostycznym, a nie celem samym w sobie. Im mocniej na nią naciskasz, tym częściej trzeba sprawdzać, czy nadal mierzy to, co trzeba.
- Jaki jest związek z przeuczeniem do leaderboardu?
- To ten sam mechanizm. Wynik na publicznej tablicy wyników to miara zastępcza dla jakości na nowych danych; wielokrotne optymalizowanie pod nią dopasowuje model do jej szumu.
- Czym różni się prawo Goodharta od prawa Campbella?
- Donald Campbell w 1979 roku sformułował podobną zasadę dla wskaźników społecznych: im częściej wskaźnik służy do decyzji, tym bardziej podlega naciskom i zniekształca proces, który miał mierzyć. Obie zasady opisują ten sam problem z różnych dziedzin.
Źródła
- Goodhart C. A. E. (1975). Problems of Monetary Management: The U.K. Experience. Papers in Monetary Economics, Reserve Bank of Australia.
- Strathern M. (1997). „Improving Ratings”: Audit in the British University System. European Review, 5(3), 305–321.
- Manheim D., Garrabrant S. (2018). Categorizing Variants of Goodhart’s Law. arXiv:1803.04585.
- Gao L., Schulman J., Hilton J. (2023). Scaling Laws for Reward Model Overoptimization. ICML 2023.
- Campbell D. T. (1979). Assessing the Impact of Planned Social Change. Evaluation and Program Planning, 2(1), 67–90.