11 · Prawa i prawdy · 3 min czytania · Interaktywne · aktualizacja
Na czym polega kompromis między obciążeniem a wariancją modelu?
W skrócie
Błąd modelu na nowych danych rozkłada się na obciążenie, wariancję i szum. Prostszy model ma większe obciążenie, bogatszy — większą wariancję.
Co to jest
Oczekiwany błąd kwadratowy modelu na nowych danych równa się sumie kwadratu obciążenia, wariancji i nieredukowalnego szumu, a zmniejszanie jednego składnika zwykle zwiększa drugi. Rozkład jest klasycznym wynikiem statystyki; do sieci neuronowych wprowadzili go Stuart Geman, Elie Bienenstock i René Doursat w 1992 roku pod nazwą „dylemat obciążenia i wariancji”.
Obciążenie (bias) to błąd systematyczny: jak daleko od prawdy jest model uśredniony po wielu możliwych zbiorach treningowych. Wariancja to rozrzut: jak bardzo model zmienia się, gdy dostanie inną próbkę z tego samego źródła. Szum to część zmienności etykiet, której żaden model nie przewidzi.
Intuicja: prosta linia dopasowana do fali sinusa za każdym razem wychodzi podobnie — i za każdym razem źle (duże obciążenie, mała wariancja). Wielomian wysokiego stopnia średnio trafia w falę, ale każda próbka daje inną, rozedrganą krzywą (małe obciążenie, duża wariancja).
Mechanizm — dlaczego tak działa
Dla punktu x i modelu f̂ uczonego na losowym zbiorze treningowym zachodzi tożsamość: E[(y − f̂(x))²] = (E[f̂(x)] − f(x))² + Var[f̂(x)] + σ². To nie empiryczna obserwacja, tylko algebra: dodajemy i odejmujemy średnią prognozę, a wyrazy mieszane znikają w oczekiwaniu.
Kompromis bierze się z tego, że oba składniki zależą od elastyczności modelu w przeciwnych kierunkach. Model sztywny nie potrafi wyrazić prawdziwej zależności, więc jego średnia się myli. Model elastyczny potrafi wyrazić prawie wszystko — także przypadkowy szum konkretnej próbki — więc to, co wyrazi, zależy od losu próbki.
Wariancję obniża więcej danych (szum się uśrednia), regularyzacja (karzemy skrajne parametry), uśrednianie wielu modeli (bagging, lasy losowe). Obciążenie obniża bogatsza klasa modeli lub lepsze cechy. Szumu nie obniży nic poza lepszymi pomiarami.
Ważne zastrzeżenie: obraz „krzywej w kształcie U” w zależności od liczby parametrów nie jest prawem natury. Rozkład błędu jest zawsze prawdziwy, ale wariancja wcale nie musi rosnąć z liczbą parametrów — w silnie przeparametryzowanych modelach potrafi znów spadać. To zjawisko podwójnego zejścia, które zmusiło do doprecyzowania, co właściwie mierzy „złożoność”.
Na przykładzie
Wzięliśmy 25 równo rozłożonych punktów x z przedziału [0, 1], etykiety y = sin(2πx) plus szum o odchyleniu 0,3 (więc szum wnosi σ² = 0,09). Tysiąc razy losowaliśmy nowy szum i dopasowywaliśmy wielomiany różnych stopni, a potem liczyliśmy obciążenie² i wariancję na siatce punktów.
Stopień 1 (prosta): obciążenie² 0,186, wariancja 0,007, łączny błąd 0,28. Stopień 3: 0,005 i 0,012, łącznie 0,107. Stopień 5: obciążenie praktycznie zero, wariancja 0,017, łącznie 0,108. Stopień 9: wariancja 0,031, łącznie 0,121. Stopień 13: wariancja 0,052, łącznie 0,142. Obciążenie znika już przy stopniu 5, a od tej pory każdy dodatkowy stopień dokłada tylko wariancji. Najlepszy kompromis to stopnie 3–5.
W praktyce
- Diagnozę robi się krzywymi:
validation_curve(błąd vs złożoność) ilearning_curve(błąd vs liczba przykładów). - Duża luka między wynikiem treningowym a walidacyjnym → wysoka wariancja: więcej danych, regularyzacja (
Ridge,alpha,max_depth,dropout), bagging. - Oba wyniki słabe i bliskie sobie → wysokie obciążenie: bogatszy model, lepsze cechy (
PolynomialFeatures), mniej regularyzacji. - Lasy losowe (
RandomForestClassifier) to praktyczna maszyna do obniżania wariancji drzew bez podnoszenia obciążenia. - Typowy błąd: dobieranie złożoności na zbiorze testowym — wtedy zmierzona wariancja jest zaniżona.
Najczęstsze pytania
- Czy da się mieć jednocześnie małe obciążenie i małą wariancję?
- Tak, jeśli danych jest dużo w stosunku do złożoności problemu albo model ma dobre założenia o strukturze danych. Kompromis jest twardy tylko przy ustalonej ilości danych i ustalonej rodzinie modeli.
- Czy w głębokim uczeniu ten kompromis nadal obowiązuje?
- Rozkład błędu obowiązuje zawsze, bo to tożsamość matematyczna. Nie obowiązuje natomiast naiwna reguła „więcej parametrów = większa wariancja” — bardzo duże sieci często generalizują lepiej niż średnie.
- Czym różni się obciążenie modelu od obciążenia w sensie uprzedzeń (fairness)?
- To różne pojęcia o tej samej nazwie. Tu obciążenie to systematyczny błąd prognozy względem prawdziwej funkcji; w kontekście sprawiedliwości chodzi o nierówne traktowanie grup.
Źródła
- Geman S., Bienenstock E., Doursat R. (1992). Neural Networks and the Bias/Variance Dilemma. Neural Computation, 4(1), 1–58.
- James G., Witten D., Hastie T., Tibshirani R. (2021). An Introduction to Statistical Learning, 2nd ed. Springer, rozdz. 2.2.2.
- Hastie T., Tibshirani R., Friedman J. (2009). The Elements of Statistical Learning, 2nd ed. Springer, rozdz. 7.3.
- Belkin M., Hsu D., Ma S., Mandal S. (2019). Reconciling modern machine-learning practice and the classical bias–variance trade-off. PNAS, 116(32), 15849–15854.