01 · Podstawy · 4 min czytania · aktualizacja
Czym jest rozkład normalny (krzywa Gaussa) i dlaczego jest tak częsty?
W skrócie
Rozkład normalny to symetryczna krzywa dzwonowa opisana średnią i odchyleniem standardowym. Pojawia się tam, gdzie wynik jest sumą wielu drobnych wpływów.
Co to jest
Rozkład normalny (rozkład Gaussa) to ciągły rozkład prawdopodobieństwa o symetrycznej, dzwonowatej gęstości, w pełni opisany dwiema liczbami: średnią μ (gdzie jest środek) i odchyleniem standardowym σ (jak szeroki jest dzwon). Gęstość ma postać f(x) = 1 / (σ√(2π)) · e^(−(x − μ)² / (2σ²)). Zapis X ~ N(μ, σ²) czyta się „X ma rozkład normalny ze średnią μ i wariancją σ²”.
Najbardziej użyteczna jest reguła 68–95–99,7: w odległości jednego σ od średniej leży około 68,3% wartości, dwóch σ — 95,4%, trzech σ — 99,7%. Wartość odległa o więcej niż 3σ zdarza się średnio raz na około 370 obserwacji, więc w małych zbiorach jest sygnałem, że coś jest nietypowe.
Rozkład normalny jest wszędzie w statystyce i uczeniu maszynowym: w założeniach regresji liniowej, w inicjalizacji wag sieci, w szumie dodawanym w modelach dyfuzyjnych, w mieszaninach gaussowskich do grupowania i w przedziałach ufności. Warto jednak pamiętać, że jest wygodnym modelem, a nie prawem natury.
Mechanizm — dlaczego tak działa
Dlaczego właśnie ten kształt? Główny powód to centralne twierdzenie graniczne: suma (lub średnia) wielu niezależnych, drobnych wpływów, z których żaden nie dominuje, ma rozkład bliski normalnemu — niezależnie od tego, jak rozkładają się same wpływy. Wzrost człowieka zależy od setek genów i czynników środowiskowych, błąd pomiaru od wielu drobnych zakłóceń. Każdy z nich dokłada małą „cegiełkę” w górę albo w dół, a suma układa się w dzwon.
Drugi powód jest teoretyczny: spośród wszystkich rozkładów o danej średniej i wariancji normalny ma największą entropię, czyli zakłada najmniej poza tymi dwiema liczbami. Jeśli wiemy tylko, gdzie jest środek i jaki jest rozrzut, rozkład normalny jest najbardziej „ostrożnym” wyborem.
Trzeci powód to wygoda obliczeniowa. Suma niezależnych zmiennych normalnych jest normalna, przekształcenie liniowe zmiennej normalnej jest normalne, a logarytm gęstości to funkcja kwadratowa. Ten ostatni fakt ma ważną konsekwencję: maksymalizacja wiarygodności przy założeniu normalnego szumu jest dokładnie tym samym co minimalizacja błędu średniokwadratowego. Metoda najmniejszych kwadratów to ukryte założenie o normalności błędów.
Zastrzeżenia są poważne. Wiele zjawisk ma ciężkie ogony: dochody, wielkości miast, zwroty giełdowe czy ruch na stronach internetowych. Tam wartości odległe o 5σ czy 10σ zdarzają się nieporównanie częściej, niż przewiduje krzywa Gaussa, a modele zakładające normalność systematycznie niedoszacowują ryzyka. Dane ograniczone z jednej strony (czasy, ceny) bywają skośne i lepiej opisuje je rozkład log-normalny. Wreszcie mieszanina kilku grup normalnych nie jest normalna — może mieć dwa garby albo grubsze ramiona.
Na przykładzie
W zbiorze pingwinów długość płetwy 151 pingwinów Adeli ma średnią 190,0 mm i odchylenie standardowe 6,5 mm. W odległości jednego σ od średniej leży 70,9% ptaków, a dwóch σ — 96,0%, blisko teoretycznych 68,3% i 95,4%. Test Shapiro–Wilka nie daje podstaw do odrzucenia normalności (p = 0,72). Model normalny przewiduje, że płetwę dłuższą niż 200 mm ma 6,2% Adeli; w danych jest to 7 ptaków, czyli 4,6% — rozsądna zgodność przy tej liczebności.
Ale weźmy wszystkie 342 pingwiny trzech gatunków razem. Średnia to 200,9 mm, odchylenie 14,1 mm, a w odległości jednego σ leży tylko 62,9% ptaków zamiast 68,3%. Test Shapiro–Wilka odrzuca normalność z p poniżej 0,0001. Powód: to mieszanina trzech gatunków o różnych średnich (190,0, 195,8 i 217,2 mm), więc rozkład ma dwa garby. Każda grupa z osobna wygląda „normalnie”, cała populacja — nie. Dokładnie taką strukturę modeluje mieszanina gaussowska.
Dane: Palmer Penguins (pingwiny z Antarktydy)
W praktyce
scipy.stats.norm(loc=μ, scale=σ)daje gęstość (pdf), dystrybuantę (cdf), kwantyle (ppf) i losowanie (rvs); w NumPy losuj przezrng.normal(μ, σ, n).- Normalność sprawdzaj wykresem kwantyl-kwantyl (
scipy.stats.probplot) zamiast polegać wyłącznie na testach — przy dużych próbach testy odrzucają nawet nieistotne odchylenia. StandardScalerzamienia cechę na z = (x − μ) / σ, ale nie czyni jej rozkładu normalnym; do tego służąPowerTransformerlubQuantileTransformer(output_distribution='normal').- Reguła „odrzuć wartości powyżej 3σ” działa tylko dla danych zbliżonych do normalnych; przy skośnych lepsze są kwantyle lub IQR.
- Inicjalizacja wag (np.
torch.nn.init.normal_,kaiming_normal_) korzysta z rozkładu normalnego o starannie dobranej wariancji.
Najczęstsze pytania
- Czy dane muszą mieć rozkład normalny, żeby używać ML?
- Nie. Drzewa decyzyjne i ich zespoły są obojętne na kształt rozkładu cech. Założenie normalności dotyczy raczej błędów w klasycznej regresji i niektórych testów statystycznych, a i tam przy dużych próbach często wystarcza normalność średnich.
- Czym jest rozkład normalny standardowy?
- To N(0, 1): średnia 0, odchylenie 1. Każdą zmienną normalną da się do niego sprowadzić wzorem z = (x − μ) / σ, a z mówi, o ile odchyleń standardowych wartość leży od średniej.
- Jak rozpoznać, że rozkład normalny nie pasuje?
- Po wyraźnej skośności, po wielu garbach na histogramie, po wartościach skrajnych częstszych, niż przewiduje reguła 68–95–99,7, i po zakrzywionym wykresie kwantyl-kwantyl. Często pomaga przekształcenie logarytmiczne albo podział danych na grupy.
Źródła
- Bishop „Pattern Recognition and Machine Learning”, Springer, 2006, rozdz. 2.3 (The Gaussian Distribution).
- Blitzstein, Hwang „Introduction to Probability”, 2nd ed., CRC Press, 2019, rozdz. 5.4.
- Murphy „Probabilistic Machine Learning: An Introduction”, MIT Press, 2022, rozdz. 2.6.
- Gorman, Williams, Fraser, 2014, „Ecological sexual dimorphism and environmental variability within a community of Antarctic penguins (genus Pygoscelis)”, PLoS ONE 9(3), e90081.
- Dokumentacja SciPy: scipy.stats.norm, https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.norm.html