11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja
Co mówi prawo wielkich liczb i dlaczego średnia się stabilizuje?
W skrócie
Średnia z coraz większej liczby niezależnych prób zbliża się do wartości oczekiwanej. Wyjaśniamy, dlaczego tak jest i czego to prawo nie obiecuje.
Co to jest
Średnia z n niezależnych powtórzeń tego samego losowego doświadczenia zbliża się do wartości oczekiwanej, gdy n rośnie. Pierwszy dowód (dla prób typu „sukces–porażka”) podał Jakob Bernoulli w „Ars Conjectandi”, wydanej pośmiertnie w 1713 roku.
To prawo jest powodem, dla którego statystyka w ogóle działa. Pojedynczy rzut monetą jest nieprzewidywalny, ale odsetek orłów w milionie rzutów jest przewidywalny prawie co do promila. Kasyno nie wie, kto wygra przy stole, ale wie, ile zarobi w miesiącu.
W uczeniu maszynowym korzystasz z niego bez przerwy: błąd na zbiorze testowym to średnia po przykładach, gradient z mini-batcha to średnia po próbkach, wynik walidacji krzyżowej to średnia po foldach. Każda z tych liczb jest wiarygodna tylko dlatego, że uśrednia dość dużo niezależnych kawałków.
Mechanizm — dlaczego tak działa
Klucz to wariancja średniej. Jeśli pojedyncza obserwacja ma wariancję σ², to średnia z n niezależnych obserwacji ma wariancję σ²/n. Przypadkowe odchylenia w górę i w dół częściowo się znoszą, bo są niezależne: żeby średnia mocno odjechała, wiele obserwacji musiałoby odjechać w tę samą stronę naraz, a to jest coraz mniej prawdopodobne.
Z tego wynika prosta nierówność Czebyszewa: P(|średnia − μ| ≥ ε) ≤ σ² / (n·ε²). Dla dowolnie małego ε prawa strona maleje do zera, gdy n rośnie. To jest tzw. słabe prawo wielkich liczb. Wersja mocna (Borel, Kołmogorow) mówi więcej: średnia zbiega do μ z prawdopodobieństwem 1, czyli niemal każdy ciąg rzutów ostatecznie się „uspokoi”.
Ważne: tempo jest powolne. Odchylenie standardowe średniej to σ/√n, więc żeby zmniejszyć błąd dwa razy, potrzebujesz czterech razy więcej danych. Dziesięć razy dokładniej oznacza sto razy więcej prób.
Prawo nie mówi, że los „wyrównuje rachunki”. Bezwzględna różnica między liczbą orłów a n/2 wcale nie musi maleć — zwykle rośnie jak √n. Maleje tylko różnica względna, bo dzielimy przez n. Wiara, że po serii orłów „należy się” reszka, to błąd hazardzisty: moneta nie ma pamięci, a nadwyżka nie jest kompensowana, tylko rozcieńczana.
Założenia też mają znaczenie. Obserwacje muszą być niezależne (albo przynajmniej słabo zależne) i rozkład musi mieć skończoną wartość oczekiwaną. Dla rozkładu Cauchy’ego średnia z miliona prób jest tak samo rozrzucona jak pojedyncza obserwacja. W danych o ciężkich ogonach (dochody, ceny, ruch w sieci) zbieżność bywa w praktyce bardzo wolna.
Na przykładzie
Symulacja 100 000 rzutów uczciwą monetą (numpy, default_rng(42)): po 10 rzutach odsetek orłów to 0,40, po 100 — 0,52, po 1000 — 0,509, po 10 000 — 0,494, po 100 000 — 0,501. Błąd względny maleje, ale nadwyżka orłów nad połową wynosiła −1 po 10 rzutach, −61 po 10 000 i +89 po 100 000. Żadnego „wyrównywania” nie ma.
Titanic (891 pasażerów, przeżyło 38,4%). Losujemy 1000 razy próbkę pasażerów i liczymy w niej odsetek ocalałych (ziarno 0). Przy 10 osobach wyniki wahają się od 0 do 0,9, a w 52,8% prób błąd przekracza 10 punktów procentowych. Przy 50 osobach zakres to 0,18–0,58 i błąd powyżej 10 pp. zdarza się w 12,8% prób. Przy 200 osobach zakres zwęża się do 0,285–0,48 i ani razu błąd nie przekroczył 10 pp.
Dane: Titanic
W praktyce
- Szacowanie metodą Monte Carlo:
rng = np.random.default_rng(42), potem średnia z wielu losowań; krzywanp.cumsum(x) / np.arange(1, n + 1)pokazuje, kiedy wynik się ustabilizował. - Błąd średniej szacuj jako
x.std(ddof=1) / np.sqrt(n)— to mówi, ile cyfr wyniku ma sens. - Wynik walidacji krzyżowej (
cross_val_score) podawaj ze średnią i odchyleniem po foldach; pięć foldów to wciąż mała próbka. - Mały zbiór testowy (np. 100 przykładów) daje dokładność obarczoną błędem rzędu kilku punktów procentowych — różnica 1 pp. między modelami to zwykle szum.
- Uważaj na dane zależne (szeregi czasowe, wiele zdjęć tej samej osoby): efektywne n jest mniejsze niż liczba wierszy.
- Przy ciężkich ogonach rozważ medianę lub transformację logarytmiczną zamiast surowej średniej.
Najczęstsze pytania
- Czym prawo wielkich liczb różni się od centralnego twierdzenia granicznego?
- Prawo wielkich liczb mówi, dokąd zbiega średnia (do μ). Centralne twierdzenie graniczne mówi, jak wyglądają jej wahania wokół μ po drodze: mają w przybliżeniu rozkład normalny o szerokości σ/√n.
- Czy po serii pięciu orłów reszka jest bardziej prawdopodobna?
- Nie. Rzuty są niezależne, więc szansa wciąż wynosi 1/2. Średnia wraca do 0,5 nie dlatego, że los nadrabia, tylko dlatego, że kolejne tysiące rzutów rozcieńczają tę krótką serię.
- Ile to jest „wielka liczba”?
- To zależy od wariancji i od wymaganej dokładności. Dla odsetka bliskiego 0,5 i błędu ±3 pp. potrzeba około 1000 obserwacji; dla rzadkich zdarzeń lub rozkładów o ciężkich ogonach — znacznie więcej.
Źródła
- Jakob Bernoulli, „Ars Conjectandi”, Bazylea 1713.
- Charles M. Grinstead, J. Laurie Snell, „Introduction to Probability”, American Mathematical Society, 1997, rozdz. 8 (Law of Large Numbers).
- Larry Wasserman, „All of Statistics”, Springer, 2004, rozdz. 5 (Convergence of Random Variables).
- Wassily Hoeffding, „Probability inequalities for sums of bounded random variables”, Journal of the American Statistical Association 58(301), 1963, s. 13–30.