ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Co to jest prawo małych liczb i dlaczego małe próbki dają skrajne wyniki?

W skrócie

Ludzie oczekują, że mała próbka będzie wiernym obrazem populacji. Tymczasem małe próbki częściej dają skrajne wyniki, z których wyciągamy fałszywe wnioski.

Co to jest

Ludzie błędnie zakładają, że nawet mała próbka będzie wiernie odzwierciedlać populację, jakby prawo wielkich liczb działało także dla małych liczb. Nazwę i opis tego błędu podali Amos Tversky i Daniel Kahneman w 1971 roku w artykule „Belief in the law of small numbers”, badając… zawodowych psychologów i statystyków.

To nie jest prawo przyrody, tylko prawo ludzkiej intuicji — i to błędnej. Prawdziwe prawo brzmi odwrotnie: małe próbki są bardzo zmienne, więc najwyższe i najniższe wyniki niemal zawsze pochodzą z najmniejszych grup. Najlepsze szkoły w rankingu, najzdrowsze powiaty, najbardziej „skuteczne” warianty strony po dziesięciu kliknięciach — często są po prostu małe.

Skutek w nauce: badacze planowali za małe eksperymenty, ufali wynikom z pilotażu i dziwili się, gdy replikacja nie wychodziła. Skutek w ML: wnioski z małego zbioru walidacyjnego, który przypadkiem sprzyja jednemu modelowi.

Mechanizm — dlaczego tak działa

Odchylenie standardowe średniej z próbki to σ/√n. Przy 15 obserwacjach jest ono prawie dwa razy większe niż przy 45 i ponad osiem razy większe niż przy 1000. Jeśli wiele grup ma ten sam prawdziwy poziom, a różnią się tylko liczebnością, to małe grupy rozrzucą się szeroko, a duże skupią się blisko prawdziwej wartości. Skrajne pozycje w rankingu przypadną więc małym grupom, w obu kierunkach.

Howard Wainer nazwał wzór σ/√n „najniebezpieczniejszym równaniem”, bo jego ignorowanie prowadziło do kosztownych decyzji — np. do promowania małych szkół, bo to one dominowały w czołówce rankingów (dominowały też na samym dole, czego nikt nie oglądał).

Dlaczego intuicja zawodzi? Według Tverskyego i Kahnemana działa heurystyka reprezentatywności: oczekujemy, że próbka „wygląda jak” populacja, łącznie z lokalną losowością. Stąd wiara, że po serii orłów powinna wypaść reszka, i zaskoczenie, gdy w małej próbce wychodzą długie serie. Mózg ocenia proporcję, a ignoruje liczbę obserwacji, z której ta proporcja pochodzi.

Zastrzeżenie: nie chodzi o to, że małe próbki są bezużyteczne. Chodzi o to, że trzeba z nimi podawać niepewność (przedział ufności) i nie porównywać surowych proporcji między grupami o bardzo różnej liczebności.

Na przykładzie

Zadanie ze szpitalami (Tversky i Kahneman, 1974): w dużym szpitalu rodzi się 45 dzieci dziennie, w małym 15. Który szpital zanotuje w roku więcej dni, w których ponad 60% noworodków to chłopcy? Większość ludzi odpowiada „mniej więcej tyle samo”. Rachunek dwumianowy daje średnio 55 takich dni w małym szpitalu i 25 w dużym. Symulacja jednego roku (numpy, default_rng(3)) dała 53 dni w małym i 20 w dużym.

Ranking szkół (default_rng(5)): 1000 szkół o liczebności od 10 do 499 uczniów, wszystkie z identycznym prawdziwym poziomem; każdy uczeń dostaje losowy wynik, szkoła — średnią. Szkoły poniżej 100 uczniów to 17,9% wszystkich. W pierwszej pięćdziesiątce rankingu stanowią 60%, a w ostatniej pięćdziesiątce — 80%. Mediana liczebności to 246 uczniów w całej grupie, 84 w czołówce i 42 na dole.

W praktyce

  • Do każdej proporcji podawaj przedział ufności, np. statsmodels.stats.proportion.proportion_confint; „3 z 4” i „750 z 1000” to nie ta sama informacja.
  • Rankingi grup o różnej liczebności wygładzaj w stronę średniej ogólnej (estymacja bayesowska, shrinkage) zamiast sortować surowe średnie.
  • Przy małym zbiorze danych zamiast jednego podziału używaj powtarzanej walidacji krzyżowej: RepeatedStratifiedKFold.
  • Planując eksperyment, policz moc testu i wymaganą liczebność, zanim zbierzesz dane.
  • Nie przerywaj testu A/B, gdy tylko wariant „wygrywa” po kilkudziesięciu obserwacjach.

Najczęstsze pytania

Czym prawo małych liczb różni się od prawa wielkich liczb?
Prawo wielkich liczb to twierdzenie matematyczne: przy dużym n średnia zbliża się do prawdy. Prawo małych liczb to błąd poznawczy: oczekiwanie, że to samo zachodzi już przy małym n.
Dlaczego najlepsze i najgorsze wyniki mają małe grupy?
Bo średnia z małej grupy ma duży rozrzut losowy. Nawet gdy wszystkie grupy są w rzeczywistości takie same, małe częściej przypadkiem lądują na skrajach rankingu.
Ile obserwacji to „mała próbka”?
Zależy od zmienności i od tego, jak małe różnice chcesz wykryć. Dla odsetka bliskiego 50% przy 100 obserwacjach przedział ufności ma szerokość około ±10 punktów procentowych.

Źródła

  • Amos Tversky, Daniel Kahneman, „Belief in the law of small numbers”, Psychological Bulletin 76(2), 1971, s. 105–110.
  • Amos Tversky, Daniel Kahneman, „Judgment under Uncertainty: Heuristics and Biases”, Science 185(4157), 1974, s. 1124–1131.
  • Howard Wainer, „The Most Dangerous Equation”, American Scientist 95(3), 2007, s. 249–256.
  • Daniel Kahneman, „Thinking, Fast and Slow”, Farrar, Straus and Giroux, 2011, rozdz. 10 (The Law of Small Numbers).

Zobacz też