01 · Podstawy · 4 min czytania · aktualizacja
Na czym polega wnioskowanie bayesowskie i czym różni się od statystyki częstościowej?
W skrócie
Wnioskowanie bayesowskie traktuje parametry jak niepewne wielkości: łączy wiedzę a priori z danymi i daje pełny rozkład a posteriori zamiast jednej liczby.
Co to jest
Wnioskowanie bayesowskie to podejście do statystyki, w którym nieznane parametry opisuje się rozkładem prawdopodobieństwa wyrażającym stopień przekonania. Przed zobaczeniem danych mamy rozkład a priori, po ich zobaczeniu — rozkład a posteriori, obliczony z twierdzenia Bayesa. Wynikiem nie jest jedna liczba, lecz cały rozkład możliwych wartości wraz z ich prawdopodobieństwami.
Intuicja: tak aktualizuje przekonania rozsądny człowiek. Słysząc, że nowa restauracja ma jedną recenzję na pięć gwiazdek, nie uznajesz jej za najlepszą w mieście — twoje wcześniejsze doświadczenie mówi, że większość restauracji jest przeciętna. Po stu entuzjastycznych recenzjach dane przeważają. Wnioskowanie bayesowskie robi dokładnie to, tylko z rachunkiem.
Mechanizm — dlaczego tak działa
Rdzeń to twierdzenie Bayesa zastosowane do parametrów: p(θ | dane) = p(dane | θ) · p(θ) / p(dane). Rozkład a posteriori jest proporcjonalny do wiarygodności razy rozkład a priori. Mianownik p(dane) to tylko stała normalizująca — tę samą dla wszystkich θ — i właśnie jej obliczenie bywa najtrudniejsze.
Najprostszy przypadek to odsetek sukcesów. Jako a priori przyjmuje się rozkład Beta(a, b); po zaobserwowaniu k sukcesów w n próbach a posteriori to Beta(a + k, b + n − k). Parametry a i b działają jak „wirtualne obserwacje” sprzed badania: Beta(1, 1) to rozkład jednostajny, czyli brak preferencji, a Beta(4, 6) to wiedza warta około dziesięciu wcześniejszych obserwacji z odsetkiem 40%. Średnia a posteriori (a + k)/(a + b + n) leży między przekonaniem wstępnym a odsetkiem z danych i przesuwa się ku danym, gdy n rośnie.
To przesuwanie, zwane ściąganiem (shrinkage), jest główną praktyczną zaletą. Małe grupy z ekstremalnymi wynikami są przyciągane ku średniej ogólnej, duże prawie wcale. Chroni to przed klątwą zwycięzcy: najlepszy wynik w małej próbie jest zwykle w dużej części szczęściem. Regularyzacja w uczeniu maszynowym to ten sam mechanizm: kara L2 to normalny rozkład a priori na wagach, a estymator MAP (maksimum a posteriori) to najbardziej prawdopodobny punkt rozkładu a posteriori.
Wynik bayesowski odpowiada wprost na pytania, które zwykle zadajemy. 95% przedział wiarygodności zawiera parametr z prawdopodobieństwem 95% — przy danych i przyjętym a priori. Można też policzyć P(θ > 0,5 | dane) albo prawdopodobieństwo, że wariant B jest lepszy od A. Przewidywania uśrednia się po całym rozkładzie parametrów, co uwzględnia niepewność modelu.
Koszty i zastrzeżenia. Wybór rozkładu a priori jest założeniem, które trzeba uzasadnić; przy małych danych wpływa na wynik, przy dużych przestaje mieć znaczenie. Dla złożonych modeli rozkładu a posteriori nie da się policzyć wzorem — stosuje się próbkowanie MCMC lub przybliżenia wariacyjne, które są wolne i wymagają diagnostyki zbieżności. Pełne podejście bayesowskie dla sieci z milionami wag jest dziś raczej wyjątkiem niż normą.
Na przykładzie
Titanic, prawdopodobieństwo przeżycia z płaskim a priori Beta(1, 1). Po pierwszych 10 pasażerach z listy (5 ocalałych) a posteriori to Beta(6, 6): średnia 0,50, 95% przedział wiarygodności od 0,23 do 0,77 — wiemy niewiele. Po 50 pasażerach (22 ocalałych) średnia to 0,44, przedział 0,31–0,58. Po wszystkich 891 (342 ocalałych) średnia wynosi 0,384, a przedział zwęża się do 0,352–0,416. Dane stopniowo przejmują kontrolę nad wnioskiem.
Ściąganie widać na pokładach. Na pokładzie G mieszkały 4 osoby z zapisanym pokładem, przeżyły 2 — surowy odsetek 0,50, a przy płaskim a priori przedział od 0,15 do 0,85. Jeśli jako a priori przyjąć wiedzę o całym statku wartą 10 obserwacji, Beta(3,84; 6,16), średnia a posteriori spada do 0,42, a przedział zwęża się do 0,18–0,67. Prawdopodobieństwo, że na pokładzie G szanse przeżycia przekraczały 50%, wynosi wtedy 26%. Cztery osoby to za mało, by odejść daleko od średniej statku.
Dane: Titanic
W praktyce
- Rozkład Beta i sprzężenie z danymi binarnymi:
scipy.stats.beta(a + k, b + n - k), przedział.interval(0.95), prawdopodobieństwo1 - .cdf(0.5). - Modele złożone: PyMC, Stan (
cmdstanpy), NumPyro — próbkowanie NUTS; sprawdzaj diagnostykę R̂ i efektywną liczbę próbek. - W scikit-learn:
BayesianRidge,ARDRegression,GaussianNB,GaussianProcessRegressor— modele z niepewnością a posteriori. - Testy A/B po bayesowsku: P(B > A | dane) z próbek dwóch rozkładów Beta; łatwiej to wytłumaczyć niż wartość p.
- Typowy błąd: dobieranie rozkładu a priori po obejrzeniu danych, tak by wynik „wyszedł”. A priori ustala się przed analizą i sprawdza wrażliwość na jego zmianę.
Najczęstsze pytania
- Czym przedział wiarygodności różni się od przedziału ufności?
- Przedział wiarygodności mówi: „przy tych danych i tym a priori parametr leży tu z prawdopodobieństwem 95%”. Przedział ufności mówi: „procedura obejmuje parametr w 95% powtórzeń”. Przy dużych próbach i słabym a priori liczby są zbliżone, ale interpretacja jest różna.
- Czy wybór rozkładu a priori nie czyni wyniku subiektywnym?
- Czyni go jawnie zależnym od założeń, które są widoczne i można je krytykować. Przy dużej ilości danych wpływ a priori zanika. Częstościowe metody też mają założenia — w wyborze modelu, testu czy progu — tylko mniej widoczne.
- Jak regularyzacja wiąże się z podejściem bayesowskim?
- Minimalizacja straty z karą L2 daje ten sam wynik co estymator MAP z normalnym rozkładem a priori na wagach o średniej zero. Kara L1 odpowiada rozkładowi Laplace’a. Siła regularyzacji to szerokość rozkładu a priori.
Źródła
- Gelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A., Rubin, D. B. (2013). Bayesian Data Analysis, 3rd ed. CRC Press, rozdz. 1–2.
- Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer, rozdz. 2.1 (rozkład Beta) i 3.3 (bayesowska regresja liniowa).
- Goodfellow, I., Bengio, Y., Courville, A. (2016). Deep Learning. MIT Press, rozdz. 5.6 (Bayesian Statistics).
- Murphy, K. P. (2022). Probabilistic Machine Learning: An Introduction. MIT Press, rozdz. 4.6 (wnioskowanie bayesowskie).