11 · Prawa i prawdy · 3 min czytania · aktualizacja
Na czym polega paradoks Berksona i skąd biorą się fałszywe korelacje przy selekcji?
W skrócie
Gdy do próbki trafiają tylko obiekty spełniające jakiś warunek, niezależne cechy zaczynają wyglądać na ujemnie skorelowane. Skąd to się bierze.
Co to jest
Dwie cechy niezależne w populacji stają się skorelowane (zwykle ujemnie) w próbce wybranej na podstawie tych cech. Opisał to Joseph Berkson w 1946 roku na przykładzie danych szpitalnych: choroby, które w populacji nie mają ze sobą związku, wśród pacjentów szpitala wyglądały na powiązane.
Intuicja: czemu przystojni ludzie wydają się mniej sympatyczni? Może dlatego, że umawiasz się z kimś, kto jest przystojny albo sympatyczny. Ktoś, kto nie ma żadnej z tych cech, do twojej próbki nie trafia. Wśród tych, którzy trafili, brak jednej cechy musi być „wynagrodzony” drugą — więc w próbce wygląda to na kompromis, którego w populacji nie ma.
To samo widać w rekrutacji (przyjęci z gorszymi ocenami mają lepsze rozmowy), w publikacjach naukowych (efekty o małej próbie muszą być duże, żeby przejść próg istotności) i w danych, które ktoś odsiał przed tobą.
Mechanizm — dlaczego tak działa
Selekcja na podstawie funkcji dwóch zmiennych — np. ich sumy powyżej progu — wycina z płaszczyzny jeden róg. Zostaje pas punktów wzdłuż ukośnej granicy. W tym pasie wysoka wartość jednej cechy idzie w parze z niższą wartością drugiej, bo tylko tak można przekroczyć próg „ledwo”. Korelacja nie istnieje w świecie, tworzy ją filtr.
W języku grafów przyczynowych (Judea Pearl) wybór do próbki jest zderzaczem (collider): obie cechy na niego wpływają. Warunkowanie na zderzaczu — czyli patrzenie tylko na tych, którzy przeszli selekcję — otwiera fałszywą ścieżkę między jego przyczynami. To odwrotność zmiennej zakłócającej: na zakłócającą trzeba warunkować, na zderzacz nie wolno.
Paradoks dotyczy każdej analizy, w której dane są już przefiltrowane: pacjentów szpitala, klientów, którzy kupili, kandydatów, którzy przeszli pierwszy etap, modeli, które trafiły do publikacji. Nie da się go wykryć w samych danych po selekcji — trzeba wiedzieć, jak powstała próbka.
Zastrzeżenie: kierunek nie zawsze jest ujemny. Zależy od reguły selekcji. Wybór „obie cechy wysokie” albo „obie niskie” może dać korelację dodatnią. Stała pozostaje tylko zasada: selekcja na skutku zniekształca związek między przyczynami.
Na przykładzie
Symulacja (numpy, default_rng(11)): 10 000 obiektów z dwiema niezależnymi cechami A i B o rozkładzie normalnym. Korelacja w całej populacji: 0,01 — brak związku. Wybieramy 20% obiektów o najwyższej sumie A + B, czyli 2000 „przyjętych”. Wśród nich korelacja A i B wynosi −0,63. Silna, ujemna i całkowicie sztuczna.
Inna reguła selekcji daje to samo: jeśli przyjmujemy każdego, kto ma A > 1 lub B > 1 (29% populacji), korelacja w próbce wynosi −0,55. Ktoś, kto badałby tylko przyjętych, mógłby ogłosić, że „wysokie A szkodzi B”.
W praktyce
- Zanim zinterpretujesz korelację, zapisz, jak dane trafiły do zbioru i co mogło je odfiltrować.
- Nie trenuj modelu tylko na obiektach, które przeszły poprzedni etap (np. tylko na zatwierdzonych kredytach) bez korekty; model nauczy się fałszywych zależności.
- W analizie przyczynowej nie dodawaj do modelu zmiennych będących skutkiem badanej przyczyny i wyniku — to warunkowanie na zderzaczu.
- Sprawdź symulacją:
rng.normal(size=(n, 2)), filtr,np.corrcoef— w minutę zobaczysz, jaką korelację tworzy twoja reguła selekcji. - Jeśli możesz, zbierz dane sprzed selekcji (np. odrzuconych kandydatów) albo modeluj mechanizm selekcji jawnie.
Najczęstsze pytania
- Czym paradoks Berksona różni się od paradoksu Simpsona?
- W paradoksie Simpsona związek fałszuje zmienna zakłócająca, którą trzeba uwzględnić. W paradoksie Berksona fałszywy związek powstaje właśnie dlatego, że uwzględniono (przez selekcję) zmienną będącą wspólnym skutkiem.
- Czy paradoks Berksona dotyczy tylko szpitali?
- Nie. Dotyczy każdej próbki wybranej na podstawie cech, które badasz: rekrutacji, publikacji, ocen produktów, danych z lejka sprzedażowego, modeli wybranych z rankingu.
- Jak się przed nim bronić?
- Znać mechanizm powstania próbki, narysować graf przyczynowy i nie warunkować na wspólnych skutkach. Najlepiej mieć dane z populacji przed selekcją.
Źródła
- Joseph Berkson, „Limitations of the application of fourfold table analysis to hospital data”, Biometrics Bulletin 2(3), 1946, s. 47–53.
- Judea Pearl, „Causality: Models, Reasoning, and Inference”, 2nd ed., Cambridge University Press, 2009.
- Miguel A. Hernán, Sonia Hernández-Díaz, James M. Robins, „A structural approach to selection bias”, Epidemiology 15(5), 2004, s. 615–625.
- Felix Elwert, Christopher Winship, „Endogenous selection bias: The problem of conditioning on a collider variable”, Annual Review of Sociology 40, 2014, s. 31–53.