ML Atlas

01 · Podstawy · 4 min czytania · aktualizacja

Czym jest wnioskowanie przyczynowe i jak odróżnić korelację od przyczynowości?

W skrócie

Wnioskowanie przyczynowe pyta, co się stanie po interwencji, a nie co z czym współwystępuje. Wymaga eksperymentu albo jawnych założeń o zakłóceniach.

Co to jest

Wnioskowanie przyczynowe (causal inference) to dział statystyki zajmujący się szacowaniem skutków interwencji: o ile zmieni się wynik, jeśli zmienimy daną zmienną, a nie tylko jak bardzo obie zmienne są ze sobą powiązane. Formalnie odróżnia prawdopodobieństwo warunkowe P(Y | X = x), czyli „co widzimy wśród tych, którzy mają x”, od P(Y | do(X = x)), czyli „co by się stało, gdyby wszystkim ustawić x”.

Intuicja: ludzie, którzy biorą witaminy, są średnio zdrowsi. Ale biorą je też częściej osoby zamożniejsze, aktywniejsze i dbające o dietę. Korelacja odpowiada na pytanie „kto bierze witaminy?”, a decyzja wymaga odpowiedzi na inne: „co się stanie, jeśli zacznę je brać?”. Modele uczenia maszynowego świetnie przewidują, ale przewidywanie to nie to samo co wiedza, którą dźwignię pociągnąć.

Mechanizm — dlaczego tak działa

Podstawowy problem: dla każdej jednostki widzimy tylko jeden wynik. W ramie potencjalnych wyników (Neyman, Rubin) każda osoba ma wynik Y(1) przy leczeniu i Y(0) bez niego, a efekt przyczynowy to Y(1) − Y(0). Jednego z nich nigdy nie obserwujemy — to wynik kontrfaktyczny. Wnioskowanie przyczynowe polega na rozsądnym uzupełnieniu brakującej połowy danych.

Porównanie grup leczonych i nieleczonych daje efekt przyczynowy tylko wtedy, gdy grupy są porównywalne pod każdym innym względem. Zmienna zakłócająca (confounder) to taka, która wpływa jednocześnie na przypisanie do grupy i na wynik — jak zamożność w przykładzie z witaminami. Tworzy ona korelację bez przyczynowości albo ukrywa prawdziwy efekt.

Złoty standard to randomizacja. Gdy o przydziale decyduje rzut monetą, żadna cecha — zmierzona ani niezmierzona — nie może być z nim powiązana, więc średnia różnica wyników jest nieobciążonym oszacowaniem efektu. Na tym opiera się badanie kliniczne i test A/B.

Bez eksperymentu trzeba przyjąć założenia. Jeśli zmierzyliśmy wszystkie zmienne zakłócające Z (brak ukrytych zakłóceń), efekt da się odzyskać przez standaryzację: P(Y | do(X = x)) = Σ_z P(Y | X = x, Z = z) · P(Z = z). Liczy się efekt w każdej warstwie Z, a potem uśrednia według rozkładu Z w całej populacji, a nie w grupie leczonych. Tę samą ideę realizują ważenie odwrotnością prawdopodobieństwa przydziału (propensity score), dopasowanie par i modele regresji z kontrolą zmiennych.

Kluczowe pytanie brzmi: co kontrolować? Grafy przyczynowe (DAG, Pearl) dają odpowiedź. Należy kontrolować zmienne zakłócające (wspólne przyczyny), ale nie mediatory (zmienne na ścieżce od X do Y — kontrola usuwa część efektu, który chcemy zmierzyć) ani zderzacze (wspólne skutki — kontrola tworzy fałszywą zależność, jak w paradoksie Berksona). „Dorzuć do regresji wszystkie dostępne zmienne” bywa więc błędem.

Gdy zmiennych zakłócających nie da się zmierzyć, stosuje się quasi-eksperymenty: zmienne instrumentalne, różnicę w różnicach, nieciągłość regresji. Każda metoda zastępuje randomizację innym założeniem, które trzeba uzasadnić wiedzą o dziedzinie — dane same nie powiedzą, która strzałka w którą stronę.

Na przykładzie

Berkeley 1973, sześć największych wydziałów: przyjęto 1198 z 2691 mężczyzn (44,5%) i 557 z 1835 kobiet (30,4%). Różnica 14 punktów procentowych wygląda na dyskryminację. Ale w czterech z sześciu wydziałów kobiety były przyjmowane częściej, np. na wydziale A 82,4% kobiet wobec 62,1% mężczyzn. Zmienną zakłócającą jest wybór wydziału: 51% mężczyzn aplikowało na łatwe wydziały A i B (przyjmowały ponad 63% kandydatów), a kobiet tylko 7%. Ponad 92% kobiet wybierało wydziały C–F, gdzie odsetek przyjęć wynosił od 6% do 35%.

Standaryzacja odpowiada na pytanie kontrfaktyczne: jaki byłby odsetek przyjęć, gdyby obie płcie aplikowały na wydziały w tych samych proporcjach (proporcjach wszystkich kandydatów)? Wychodzi 38,7% dla mężczyzn i 43,0% dla kobiet — kierunek różnicy się odwraca. Bickel i współautorzy (1975) wywnioskowali, że dane nie wskazują na dyskryminację przy decyzjach wydziałów. Zauważ, że to wniosek zależny od założenia: jeśli płeć wpływa na wybór wydziału przez czynniki, które same są skutkiem dyskryminacji, wydział jest częściowo mediatorem i odpowiedź zależy od pytania, które zadajemy.

Dane: Przyjęcia na Berkeley 1973

W praktyce

  • Najpierw narysuj graf przyczynowy: co wpływa na przydział, co na wynik, co jest skutkiem obu. To on, a nie dostępność kolumn, mówi, co kontrolować.
  • DoWhy (identyfikacja i testy odporności), EconML i CausalML (heterogeniczne efekty, meta-learnery), statsmodels do regresji z kontrolą zmiennych.
  • Ważenie propensity score: model LogisticRegression przewiduje przydział z Z, wagi 1/p dla leczonych i 1/(1 − p) dla nieleczonych; sprawdź, czy po ważeniu grupy są zbalansowane.
  • Ważność cech w modelu (feature_importances_, SHAP) mówi, czego model używa do przewidywania, a nie co jest przyczyną.
  • Typowy błąd: kontrolowanie zmiennej mierzonej po interwencji (mediatora lub zderzacza), co psuje oszacowanie zamiast je poprawiać.

Najczęstsze pytania

Czy da się wnioskować o przyczynowości bez eksperymentu?
Tak, ale tylko przy założeniach, których nie da się w pełni sprawdzić na danych — przede wszystkim, że zmierzono wszystkie istotne zmienne zakłócające. Dlatego wyniki obserwacyjne raportuje się z analizą wrażliwości: jak silne musiałoby być ukryte zakłócenie, by zmienić wniosek.
Czym jest zmienna zakłócająca?
To zmienna, która wpływa zarówno na to, kto dostaje interwencję, jak i na wynik. Tworzy korelację między nimi nawet wtedy, gdy interwencja nic nie robi. Na Berkeley taką rolę grał wybór wydziału.
Czy model uczenia maszynowego może odkryć przyczyny?
Sam z siebie nie. Model przewiduje, korzystając z dowolnych korelacji, także pozornych. Do pytań przyczynowych potrzebny jest eksperyment albo model przyczynowy z jawnymi założeniami; ML może pomóc w oszacowaniu jego składników.

Źródła

  • Pearl, J., Glymour, M., Jewell, N. P. (2016). Causal Inference in Statistics: A Primer. Wiley.
  • Hernán, M. A., Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC.
  • Rubin, D. B. (1974). "Estimating causal effects of treatments in randomized and nonrandomized studies". Journal of Educational Psychology, 66(5), 688–701.
  • Bickel, P. J., Hammel, E. A., O'Connell, J. W. (1975). "Sex bias in graduate admissions: data from Berkeley". Science, 187(4175), 398–404.

Zobacz też