ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Na czym polega błąd ekologiczny i czy dane o grupach mówią coś o jednostkach?

W skrócie

Zależność między średnimi grup nie musi zachodzić dla pojedynczych osób w tych grupach, a nawet może mieć odwrotny znak. Dlaczego tak się dzieje.

Co to jest

Wnioskowanie o jednostkach na podstawie zależności między średnimi grup jest błędne, bo korelacja na poziomie grup może być znacznie silniejsza, słabsza, a nawet przeciwna niż na poziomie jednostek. Pokazał to William S. Robinson w 1950 roku: w stanach USA odsetek imigrantów był ujemnie skorelowany z odsetkiem analfabetów, choć wśród pojedynczych osób imigranci częściej nie umieli czytać.

„Ekologiczny” znaczy tu „dotyczący zbiorowości” (regionów, szkół, krajów), a nie przyrody. Dane zbiorcze są często jedynymi dostępnymi: wyniki wyborów w gminach, zachorowania w powiatach, sprzedaż w sklepach. Kusi, by z nich wnioskować o ludziach: „w gminach, gdzie jest więcej X, częściej głosuje się na Y, więc osoby X głosują na Y”. Ten krok jest nieuprawniony.

Błąd działa w obie strony. Odwrotny błąd — przypisywanie grupie cech jej typowych członków — też zdarza się często, ale to już stereotyp, a nie problem statystyczny.

Mechanizm — dlaczego tak działa

Całkowitą kowariancję dwóch zmiennych można rozłożyć na dwie części: kowariancję między grupami (liczoną ze średnich grup) i kowariancję wewnątrz grup (jak zmienne współzmieniają się w obrębie grupy). Te dwie części są od siebie niezależne. Mogą mieć ten sam znak, różne znaki albo jedna może być zerowa. Analiza średnich grup widzi tylko pierwszą część.

Do tego uśrednianie usuwa szum indywidualny. Średnie grup leżą więc na wykresie dużo bliżej linii niż pojedyncze punkty i korelacja ekologiczna zwykle jest dużo silniejsza niż indywidualna. Robinson pokazał, że korelacje na poziomie stanów mogły być kilkukrotnie wyższe niż dla tych samych zmiennych liczonych na osobach.

Skąd odwrócenie znaku? Gdy grupy różnią się jakąś trzecią cechą (rozmiarem, gatunkiem, zamożnością regionu), która przesuwa obie średnie, zależność między średnimi odzwierciedla tę cechę, a nie mechanizm działający w jednostkach. To bliski krewny paradoksu Simpsona.

Zastrzeżenie: dane zbiorcze nie są bezwartościowe. Dobrze odpowiadają na pytania o grupy (czy regiony z wyższym X mają wyższe Y?). Problem zaczyna się dopiero przy przeskoku na pytania o jednostki.

Na przykładzie

Pingwiny Palmer (333 osobniki z kompletnymi danymi). Na poziomie trzech gatunków korelacja między średnią masą ciała a średnią głębokością dzioba wynosi −1,00: najcięższy gatunek (Gentoo) ma najpłytszy dziób. Wniosek „cięższy pingwin ma płytszy dziób” byłby jednak błędny. W obrębie każdego gatunku zależność jest dodatnia: 0,58 u Adelie, 0,60 u Chinstrap i 0,72 u Gentoo — cięższe osobniki mają głębsze dzioby. Korelacja liczona na wszystkich osobnikach naraz, bez podziału na gatunki, wynosi −0,47, bo miesza oba poziomy.

Titanic pokazuje wzmocnienie. Na poziomie pasażerów korelacja ceny biletu z przeżyciem to 0,26. Na poziomie trzech klas (średnia cena vs odsetek ocalałych) — 0,86. Ktoś, kto zobaczyłby tylko zestawienie klas, przeceniłby, jak dobrze cena przewiduje los pojedynczej osoby.

Dane: Titanic Palmer Penguins (pingwiny z Antarktydy)

W praktyce

  • Rozkładaj zależności na poziomy: licz korelację wewnątrz grup (df.groupby('grupa')[['x', 'y']].corr()) i między średnimi grup osobno.
  • Do danych o jednostkach zagnieżdżonych w grupach używaj modeli wielopoziomowych (np. statsmodels MixedLM).
  • Przy walidacji modeli z danymi pogrupowanymi (pacjenci, szkoły, sklepy) dziel dane po grupach: GroupKFold.
  • Nie trenuj modelu na agregatach (średnie gmin, sklepów), jeśli ma przewidywać zachowanie pojedynczych osób.
  • Pisząc wnioski, zaznacz, na jakim poziomie zostały ustalone: „regiony, w których…”, a nie „ludzie, którzy…”.

Najczęstsze pytania

Skąd nazwa „błąd ekologiczny”?
Od „korelacji ekologicznych” — tak Robinson nazwał korelacje liczone na zbiorowościach (obszarach geograficznych), a nie na jednostkach. Nazwa nie ma związku z ochroną środowiska.
Czy błąd ekologiczny to to samo co paradoks Simpsona?
To bliskie zjawiska. W paradoksie Simpsona zależność zmienia się po podziale na grupy. W błędzie ekologicznym problem polega na przenoszeniu zależności między średnimi grup na jednostki. Oba wynikają z różnicy między zmiennością między grupami a wewnątrz grup.
Kiedy dane zbiorcze są w porządku?
Gdy pytanie dotyczy samych grup: regionów, szkół, krajów. Wtedy korelacja ekologiczna jest właściwą miarą. Kłopot zaczyna się przy wnioskach o pojedynczych osobach.

Źródła

  • William S. Robinson, „Ecological correlations and the behavior of individuals”, American Sociological Review 15(3), 1950, s. 351–357.
  • Gary King, „A Solution to the Ecological Inference Problem”, Princeton University Press, 1997.
  • Kristen B. Gorman, Tony D. Williams, William R. Fraser, „Ecological sexual dimorphism and environmental variability within a community of Antarctic penguins (genus Pygoscelis)”, PLoS ONE 9(3), 2014, e90081.
  • Judea Pearl, Madelyn Glymour, Nicholas P. Jewell, „Causal Inference in Statistics: A Primer”, Wiley, 2016, rozdz. 1.

Zobacz też