ML Atlas

10 · Praktyka · 4 min czytania · aktualizacja

Skąd bierze się stronniczość modeli ML i jak mierzyć sprawiedliwość?

W skrócie

Model uczy się wzorców z danych historycznych, także niesprawiedliwych. Sprawiedliwość mierzy się, porównując decyzje i błędy w grupach.

Co to jest

Stronniczość (bias) modelu w sensie etycznym to systematycznie gorsze traktowanie pewnych grup ludzi — np. ze względu na płeć, pochodzenie czy wiek — przez decyzje oparte na predykcjach. Sprawiedliwość algorytmiczna (fairness) to zestaw definicji i metod, które pozwalają takie różnice zmierzyć i ograniczyć.

Nie chodzi tu o „bias” z kompromisu obciążenie–wariancja, tylko o skutki społeczne. Model nie musi „wiedzieć”, kto należy do jakiej grupy, by działać stronniczo: wystarczy, że uczy się z danych, w których historyczne decyzje były nierówne, albo z cech, które są pośrednikami (proxy) atrybutu chronionego, jak kod pocztowy.

Mechanizm — dlaczego tak działa

Uczenie nadzorowane odtwarza zależności z danych. Jeśli etykiety pochodzą z dawnych decyzji ludzi (kogo zatrudniono, komu dano kredyt), model uczy się tych decyzji razem z ich uprzedzeniami. Jeśli jakaś grupa jest w danych słabo reprezentowana, model myli się dla niej częściej, bo widział mniej przykładów. Jeśli etykieta mierzy cel nierówno (np. zatrzymania zamiast przestępstw), model dziedziczy błąd pomiaru.

Usunięcie atrybutu chronionego z cech zwykle nie pomaga. Informacja o płci czy pochodzeniu jest rozproszona w innych cechach — zawodzie, miejscu zamieszkania, historii zakupów — i model odtworzy ją pośrednio. Co więcej, bez tego atrybutu nie da się zmierzyć, czy model jest sprawiedliwy.

Definicje sprawiedliwości dzielą się na kilka rodzin. Parytet demograficzny: odsetek decyzji pozytywnych jest taki sam w grupach. Wyrównane szanse (equalized odds): w grupach są równe odsetki prawdziwie i fałszywie pozytywnych. Kalibracja w grupach: predykcja 70% oznacza 70% w każdej grupie. Kleinberg, Mullainathan i Raghavan (2017) oraz Chouldechova (2017) pokazali, że gdy częstości bazowe w grupach się różnią, kalibracji i równych odsetków błędów nie da się spełnić jednocześnie (poza modelem doskonałym). Wybór definicji jest więc decyzją wartościującą, nie techniczną.

Ostatnia pułapka to agregacja. Różnica widoczna w danych zbiorczych może zniknąć lub się odwrócić po podziale na podgrupy — to paradoks Simpsona. Odpowiedź na pytanie „czy to dyskryminacja?” wymaga modelu przyczynowego: które zmienne są uzasadnionym wyjaśnieniem różnicy, a które same są jej śladem.

Na przykładzie

Rekrutacja na studia magisterskie i doktoranckie w Berkeley w 1973 roku, sześć największych wydziałów. Przyjęto 1198 z 2691 mężczyzn (44,5%) i 557 z 1835 kobiet (30,4%). Stosunek tych odsetków to 0,68 — poniżej progu 0,8 z popularnej „reguły czterech piątych”, więc w ujęciu parytetu demograficznego wygląda to na wyraźną dyskryminację.

Po podziale na wydziały obraz się zmienia: w czterech z sześciu kobiety miały wyższy odsetek przyjęć, a na wydziale A aż 82,4% wobec 62,1% u mężczyzn. Różnicę zbiorczą tworzy wybór wydziałów: na dwa najłatwiejsze (A i B, ok. 63–64% przyjęć) trafiło 51,5% zgłoszeń mężczyzn, ale tylko 7,2% zgłoszeń kobiet, które aplikowały głównie na wydziały przyjmujące 6–35% kandydatów. Przy tym samym rozkładzie zgłoszeń dla obu płci odsetki wyniosłyby 38,7% dla mężczyzn i 43,0% dla kobiet. Bickel i współautorzy (1975) nie znaleźli na poziomie wydziałów dowodów dyskryminacji kobiet — ale pytanie, dlaczego kobiety kierowano ku najbardziej obleganym kierunkom, pozostaje pytaniem o sprawiedliwość, tylko na innym poziomie.

Dane: Przyjęcia na Berkeley 1973

W praktyce

  • Zawsze raportuj metryki osobno dla grup: odsetek decyzji pozytywnych, czułość, odsetek fałszywie pozytywnych, kalibrację (groupby na predykcjach out-of-fold).
  • Biblioteka fairlearn: MetricFrame liczy dowolne metryki per grupa, ThresholdOptimizer dobiera progi pod wybrane kryterium.
  • Sprawdź reprezentację grup w danych uczących i jakość etykiet w każdej z nich.
  • Szukaj cech-pośredników: model przewidujący atrybut chroniony z pozostałych cech z wysokim AUC oznacza, że informacja i tak jest w danych.
  • Wybór kryterium uzgodnij z interesariuszami i zapisz uzasadnienie; nie ma definicji neutralnej.
  • Typowy błąd: usunięcie kolumny „płeć” i ogłoszenie, że model jest sprawiedliwy.

Najczęstsze pytania

Czy model może być stronniczy, jeśli nie widzi atrybutu chronionego?
Tak. Atrybut chroniony jest zwykle skorelowany z innymi cechami, a etykiety z przeszłości mogą zawierać nierówne decyzje. Model odtworzy te wzorce pośrednio. Do sprawdzenia sprawiedliwości atrybut jest wręcz potrzebny — przynajmniej w zbiorze ewaluacyjnym.
Która definicja sprawiedliwości jest właściwa?
Żadna nie jest uniwersalna. Parytet demograficzny pasuje, gdy różnice w danych uznajemy za skutek niesprawiedliwości; wyrównane szanse, gdy etykiety uznajemy za wiarygodne; kalibracja, gdy predykcje mają oznaczać to samo ryzyko dla każdego. Przy różnych częstościach bazowych trzeba wybierać.
Czego uczy przypadek Berkeley?
Że różnica w danych zbiorczych nie dowodzi dyskryminacji, a jej brak w podgrupach nie dowodzi sprawiedliwości. Trzeba zapytać, przez jakie mechanizmy powstaje różnica i które z nich uznajemy za uprawnione.

Źródła

  • Bickel P. J., Hammel E. A., O'Connell J. W. „Sex Bias in Graduate Admissions: Data from Berkeley”, Science 187(4175), 1975.
  • Barocas S., Hardt M., Narayanan A. „Fairness and Machine Learning: Limitations and Opportunities”, MIT Press 2023, https://fairmlbook.org
  • Kleinberg J., Mullainathan S., Raghavan M. „Inherent Trade-Offs in the Fair Determination of Risk Scores”, ITCS 2017.
  • Chouldechova A. „Fair prediction with disparate impact: A study of bias in recidivism prediction instruments”, Big Data 5(2), 2017.
  • Hardt M., Price E., Srebro N. „Equality of Opportunity in Supervised Learning”, NeurIPS 2016.

Zobacz też