11 · Prawa i prawdy · 4 min czytania · Interaktywne · aktualizacja
Na czym polega błąd prokuratora w statystyce?
W skrócie
Mylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.
Co to jest
Błąd prokuratora to mylenie P(dowód | niewinny) z P(niewinny | dowód) — na przykład uznanie, że skoro przypadkowa zgodność DNA zdarza się raz na milion, to oskarżony jest niewinny z szansą jeden na milion. Nazwę wprowadzili William Thompson i Edward Schumann w 1987 roku, badając, jak sędziowie przysięgli interpretują dowody statystyczne.
Te dwa prawdopodobieństwa brzmią podobnie, ale mogą różnić się o rzędy wielkości. „Jak rzadko niewinna osoba pasuje do dowodu” to jedno pytanie. „Jak często osoba pasująca do dowodu jest niewinna” to drugie — i odpowiedź zależy od tego, ile osób w ogóle mogło pasować.
Ten sam błąd pojawia się poza sądem: w medycynie (fałszywie dodatni wynik testu), w nauce (wartość p mylona z prawdopodobieństwem, że hipoteza zerowa jest prawdziwa) i w ML (odsetek fałszywych alarmów mylony z odsetkiem alarmów fałszywych).
Mechanizm — dlaczego tak działa
Twierdzenie Bayesa wiąże oba prawdopodobieństwa: P(niewinny | dowód) = P(dowód | niewinny) · P(niewinny) / P(dowód). Odwrócenie warunku wymaga stopy bazowej — ile osób z góry mogło być sprawcą. Gdy potencjalnych podejrzanych jest wielu, nawet rzadka przypadkowa zgodność trafi się wielu niewinnym.
Prosty rachunek: profil DNA pasuje przypadkowo do 1 osoby na milion, a w mieście mieszka 10 milionów osób, z których każda teoretycznie mogła być sprawcą. Spodziewamy się około 10 przypadkowych zgodności plus prawdziwy sprawca. Jeśli jedynym dowodem jest zgodność, szansa, że konkretna pasująca osoba jest winna, to około 1 na 11, czyli 9% — a nie 99,9999%. Dopiero inne dowody (motyw, miejsce, czas) zawężają pulę.
Najgłośniejszy przykład to sprawa Sally Clark w Wielkiej Brytanii. W 1999 roku biegły zeznał, że szansa dwóch nagłych zgonów niemowląt w jednej zamożnej rodzinie to 1 do 73 milionów, co sugerowało winę matki. Popełniono dwa błędy naraz: pomnożono prawdopodobieństwa, jakby zgony były niezależne (ignorując czynniki genetyczne i środowiskowe), i przedstawiono rzadkość zdarzenia przy niewinności jako prawdopodobieństwo niewinności. Royal Statistical Society w 2001 roku publicznie zakwestionowała to rozumowanie; wyrok uchylono w 2003 roku. Właściwe pytanie brzmiało: co jest rzadsze — podwójny naturalny zgon czy podwójne zabójstwo dzieci przez matkę? Oba zdarzenia są skrajnie rzadkie.
Istnieje też lustrzany „błąd obrońcy” (Thompson i Schumann): skoro do profilu pasuje 10 osób w mieście, dowód jest bez znaczenia. Też źle — zawęzienie z 10 milionów do 11 to silny dowód, tylko niewystarczający sam w sobie.
Na przykładzie
Breast Cancer Wisconsin: regresja logistyczna (5-krotna walidacja krzyżowa, ziarno 0) daje fałszywy alarm u 3 z 357 guzów łagodnych, czyli P(alarm | łagodny) = 0,84%. Błąd prokuratora brzmiałby: „skoro tylko 0,84% łagodnych zmian wywołuje alarm, to po alarmie szansa, że zmiana jest łagodna, wynosi 0,84%”.
Policzmy dla populacji badań przesiewowych, w której złośliwe zmiany to 1%. Na 10 000 badanych: 100 zmian złośliwych, z czego model wykrywa około 96 (czułość 95,8%); 9900 łagodnych, z czego około 83 daje fałszywy alarm. Wśród 179 alarmów łagodnych jest 83, czyli P(łagodny | alarm) = 46,5%. Nie 0,84%, tylko prawie połowa.
Dane: Breast Cancer Wisconsin (diagnostyka raka piersi)
W praktyce
- Rozróżniaj w raportach odsetek fałszywych alarmów (FPR = FP / (FP + TN)) i odsetek fałszywych wśród alarmów (1 − precyzja = FP / (FP + TP)); w scikit-learn wyczytasz oba z
confusion_matrix. - Wartość p to P(dane tak skrajne | H₀), a nie P(H₀ | dane). Nie pisz „na 95% hipoteza jest prawdziwa”.
- Przy przeszukiwaniu dużej bazy (rekordy, twarze, transakcje) liczba przypadkowych trafień rośnie z rozmiarem bazy; oszacuj ją przed interpretacją trafienia.
- Prezentuj dowody liczebnościami („na 10 000 osób: 96 trafnych i 83 fałszywe alarmy”), które chronią przed odwróceniem warunku.
- Iloczyny prawdopodobieństw stosuj tylko wtedy, gdy zdarzenia są naprawdę niezależne.
Najczęstsze pytania
- Czym różni się P(A | B) od P(B | A)?
- P(A | B) to szansa A, gdy wiemy, że zaszło B; P(B | A) — odwrotnie. Prawie wszyscy papieże są mężczyznami, ale prawie żaden mężczyzna nie jest papieżem. Przejście między nimi wymaga stopy bazowej.
- Czy błąd prokuratora to to samo co błąd stopy bazowej?
- To ten sam mechanizm: ignorowanie, ilu kandydatów z góry pasowało do hipotezy. Nazwa „błąd prokuratora” odnosi się do kontekstu sądowego, a „błąd stopy bazowej” do ogólnego wnioskowania.
- Czy wartość p to prawdopodobieństwo, że wynik jest przypadkowy?
- Nie. Wartość p mówi, jak rzadkie byłyby takie dane, gdyby hipoteza zerowa była prawdziwa. Prawdopodobieństwo hipotezy zerowej po zobaczeniu danych wymaga dodatkowo prawdopodobieństwa a priori.
Źródła
- William C. Thompson, Edward L. Schumann, „Interpretation of statistical evidence in criminal trials: The prosecutor’s fallacy and the defense attorney’s fallacy”, Law and Human Behavior 11(3), 1987, s. 167–187.
- Colin Aitken, Franco Taroni, „Statistics and the Evaluation of Evidence for Forensic Scientists”, 2nd ed., Wiley, 2004.
- Gerd Gigerenzer, „Calculated Risks: How to Know When Numbers Deceive You”, Simon & Schuster, 2002.
- Royal Statistical Society, oświadczenie w sprawie statystyki w procesie Sally Clark, Londyn 2001.