01 · Podstawy · 4 min czytania · Interaktywne · aktualizacja
Na czym polega testowanie hipotez statystycznych i co naprawdę znaczy wartość p?
W skrócie
Test hipotez sprawdza, czy dane byłyby zaskakujące, gdyby efektu nie było. Wartość p mierzy to zaskoczenie, ale nie mówi, czy efekt jest prawdziwy ani duży.
Co to jest
Testowanie hipotez to procedura sprawdzająca, czy obserwowane dane są zgodne z hipotezą zerową H₀ — zwykle twierdzeniem „efektu nie ma” (średnie są równe, cecha nie wpływa na wynik). Wartość p to prawdopodobieństwo uzyskania wyniku co najmniej tak skrajnego jak obserwowany, przy założeniu, że H₀ jest prawdziwa. Jeśli p jest mniejsze od ustalonego progu α (zwykle 0,05), odrzuca się H₀.
Intuicja: to dowód nie wprost z marginesem na przypadek. Zakładamy, że różnicy nie ma, i pytamy, jak często sam los dałby różnicę taką jak nasza. Jeśli bardzo rzadko — mamy powód wątpić w założenie. Jeśli często — dane nic nie rozstrzygają, ale też niczego nie dowodzą.
Mechanizm — dlaczego tak działa
Każdy test składa się z trzech elementów. Statystyka testowa streszcza dane w jednej liczbie mierzącej odejście od H₀, na przykład t = (różnica średnich) / (błąd standardowy różnicy). Rozkład zerowy mówi, jakie wartości statystyki pojawiają się, gdy H₀ jest prawdziwa — z teorii (rozkład t, χ²) albo z symulacji. Wartość p to pole ogona tego rozkładu za obserwowaną statystyką.
Rozkład zerowy można zbudować bez wzorów, testem permutacyjnym. Jeśli gatunek nie wpływa na masę, etykiety gatunków są wymienne: tasujemy je losowo tysiące razy i za każdym razem liczymy różnicę średnich. Odsetek tasowań dających różnicę co najmniej taką jak prawdziwa to wartość p. Pokazuje to istotę testu: p mierzy, jak nietypowe są dane w świecie, w którym efektu nie ma.
Decyzja niesie dwa rodzaje błędów. Błąd I rodzaju to odrzucenie prawdziwej H₀ — jego częstość kontroluje α. Błąd II rodzaju to przeoczenie prawdziwego efektu; prawdopodobieństwo jego uniknięcia to moc testu. Moc rośnie z wielkością efektu i liczebnością próby, więc przy ogromnych n nawet znikome, praktycznie bez znaczenia różnice dają p < 0,001.
Najczęstsze nieporozumienie: p nie jest prawdopodobieństwem, że H₀ jest prawdziwa, ani że wynik jest „przypadkiem”. To P(dane tak skrajne | H₀), a nie P(H₀ | dane). Odwrócenie warunku wymaga twierdzenia Bayesa i wiedzy, jak często badane hipotezy są w ogóle prawdziwe. Gdy testuje się głównie nieprawdopodobne pomysły, duża część wyników z p < 0,05 to fałszywe alarmy.
Drugie nieporozumienie: p > 0,05 nie dowodzi braku efektu. Oznacza tylko, że dane nie wykluczają H₀ — może efektu nie ma, a może próba była za mała. Dlatego obok wartości p podaje się wielkość efektu i przedział ufności: one mówią, jak duża jest różnica i jak dokładnie ją znamy. Test na poziomie 0,05 odrzuca H₀ dokładnie wtedy, gdy 95% przedział ufności dla różnicy nie zawiera zera.
Na przykładzie
Palmer Penguins: czy pingwiny maskowe (Chinstrap, 68 ptaków, średnio 3733 g) są cięższe od Adélie (151 ptaków, 3701 g)? Różnica wynosi 32 g. Test t Welcha daje t = −0,54 i p = 0,59; test permutacyjny z 10 000 tasowań — p = 0,61. Przedział ufności dla różnicy to od −86 do +150 g. Wniosek: dane są w pełni zgodne z brakiem różnicy, ale nie wykluczają różnicy rzędu 100 g. To nie jest dowód, że gatunki ważą tyle samo.
Kontrast: Gentoo (5076 g) wobec Adélie to różnica 1375 g, t = −23,4 i p rzędu 10⁻⁶⁵ — taki wynik w świecie bez różnicy praktycznie się nie zdarza. Podobnie na Titanicu: przeżyło 233 z 314 kobiet i 109 z 577 mężczyzn. Test χ² niezależności daje χ² = 260,7 przy p rzędu 10⁻⁵⁸. Gdyby płeć nie miała związku z przeżyciem, oczekiwalibyśmy około 121 ocalałych kobiet, a nie 233.
Dane: Titanic Palmer Penguins (pingwiny z Antarktydy)
W praktyce
scipy.stats.ttest_ind(a, b, equal_var=False)— test t Welcha (bezpieczniejszy domyślny wybór niż klasyczny t, gdy wariancje grup się różnią); wynik ma.confidence_interval().scipy.stats.chi2_contingency(pd.crosstab(df.a, df.b))dla dwóch zmiennych kategorycznych;scipy.stats.permutation_testdla dowolnej statystyki bez założeń o rozkładzie.scipy.stats.mannwhitneyugdy rozkłady są silnie skośne, a próby małe.- Zawsze raportuj wielkość efektu (różnicę, d Cohena, iloraz szans) i przedział ufności, nie samo „p < 0,05”.
- Hipotezę i test ustal przed spojrzeniem na dane. Testowanie wielu wariantów i wybór najlepszego wymaga korekty na wielokrotne porównania.
- Typowy błąd: obserwacje zależne (wiele pomiarów tej samej osoby) traktowane jak niezależne — p wychodzi zaniżone.
Najczęstsze pytania
- Co oznacza p = 0,03?
- Że gdyby efektu nie było, wynik co najmniej tak skrajny pojawiałby się w około 3% powtórzeń badania. Nie oznacza, że hipoteza zerowa ma 3% szans na prawdziwość, ani że efekt jest duży czy ważny.
- Dlaczego próg 0,05?
- To konwencja przyjęta w XX-wiecznej statystyce, a nie wartość wynikająca z matematyki. W fizyce cząstek wymaga się progu około 3·10⁻⁷ („5 sigma”), w genetyce 5·10⁻⁸. Właściwy próg zależy od kosztu fałszywego alarmu i liczby testów.
- Czy nieistotny wynik oznacza brak efektu?
- Nie. Brak istotności to brak dowodu, a nie dowód braku. Przedział ufności pokazuje, jak duże efekty wciąż są zgodne z danymi; jeśli jest szeroki, badanie było po prostu za małe.
Źródła
- Wasserman, L. (2004). All of Statistics. Springer, rozdz. 10 (Hypothesis Testing and p-values).
- Wasserstein, R. L., Lazar, N. A. (2016). "The ASA statement on p-values: context, process, and purpose". The American Statistician, 70(2), 129–133.
- Greenland, S. i in. (2016). "Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations". European Journal of Epidemiology, 31, 337–350.
- James, G., Witten, D., Hastie, T., Tibshirani, R. (2021). An Introduction to Statistical Learning, 2nd ed., rozdz. 13 (Multiple Testing).
- SciPy:
scipy.stats.ttest_ind, https://docs.scipy.org/doc/scipy/reference/generated/scipy.stats.ttest_ind.html