ML Atlas

02 · Dane · 3 min czytania · Interaktywne · aktualizacja

Jakie są podstawowe statystyki opisowe i kiedy średnia wprowadza w błąd?

W skrócie

Statystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.

Co to jest

Statystyki opisowe to liczby streszczające rozkład zmiennej: gdzie leży jej „środek” (średnia, mediana, dominanta), jak bardzo wartości się rozrzucają (odchylenie standardowe, rozstęp międzykwartylowy, zakres) i jaki ma kształt (skośność, kurtoza). Dla par zmiennych dochodzą miary zależności, takie jak kowariancja i korelacja.

Podsumowanie jest kompresją: setki czy tysiące wartości zastępujemy kilkoma liczbami. To wygodne i niezbędne, ale każda kompresja coś gubi — i trzeba wiedzieć, co.

Intuicja: średni majątek w sali, do której wchodzi miliarder, rośnie gwałtownie, choć nikt z obecnych nie stał się bogatszy. Mediana prawie się nie zmienia.

Mechanizm — dlaczego tak działa

Średnia x̄ = (x₁ + … + xₙ) / n minimalizuje sumę kwadratów odległości od punktów. Kwadrat sprawia, że daleki punkt „ciągnie” ją bardzo mocno, więc jedna skrajna wartość może przesunąć średnią dowolnie daleko. Mediana — wartość środkowa po posortowaniu — minimalizuje sumę bezwzględnych odległości; skrajne punkty liczą się tylko tym, po której stronie leżą. Mówimy, że mediana jest odporna (ma punkt załamania 50%), a średnia nie (punkt załamania 0%).

To samo dotyczy rozrzutu. Odchylenie standardowe s = √(Σ(xᵢ − x̄)² / (n − 1)) dziedziczy wrażliwość średniej. Rozstęp międzykwartylowy IQR = Q3 − Q1 opisuje szerokość środkowej połowy danych i ignoruje ogony. Dzielnik n − 1 zamiast n (poprawka Bessela) koryguje fakt, że odchylenia liczymy od średniej z próby, a nie od prawdziwej.

Relacja średniej i mediany mówi o kształcie. Gdy średnia jest wyraźnie większa od mediany, rozkład ma długi prawy ogon (dochody, ceny, czasy oczekiwania). W rozkładzie symetrycznym obie są bliskie. Dlatego „przeciętny” w raporcie warto doprecyzować: czy to średnia, czy mediana?

Granica podsumowań: zupełnie różne dane mogą mieć te same statystyki. Kwartet Anscombe’a to cztery zbiory o identycznych średnich, wariancjach i korelacji, z których tylko jeden pasuje do modelu liniowego. Korelacja Pearsona mierzy wyłącznie zależność liniową i jest wrażliwa na pojedyncze punkty. Statystyki opisowe trzeba więc czytać razem z wykresem rozkładu.

Wreszcie: statystyka z próby jest zmienną losową. Średnia ze 100 obserwacji ma własny błąd standardowy s / √n — inna próba dałaby inną liczbę.

Na przykładzie

W zbiorze Titanic opłata za bilet (fare) ma średnią 32,2 i medianę 14,45 — średnia jest ponad dwa razy większa. Odchylenie standardowe wynosi 49,7, więcej niż sama średnia, a maksimum 512,33. Kwartyle mówią więcej: połowa pasażerów zapłaciła między 7,91 a 31,0 (IQR = 23,1). Kilka bardzo drogich biletów w pierwszej klasie ciągnie średnią i odchylenie w górę; mediana i IQR opisują typowego pasażera znacznie lepiej.

Dla kontrastu masa ciała pingwinów (Palmer Penguins, 342 ptaki z pomiarem) ma średnią 4202 g i medianę 4050 g, odchylenie 802 g i skośność 0,47 — rozkład umiarkowanie asymetryczny, więc obie miary środka są bliskie. Kwartet Anscombe’a domyka lekcję: we wszystkich czterech zbiorach średnia x wynosi 9,0, średnia y 7,50, wariancja x 11,0, wariancja y 4,12, a korelacja 0,82 — przy całkowicie różnych kształtach.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: wiek brakuje u 177 z 891 pasażerów Titanica; wypełnienie średnią tworzy szpic 177 identycznych wartości i zaniża rozrzut.

Dane: Titanic Palmer Penguins (pingwiny z Antarktydy) Kwartet Anscombe’a

W praktyce

  • df.describe() daje liczność, średnią, odchylenie, minimum, kwartyle i maksimum; df.skew() i df.kurt() dodają kształt.
  • Dla skośnych zmiennych raportuj medianę i IQR (df.quantile([.25, .5, .75])) albo statystyki po logarytmowaniu (np.log1p).
  • Statystyki w podgrupach: df.groupby('grupa')['x'].agg(['mean', 'median', 'std']).
  • Pamiętaj, że pandas liczy std z dzielnikiem n − 1, a NumPy (np.std) domyślnie z n.
  • Korelację Spearmana (df.corr(method='spearman')) stosuj, gdy zależność jest monotoniczna, ale nie liniowa, lub są wartości odstające.
  • Typowy błąd: raportowanie samej średniej bez miary rozrzutu i bez wykresu.

Najczęstsze pytania

Kiedy używać średniej, a kiedy mediany?
Średnia jest dobra dla rozkładów zbliżonych do symetrycznych i gdy liczy się suma (np. łączny koszt). Mediana lepiej opisuje typową obserwację w danych skośnych lub z wartościami odstającymi, np. dochody czy ceny mieszkań.
Czym różni się odchylenie standardowe od błędu standardowego?
Odchylenie standardowe opisuje rozrzut pojedynczych obserwacji. Błąd standardowy opisuje niepewność oszacowania, np. średniej, i maleje jak 1/√n wraz z liczbą obserwacji.
Czy dwie zmienne o korelacji 0 są niezależne?
Nie. Korelacja Pearsona równa zero oznacza brak zależności liniowej. Zmienna y = x² dla x symetrycznego wokół zera ma korelację bliską zeru, choć jest całkowicie wyznaczona przez x.

Źródła

  • Tukey J. W. (1977). „Exploratory Data Analysis”. Addison-Wesley.
  • Anscombe F. J. (1973). „Graphs in Statistical Analysis”. The American Statistician, 27(1), 17–21.
  • James G., Witten D., Hastie T., Tibshirani R. „An Introduction to Statistical Learning”, 2nd ed., 2021, rozdz. 2 i 3.1.
  • Dokumentacja pandas: DataFrame.describe, https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.describe.html

Zobacz też