Atlas

Encyklopedia · 239 haseł · 11 działów

Atlas uczenia maszynowego

Jak naprawdę działa uczenie maszynowe, sieci neuronowe i modele językowe — każde pojęcie z mechanizmem „dlaczego”, przykładem na znanym zbiorze danych i ilustracją, którą możesz sam zmieniać.

Od czego zacząć

Od zera do sieci neuronowej

Dziesięć haseł, po których wiesz, jak uczy się sieć.

  1. Czym jest uczenie maszynowe
  2. Regresja liniowa
  3. Funkcja straty (loss)
  4. Gradient i spadek gradientu
  5. Regresja logistyczna
  6. Perceptron (sztuczny neuron)
  7. Funkcja aktywacji (ReLU, sigmoid, tanh)
  8. Perceptron wielowarstwowy (MLP)
  9. Propagacja wsteczna (backpropagation)
  10. Przeuczenie i niedouczenie

Pierwszy model na danych tabelarycznych

Od surowej tabeli do uczciwie ocenionego modelu.

  1. Eksploracyjna analiza danych (EDA)
  2. Brakujące wartości i imputacja
  3. Kodowanie zmiennych kategorycznych
  4. Zbiór treningowy, walidacyjny i testowy
  5. Walidacja krzyżowa
  6. Drzewo decyzyjne
  7. Las losowy
  8. Wzmacnianie gradientowe
  9. Macierz pomyłek
  10. Jak pracować w konkursach Kaggle

Jak działa model językowy

Od tokenu do odpowiedzi czatu — bez magii.

  1. Duży model językowy (LLM)
  2. Tokenizacja i BPE
  3. Embeddingi słów
  4. Mechanizm uwagi (attention)
  5. Transformer
  6. Przewidywanie następnego tokenu
  7. Temperatura i próbkowanie w LLM
  8. Pretrening modeli językowych
  9. RLHF i DPO — uczenie z preferencji
  10. Halucynacje modeli językowych

Działy

01Podstawy: matematyka i statystykaPrawdopodobieństwo, rozkłady, średnia i wariancja, gradient i optymalizacja — język, w którym zapisane jest całe uczenie maszynowe.27 haseł 02Dane i cechySkąd się biorą dane, jak je czyścić, skalować i zamieniać w cechy — i jak dane potrafią oszukać model, zanim zacznie się uczyć.22 hasła 03Uczenie nadzorowaneRegresja liniowa i logistyczna, k najbliższych sąsiadów, drzewa, lasy i boosting: modele, które uczą się z par „przykład → odpowiedź”.21 haseł 04Ocena modeliWalidacja, przeuczenie, macierz pomyłek, precision i recall, ROC AUC, kalibracja: jak sprawdzić, czy model naprawdę działa.27 haseł 05Uczenie bez nadzoruKlastrowanie, redukcja wymiaru, PCA i wykrywanie anomalii: szukanie struktury w danych bez etykiet.15 haseł 06Sieci neuronoweNeuron, warstwy, funkcje aktywacji, propagacja wsteczna, learning rate, optymalizatory i regularyzacja — jak uczy się sieć.30 haseł 07Głębokie architekturySieci splotowe, rekurencyjne, uwaga i transformer, osadzenia, transfer learning: konstrukcje, które zmieniły obrazy, dźwięk i tekst.16 haseł 08Modele językowe (LLM)Tokenizacja, przewidywanie następnego tokenu, pretrening, fine-tuning, RLHF, temperatura, RAG i halucynacje.19 haseł 09Uczenie ze wzmocnieniem i ewolucjaAgent, nagroda, eksploracja i eksploatacja, algorytmy ewolucyjne: uczenie się z konsekwencji zamiast z etykiet.5 haseł 10Praktyka: od notatnika do produkcjiPrzepływ pracy, wyciek danych, strojenie hiperparametrów, ensembling, konkursy Kaggle, wdrożenie i dryf danych.12 haseł 11Prawa i prawdyTwierdzenia, paradoksy i twarde prawdy uczenia maszynowego: No Free Lunch, kompromis obciążenie–wariancja, Simpson, Goodhart, klątwa wymiarowości i inne.45 haseł

Prawa i prawdy

Twierdzenia, paradoksy i twarde prawdy, które każdy, kto pracuje z danymi, powinien znać na pamięć.

Twierdzenie „nie ma darmowego lunchu”Uśredniony po wszystkich możliwych problemach żaden algorytm uczenia nie jest lepszy od innego. Przewaga zawsze bierze się z założeń dopasowanych do danych.Kompromis obciążenie–wariancja InteraktywneBłąd modelu na nowych danych rozkłada się na obciążenie, wariancję i szum. Prostszy model ma większe obciążenie, bogatszy — większą wariancję.Podwójne zejście (double descent) InteraktywneBłąd testowy rośnie, gdy model ledwo mieści dane treningowe, a potem znów spada, gdy parametrów jest znacznie więcej niż przykładów.Przekleństwo wymiarowości InteraktywneWraz z liczbą wymiarów przestrzeń pustoszeje wykładniczo, a odległości między punktami stają się prawie równe. Metody oparte na sąsiedztwie tracą sens.Zjawisko Hughesa InteraktywnePrzy stałej liczbie przykładów dokładność klasyfikatora najpierw rośnie z liczbą cech, a potem spada, bo parametrów do oszacowania przybywa szybciej niż danych.Brzytwa Ockhama w uczeniu maszynowymSpośród modeli równie dobrze wyjaśniających dane wybieraj prostszy. W ML to rozsądna heurystyka chroniąca przed przeuczeniem, ale nie twarde prawo.Wszystkie modele są błędneKażdy model jest uproszczeniem i w jakimś sensie fałszywy. Pytanie nie brzmi „czy jest prawdziwy”, tylko „czy jest wystarczająco dobry do tego celu”.Śmieci na wejściu, śmieci na wyjściuModel nie będzie lepszy niż dane, z których się uczy: błędne etykiety, stronnicza próbka i zbędne cechy przechodzą wprost do predykcji. Dlaczego tak jest.Wyciek danych (data leakage) InteraktywneWyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.

Spróbuj sam

Hasła z ilustracją, która liczy się na żywo w przeglądarce.

Wektory i wartości własne InteraktywneWektor własny to kierunek, który macierz tylko rozciąga, nie obracając go. Wartość własna mówi, jak mocno. Na tym opiera się PCA i analiza dynamiki.Gradient i spadek gradientu InteraktywneGradient to wektor pochodnych straty po wagach, wskazujący kierunek jej najszybszego wzrostu. Spadek gradientu przesuwa wagi małymi krokami w przeciwną stronę.Podstawy prawdopodobieństwa InteraktywnePrawdopodobieństwo to liczba od 0 do 1 mierząca, jak bardzo możliwe jest zdarzenie. Trzy proste aksjomaty dają reguły dopełnienia, sumy i niezależności.Prawdopodobieństwo warunkowe InteraktywnePrawdopodobieństwo warunkowe P(A|B) to szansa zdarzenia A, gdy wiemy, że zaszło B. To zawężenie świata do przypadków B — i nie wolno go odwracać bez Bayesa.Twierdzenie Bayesa InteraktywneTwierdzenie Bayesa odwraca warunek: z P(dowód|hipoteza) liczy P(hipoteza|dowód), łącząc siłę dowodu z tym, jak częsta była hipoteza przed jego poznaniem.Kowariancja i korelacja InteraktywneKowariancja mówi, czy dwie zmienne rosną razem, ale zależy od jednostek. Korelacja to kowariancja przeskalowana do zakresu od −1 do 1.Próbkowanie i błąd standardowy InteraktywneBłąd standardowy mówi, jak bardzo wynik z próby zmieniałby się przy ponownym losowaniu. Maleje jak 1/√n: czterokrotnie większa próba to połowa błędu.Przedział ufności InteraktywnePrzedział ufności to zakres wyliczony z próby metodą, która w 95% powtórzeń obejmuje prawdziwy parametr. Pokazuje, jak dokładny jest wynik.Bootstrap InteraktywneBootstrap szacuje niepewność dowolnej statystyki, losując ze zwracaniem wiele nowych prób z danych i patrząc, jak bardzo zmienia się jej wartość.Problem wielokrotnych porównań InteraktywneIm więcej testów robisz, tym pewniejsze są fałszywe odkrycia. Korekty Bonferroniego, Holma i Benjaminiego–Hochberga przywracają kontrolę nad błędami.Metoda największej wiarygodności InteraktywneMetoda największej wiarygodności wybiera parametry, przy których zaobserwowane dane są najbardziej prawdopodobne. Z niej biorą się MSE i entropia krzyżowa.Entropia krzyżowa (log loss) InteraktywneEntropia krzyżowa karze model ujemnym logarytmem prawdopodobieństwa danego poprawnej odpowiedzi. Nagradza uczciwe prawdopodobieństwa, nie same trafienia.Eksploracyjna analiza danych (EDA) InteraktywneEDA to oglądanie danych przed modelowaniem: rozkłady, braki, zależności i podgrupy. Wykrywa błędy i pułapki, których nie pokaże żadna metryka modelu.Statystyki opisowe InteraktywneStatystyki opisowe streszczają rozkład kilkoma liczbami: położenie, rozrzut i kształt. Średnia i odchylenie są wrażliwe na skośność, mediana i IQR odporne.Brakujące wartości i imputacja InteraktywneBrak danych rzadko jest przypadkowy. Mechanizm braków (MCAR, MAR, MNAR) decyduje, czy usunąć wiersze, imputować wartości, czy uczynić z braku osobną cechę.Skalowanie cech (standaryzacja) InteraktywneStandaryzacja sprowadza każdą cechę do średniej 0 i odchylenia 1. Bez niej cechy o dużej skali dominują gradient i odległości, a jeden learning rate nie pasuje.Cechy wielomianowe i interakcje InteraktywneCechy wielomianowe to potęgi i iloczyny zmiennych. Pozwalają modelowi liniowemu wyrażać krzywe i interakcje, ale ich liczba rośnie lawinowo.Selekcja cech InteraktywneSelekcja cech zostawia podzbiór zmiennych: by uprościć model, przyspieszyć go i zmniejszyć szum. Wykonana poza walidacją krzyżową daje fałszywie wysokie wyniki.Obrazy jako tablice liczb InteraktywneDla komputera obraz to tablica liczb: jasności pikseli w kanałach kolorów. Spłaszczenie do wektora gubi sąsiedztwo pikseli, z którego korzystają sieci CNN.Regresja liniowa InteraktywneRegresja liniowa przewiduje liczbę jako ważoną sumę cech plus stałą. Wagi dobiera metodą najmniejszych kwadratów, a każda mówi o wpływie cechy.Metoda najmniejszych kwadratów InteraktywneMetoda najmniejszych kwadratów dobiera parametry modelu tak, by suma kwadratów błędów była minimalna. Ma wzór zamknięty, ale jest wrażliwa na odstające punkty.Regresja wielomianowa InteraktywneRegresja wielomianowa dopasowuje krzywą, dodając potęgi cech do zwykłej regresji liniowej. Wysoki stopień szybko prowadzi do przeuczenia i dzikich wahań.Regresja grzbietowa i lasso InteraktywneRidge i lasso to regresja liniowa z karą za duże wagi. Ridge kurczy wszystkie współczynniki, lasso część z nich zeruje i w ten sposób wybiera cechy.Regresja logistyczna InteraktywneRegresja logistyczna to model klasyfikacji, który ważoną sumę cech zamienia funkcją sigmoidalną w prawdopodobieństwo. Wagi czyta się jako ilorazy szans.Granica decyzyjna InteraktywneGranica decyzyjna to miejsce w przestrzeni cech, gdzie klasyfikator zmienia zdanie. Jej kształt zdradza założenia modelu i jego skłonność do przeuczenia.Metoda k najbliższych sąsiadów (kNN) InteraktywneMetoda kNN klasyfikuje nowy punkt głosem k najbliższych przykładów treningowych. Jest prosta i elastyczna, ale wrażliwa na skalę cech i ich liczbę.Naiwny klasyfikator Bayesa InteraktywneNaiwny Bayes liczy prawdopodobieństwo klasy z twierdzenia Bayesa, zakładając niezależność cech. Klasyfikuje nieźle, ale jego pewność bywa mocno zawyżona.Drzewo decyzyjne InteraktywneDrzewo decyzyjne klasyfikuje przykład serią pytań tak/nie o pojedyncze cechy („wiek ≤ 6,5?”) aż do liścia z decyzją. Dzieli przestrzeń cech na prostokąty.Zysk informacyjny i gain podziału InteraktywneGain to ocena pytania w drzewie: o ile grupy po podziale są bardziej jednorodne niż przed nim. XGBoost liczy go z gradientów i hesjanów straty, z karami λ i γ.Przycinanie drzew decyzyjnych InteraktywnePrzycinanie usuwa z drzewa decyzyjnego gałęzie, które dopasowują szum zamiast reguły. Drzewo jest mniejsze, czytelniejsze i zwykle lepiej uogólnia.Bagging (agregacja bootstrapowa) InteraktywneBagging uczy wiele kopii modelu na losowych próbkach bootstrapowych i uśrednia ich przewidywania. Zmniejsza wariancję niestabilnych modeli, nie obciążenie.Las losowy InteraktywneLas losowy uśrednia setki drzew decyzyjnych uczonych na losowych próbkach danych i losowych podzbiorach cech. Dzięki temu jest dokładny i stabilny.Wzmacnianie gradientowe InteraktywneWzmacnianie gradientowe buduje model krok po kroku: każde nowe płytkie drzewo poprawia błędy dotychczasowej sumy drzew, idąc w kierunku spadku straty.XGBoost, LightGBM i CatBoost InteraktywneXGBoost, LightGBM i CatBoost to szybkie biblioteki wzmacniania gradientowego. Różnią się sposobem budowy drzew, obsługą kategorii i domyślnymi ustawieniami.Zbiór treningowy, walidacyjny i testowy InteraktywneTrening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.Przeuczenie i niedouczenie InteraktywnePrzeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.Mały zbiór treningowy i 100% trafności InteraktywnePrzy kilku przykładach model dopasuje dowolne etykiety, więc idealny wynik treningowy nie mówi, czy poznał regułę. Wymiar VC klasyfikatora liniowego to d+1.Walidacja krzyżowa InteraktywneWalidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.Warianty walidacji krzyżowej InteraktywneWariant walidacji krzyżowej musi naśladować sposób, w jaki model spotka nowe dane: warstwowanie dla klas, grupy dla pacjentów, porządek czasu dla prognoz.Macierz pomyłek InteraktywneMacierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.Precyzja i recall InteraktywnePrecyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.Recall (czułość) InteraktywneRecall (czułość) to odsetek prawdziwych przykładów danej klasy, które model rozpoznał. Fałszywe alarmy mierzy precyzja. Średnia recalli to balanced accuracy.Miara F1 InteraktywneF1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.Próg decyzji InteraktywnePróg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.ROC AUC (pole pod krzywą ROC) InteraktywneROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.Metryki dla wielu klas InteraktywneW klasyfikacji wieloklasowej precyzję, recall i F1 liczy się dla każdej klasy osobno i uśrednia. Sposób uśredniania decyduje, czy liczą się rzadkie klasy.Metryki regresji: MAE, RMSE, R² InteraktywneMAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.Analiza reszt InteraktywneReszty to różnice między wartością prawdziwą a przewidywaną. Ich wykres ujawnia nieliniowość, punkty wpływowe i zmienny rozrzut, których metryki nie pokażą.Krzywe uczenia InteraktywneKrzywa uczenia pokazuje wynik treningowy i walidacyjny modelu w zależności od liczby przykładów. Mówi, czy więcej danych pomoże, czy model jest za prosty.Krzywe walidacyjne InteraktywneKrzywa walidacyjna pokazuje wynik treningowy i walidacyjny w zależności od jednego hiperparametru. Widać, gdzie model jest za prosty, a gdzie przeuczony.Uczenie nienadzorowane InteraktywneUczenie bez etykiet: algorytm sam szuka w danych grup, ukrytych kierunków i nietypowych punktów. Wynik zależy od kryterium i od tego, jak opiszesz dane.K-means InteraktywneK-means dzieli punkty na k grup: każdy punkt trafia do najbliższego środka, a środki przesuwają się do średniej swojej grupy. Zwraca k grup, nawet gdy ich brak.Pułapki metody k-średnich InteraktywneK-średnich zawsze zwróci k grup, nawet bez sensu. Psują go skale cech, złe ziarno startowe, wydłużone i nierówne skupiska oraz źle dobrane k.Współczynnik silhouette InteraktywneSilhouette porównuje, jak blisko punkt jest własnego klastra, a jak blisko najbliższego obcego. Ocenia konkretny podział, nie dane — dlatego zmienia się z k.Analiza głównych składowych (PCA) InteraktywnePCA obraca układ współrzędnych tak, by pierwsze osie łapały jak najwięcej zmienności danych. Pozwala zastąpić wiele skorelowanych cech kilkoma nowymi.Pułapki PCA InteraktywnePCA łatwo zepsuć: brak standaryzacji, mylenie wariancji z ważnością, wyciek danych, nadinterpretacja ładunków i liniowość tam, gdzie struktura jest zakrzywiona.Perceptron wielowarstwowy (MLP) InteraktywneMLP to sieć neuronowa z warstwami ukrytymi: każda składa sumy ważone i nieliniowość, dzięki czemu sieć uczy się zależności, których model liniowy nie uchwyci.Softmax InteraktywneSoftmax zamienia wektor logitów na rozkład prawdopodobieństwa: każdy wynik podnosi do e^z i dzieli przez sumę, więc wyjścia są dodatnie i sumują się do 1.Learning rate (współczynnik uczenia) InteraktywneLearning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.Epoka treningu InteraktywneEpoka to jedno pełne przejście algorytmu uczącego przez cały zbiór treningowy. Trening składa się z wielu epok, bo jeden krok zmienia wagi tylko trochę.Optymalizatory: SGD, momentum, Adam InteraktywneOptymalizator zamienia gradient na krok. SGD idzie wzdłuż gradientu, momentum dodaje rozpęd, a Adam skaluje krok każdej wagi jej typowym gradientem.Regularyzacja (L2, dropout, early stopping) InteraktywneRegularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.Pojemność sieci neuronowej InteraktywnePojemność sieci to zakres funkcji, jakie może ona odwzorować. Za mała nie uchwyci wzorca, duża zapamięta nawet losowe etykiety, a mimo to potrafi uogólniać.Splot (konwolucja) InteraktywneSplot przesuwa mały filtr wag po obrazie i w każdym miejscu liczy sumę iloczynów. Ten sam wzorzec wykrywa wszędzie, przy ułamku parametrów warstwy gęstej.Sieć konwolucyjna (CNN) InteraktywneCNN to sieć zbudowana z warstw splotowych i poolingu, która składa obraz z hierarchii wzorców: od krawędzi, przez fragmenty, po całe obiekty.Pooling, krok i dopełnienie InteraktywneDopełnienie (padding) chroni brzegi obrazu, krok (stride) przeskakuje pozycje filtra, a pooling streszcza okienka. Razem ustalają rozmiar map cech w CNN.Mechanizm uwagi (attention) InteraktywneUwaga pozwala modelowi w każdym kroku sięgnąć do dowolnego fragmentu wejścia i wziąć z niego tyle, ile pasuje do bieżącego pytania — średnią ważoną zgodnością.Samouwaga (self-attention) InteraktywneW samouwadze każdy token tej samej sekwencji tworzy zapytanie, klucz i wartość, a potem zbiera informację od pozostałych tokenów w proporcji do ich zgodności.Uwaga wielogłowa (multi-head) InteraktywneUwaga wielogłowa uruchamia kilka niezależnych uwag równolegle w mniejszych podprzestrzeniach, więc każdy token może naraz śledzić różne relacje w tekście.Transformer InteraktywneTransformer to architektura z bloków samouwagi i warstw MLP z połączeniami rezydualnymi. Liczy całą sekwencję naraz i napędza dzisiejsze modele językowe.Duży model językowy (LLM) InteraktywneLLM to sieć neuronowa typu transformer trenowana na ogromnym zbiorze tekstu do przewidywania kolejnego tokenu. Z tej prostej zasady biorą się jego umiejętności.Tokenizacja i BPE InteraktywneTokenizacja dzieli tekst na tokeny, czyli kawałki słów, które model zamienia na liczby. BPE buduje słownik, łącząc najczęstsze pary symboli w dane.Przewidywanie następnego tokenu InteraktywneLLM dla każdego miejsca w tekście liczy rozkład prawdopodobieństwa następnego tokenu. Uczy się go entropią krzyżową, a tekst tworzy, losując token po tokenie.Temperatura i próbkowanie w LLM InteraktywneTemperatura dzieli logity przed softmaksem: niska wyostrza rozkład, wysoka go spłaszcza. Top-k i top-p odcinają mało prawdopodobny ogon przed losowaniem.Pipeline w scikit-learn InteraktywnePipeline łączy przetwarzanie danych i model w jeden obiekt, dzięki czemu każdy krok uczy się tylko na danych uczących, a walidacja nie przepuszcza wycieku.Lokalna CV a ranking publiczny InteraktywneRanking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.Zespoły modeli i stacking InteraktywneZespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.Kompromis obciążenie–wariancja InteraktywneBłąd modelu na nowych danych rozkłada się na obciążenie, wariancję i szum. Prostszy model ma większe obciążenie, bogatszy — większą wariancję.Podwójne zejście (double descent) InteraktywneBłąd testowy rośnie, gdy model ledwo mieści dane treningowe, a potem znów spada, gdy parametrów jest znacznie więcej niż przykładów.Przekleństwo wymiarowości InteraktywneWraz z liczbą wymiarów przestrzeń pustoszeje wykładniczo, a odległości między punktami stają się prawie równe. Metody oparte na sąsiedztwie tracą sens.Zjawisko Hughesa InteraktywnePrzy stałej liczbie przykładów dokładność klasyfikatora najpierw rośnie z liczbą cech, a potem spada, bo parametrów do oszacowania przybywa szybciej niż danych.Wyciek danych (data leakage) InteraktywneWyciek danych to sytuacja, w której model w treningu lub walidacji dostaje informację niedostępną w chwili prawdziwej prognozy. Daje zawyżone wyniki.Prawo Goodharta InteraktywneGdy miara staje się celem, przestaje być dobrą miarą. W ML optymalizowanie zastępczej metryki rozjeżdża ją z tym, na czym naprawdę nam zależy.Przeuczenie do tablicy wyników InteraktywnePoprawianie modelu pod wynik na publicznej tablicy dopasowuje go do szumu tej małej próbki. Na zbiorze prywatnym wynik spada, a ranking się tasuje.Klątwa zwycięzcy InteraktywneWynik kandydata wybranego jako najlepszy na tych samych danych jest zawyżony, bo wybór faworyzuje korzystny szum pomiaru. Na nowych danych szczęście znika.Selekcja na szumnym pomiarze InteraktywneZysk z selekcji to pozorna przewaga wybranych pomnożona przez rzetelność pomiaru. Gdy miara to głównie szum, wybór najlepszych nagradza szczęście.Prawo wielkich liczb InteraktywneŚrednia z coraz większej liczby niezależnych prób zbliża się do wartości oczekiwanej. Wyjaśniamy, dlaczego tak jest i czego to prawo nie obiecuje.Centralne twierdzenie graniczne InteraktywneSuma lub średnia wielu niezależnych wartości ma w przybliżeniu rozkład normalny, nawet gdy pojedyncze wartości są skrajnie skośne. Skąd to się bierze.Regresja do średniej InteraktywneSkrajny wynik w jednym pomiarze zwykle oznacza też skrajne szczęście, więc kolejny pomiar wypada bliżej średniej. Dlaczego to zjawisko myli badaczy.Błąd zaniedbania stopy bazowej InteraktywneTrafny test przy rzadkim zjawisku daje głównie fałszywe alarmy, bo zdrowych jest dużo więcej niż chorych. Dlaczego ludzie i modele o tym zapominają.Błąd prokuratora InteraktywneMylenie prawdopodobieństwa dowodu przy niewinności z prawdopodobieństwem niewinności przy dowodzie. Dlaczego „1 na milion” nie znaczy „winny na 99,9999%”.Paradoks Simpsona InteraktywneZależność widoczna w całych danych może zniknąć albo się odwrócić po podziale na grupy. Przykład rekrutacji w Berkeley w 1973 roku i wyjaśnienie dlaczego.Kwartet Anscombe’a InteraktywneCztery zbiory o identycznych średnich, wariancjach, korelacji i prostej regresji wyglądają na wykresie zupełnie inaczej. Dlaczego statystyki nie wystarczą.Mądrość tłumu i twierdzenie Condorceta InteraktywneWiększość niezależnych głosujących, z których każdy ma rację częściej niż w połowie przypadków, myli się coraz rzadziej. Na tym opierają się zespoły modeli.

Dane referencyjne

Przykłady w Atlasie liczymy na klasycznych, publicznych zbiorach danych — tych samych, na których uczą się studenci i zaczynają konkursy.

TitanicIris (irysy Fishera)Palmer Penguins (pingwiny z Antarktydy)Breast Cancer Wisconsin (diagnostyka raka piersi)Wine (wina z Piemontu)Digits (ręcznie pisane cyfry 8×8)Diabetes (progresja cukrzycy)Kwartet Anscombe’aPrzyjęcia na Berkeley 1973

Wszystkie hasła od A do Z

A

B

C

D

E

F

G

H

I

J

K

L

M

N

O

P

Q

R

S

T

U

W

X

Z