ML Atlas

Dział 04 · 31 haseł

Ocena modeli

Walidacja, przeuczenie, macierz pomyłek, precision i recall, ROC AUC, kalibracja: jak sprawdzić, czy model naprawdę działa.

  1. Zbiór treningowy, walidacyjny i testowy InteraktywneTrening służy do uczenia, walidacja do wyboru modelu i ustawień, a test do jednej uczciwej oceny na końcu. Każde podejrzenie testu psuje jego wartość.
  2. Zbiór walidacyjnyZbiór walidacyjny to odłożone dane, na których model się nie uczy, a które służą do wyboru ustawień. Przeuczenie widać jako lukę między nim a treningiem.
  3. Przeuczenie i niedouczenie InteraktywnePrzeuczony model zapamiętuje szum ze zbioru treningowego i gorzej działa na nowych danych, a niedouczony jest za prosty, by uchwycić nawet główny wzorzec.
  4. Złudzenie trafności treningowejWysoki wynik na zbiorze treningowym może być zapamiętaniem przykładów, a nie reguły. Prawdę o modelu mówi tylko wynik na danych, których model nie widział.
  5. Mały zbiór treningowy i 100% trafności InteraktywnePrzy kilku przykładach model dopasuje dowolne etykiety, więc idealny wynik treningowy nie mówi, czy poznał regułę. Wymiar VC klasyfikatora liniowego to d+1.
  6. Walidacja krzyżowa InteraktywneWalidacja krzyżowa dzieli dane na k części i każdą z nich po kolei traktuje jako zbiór walidacyjny. Daje stabilniejszą ocenę modelu niż jeden podział.
  7. Warianty walidacji krzyżowej InteraktywneWariant walidacji krzyżowej musi naśladować sposób, w jaki model spotka nowe dane: warstwowanie dla klas, grupy dla pacjentów, porządek czasu dla prognoz.
  8. Modele bazoweModel bazowy to najprostsze sensowne rozwiązanie, np. zawsze najczęstsza klasa. Bez niego nie wiadomo, czy wynik modelu jest dobry, czy tylko tak wygląda.
  9. Macierz pomyłek InteraktywneMacierz pomyłek zlicza, ile przykładów każdej prawdziwej klasy model przypisał do każdej klasy. Z niej wynikają trafność, precyzja, recall i inne metryki.
  10. Precyzja i recall InteraktywnePrecyzja mówi, jaka część alarmów modelu jest prawdziwa, a recall, jaką część prawdziwych przypadków model wykrył. Zwykle poprawa jednej psuje drugą.
  11. Recall (czułość) InteraktywneRecall (czułość) to odsetek prawdziwych przykładów danej klasy, które model rozpoznał. Fałszywe alarmy mierzy precyzja. Średnia recalli to balanced accuracy.
  12. Precyzja czy recall — co ważniejszeO wyborze między precyzją a recall decyduje koszt błędów: gdy droższe jest przeoczenie, liczy się recall, gdy fałszywy alarm — precyzja. Próg wynika z kosztów.
  13. Miara F1 InteraktywneF1 to średnia harmoniczna precyzji i recall. Jest wysoka tylko wtedy, gdy obie są wysokie, więc karze modele, które poświęcają jedną dla drugiej.
  14. Zbalansowana trafność (balanced accuracy)Balanced accuracy to średnia z recalli wszystkich klas. Przy niezbalansowanych klasach nie nagradza modelu, który zawsze wybiera klasę najczęstszą.
  15. Trafność czy zbalansowana trafnośćTrafność liczy odsetek wszystkich poprawnych odpowiedzi, a zbalansowana trafność uśrednia recall każdej klasy. Przy rzadkiej klasie tylko ta druga widzi kłopot.
  16. Próg decyzji InteraktywnePróg decyzji to reguła zamiany prawdopodobieństw na klasę. Próg 0,5 jest optymalny tylko przy równych kosztach pomyłek i tych samych proporcjach klas.
  17. ROC AUC (pole pod krzywą ROC) InteraktywneROC AUC to prawdopodobieństwo, że losowy przykład pozytywny dostanie wyższy wynik niż losowy negatywny. Zależy od kolejności wyników, nie od progu.
  18. Krzywa precyzja–recallKrzywa precyzja–recall pokazuje precyzję modelu przy każdym poziomie recall, czyli dla wszystkich progów naraz. Przy rzadkiej klasie mówi więcej niż ROC.
  19. ROC AUC czy PR AUCROC AUC nie zależy od częstości klasy pozytywnej i ocenia cały ranking. PR AUC spada razem z częstością i pokazuje, ile warte są alarmy przy rzadkiej klasie.
  20. Kalibracja modeluModel jest skalibrowany, gdy deklarowana pewność zgadza się z częstością trafień. Temperature scaling dzieli logity przez T z walidacji, nie zmieniając decyzji.
  21. Metryki dla wielu klas InteraktywneW klasyfikacji wieloklasowej precyzję, recall i F1 liczy się dla każdej klasy osobno i uśrednia. Sposób uśredniania decyduje, czy liczą się rzadkie klasy.
  22. Metryki regresji: MAE, RMSE, R² InteraktywneMAE mierzy przeciętny błąd, RMSE mocniej karze duże pomyłki, a R² mówi, jaką część zmienności celu model wyjaśnia w porównaniu z przewidywaniem średniej.
  23. Jak wybrać metrykę oceny modeluMetrykę dobiera się do decyzji: etykieta, ranking czy prawdopodobieństwo, koszty błędów i proporcje klas. Inna metryka to często inny zwycięski model.
  24. Analiza reszt InteraktywneReszty to różnice między wartością prawdziwą a przewidywaną. Ich wykres ujawnia nieliniowość, punkty wpływowe i zmienny rozrzut, których metryki nie pokażą.
  25. Krzywe uczenia InteraktywneKrzywa uczenia pokazuje wynik treningowy i walidacyjny modelu w zależności od liczby przykładów. Mówi, czy więcej danych pomoże, czy model jest za prosty.
  26. Krzywe walidacyjne InteraktywneKrzywa walidacyjna pokazuje wynik treningowy i walidacyjny w zależności od jednego hiperparametru. Widać, gdzie model jest za prosty, a gdzie przeuczony.
  27. Strojenie hiperparametrówStrojenie hiperparametrów to wybór ustawień modelu, których algorytm nie uczy się sam, na podstawie walidacji. Wynik zwycięzcy jest zawsze nieco zawyżony.
  28. Wpływ cechy InteraktywneWpływ cechy mówi, o ile zmienia się odpowiedź modelu po zmianie jednej cechy. W modelu liniowym to waga po standaryzacji, w innych — permutacja lub SHAP.
  29. Ważność permutacyjna cech InteraktywneWażność permutacyjna mierzy, o ile pogarsza się wynik modelu, gdy losowo przetasujemy wartości jednej cechy. Działa dla każdego modelu i na danych testowych.
  30. Zależność częściowa i krzywe ICEWykres zależności częściowej pokazuje, jak średnio zmienia się przewidywanie modelu wraz z jedną cechą. Krzywe ICE pokazują to osobno dla każdego przykładu.
  31. Wartości SHAP InteraktywneWartości SHAP rozkładają przewidywanie modelu dla jednego przykładu na wkłady cech, które sumują się do różnicy między tym przewidywaniem a średnią.

Inne działy

01 Podstawy02 Dane03 Nadzorowane05 Bez nadzoru06 Sieci07 Architektury08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy