Dział 10 · 15 haseł
Praktyka: od notatnika do produkcji
Przepływ pracy, wyciek danych, strojenie hiperparametrów, ensembling, konkursy Kaggle, wdrożenie i dryf danych.
- Przebieg projektu uczenia maszynowegoProjekt ML to pętla: określ problem i metrykę, zbuduj punkt odniesienia, waliduj uczciwie, poprawiaj małymi krokami, a potem wdrażaj i monitoruj.
- Formułowanie problemu MLFormułowanie problemu to decyzja, co dokładnie przewidujemy, na jakich danych dostępnych w chwili predykcji i jaką metryką mierzymy sukces modelu.
- Jak wybrać model uczenia maszynowegoNie ma modelu najlepszego zawsze. Zacznij od punktu odniesienia i modelu liniowego, dodaj las lub boosting, a wybór rozstrzygnij walidacją krzyżową.
- Ile danych potrzeba do uczenia modeluNie ma uniwersalnej liczby. Odpowiada krzywa uczenia: gdy wynik wciąż rośnie z liczbą przykładów, więcej danych pomoże; gdy stoi, zmień model lub cechy.
- Pipeline w scikit-learn InteraktywnePipeline łączy przetwarzanie danych i model w jeden obiekt, dzięki czemu każdy krok uczy się tylko na danych uczących, a walidacja nie przepuszcza wycieku.
- Powtarzalność eksperymentów MLPowtarzalność to możliwość odtworzenia wyniku: te same dane, kod, wersje bibliotek i ziarna losowości, a także raport rozrzutu wyniku między ziarnami.
- Debugowanie modeli MLDebugowanie modelu to seria testów kontrolnych: baseline, przeuczenie małej próbki, przetasowane etykiety, krzywe uczenia i analiza błędów.
- Przeuczenie modelu — lista kontrolnaLista kontrolna przeuczenia: luka trening–walidacja, przeciek w przetwarzaniu, duplikaty i grupy, zbyt wiele prób na walidacji i test na losowych etykietach.
- Jak pracować w konkursach KagglePraca na Kaggle to pętla: zrozum metrykę, zbuduj walidację podobną do testu, wyślij prosty baseline, ulepszaj według lokalnej CV, nie rankingu publicznego.
- Lokalna CV a ranking publiczny InteraktywneRanking publiczny liczy się na małej części testu i jest zaszumiony, a lokalna CV korzysta z większej próby. Ostateczny model wybieraj według CV, nie rankingu.
- Zespoły modeli i stacking InteraktywneZespół modeli uśrednia lub łączy predykcje kilku modeli. Działa, gdy modele mylą się w różnych miejscach, a stacking uczy się wag na predykcjach out-of-fold.
- Wdrożenie modelu MLWdrożenie to przeniesienie modelu z notebooka do systemu, który podejmuje decyzje: zapis z przetwarzaniem, API lub wsad, walidacja wejścia, wersje i monitoring.
- Monitoring i dryf danychDryf to zmiana rozkładu danych lub zależności cech od celu po wdrożeniu. Monitoring śledzi wejścia, predykcje i metryki, zanim jakość po cichu spadnie.
- Sprawiedliwość i stronniczość modeliModel uczy się wzorców z danych historycznych, także niesprawiedliwych. Sprawiedliwość mierzy się, porównując decyzje i błędy w grupach.
- Historia uczenia maszynowegoOd neuronu McCullocha i Pittsa (1943) przez perceptron, zimy AI i propagację wsteczną po AlexNet, Transformera i ChatGPT, czyli najważniejsze daty i ich sens.