Dział 06 · 32 hasła
Sieci neuronowe
Neuron, warstwy, funkcje aktywacji, propagacja wsteczna, learning rate, optymalizatory i regularyzacja — jak uczy się sieć.
- Perceptron (sztuczny neuron)Perceptron to najprostszy sztuczny neuron: liczy sumę ważoną wejść plus bias i zwraca 1, gdy przekracza ona zero. Dzieli przestrzeń cech hiperpłaszczyzną.
- Funkcja aktywacji (ReLU, sigmoid, tanh) InteraktywneFunkcja aktywacji to nieliniowość nakładana na sumę ważoną neuronu. Bez niej sieć wielowarstwowa jest liniowa, a jej kształt decyduje o przepływie gradientu.
- Perceptron wielowarstwowy (MLP) InteraktywneMLP to sieć neuronowa z warstwami ukrytymi: każda składa sumy ważone i nieliniowość, dzięki czemu sieć uczy się zależności, których model liniowy nie uchwyci.
- Warstwa ukryta InteraktywneWarstwa ukryta to neurony między wejściem a wyjściem sieci. Każdy uczy się cechy pośredniej, dzięki czemu sieć rysuje granice, których jedna prosta nie da.
- Szerokość warstwySzerokość warstwy to liczba jej neuronów, czyli część pojemności sieci. Za mało — sieć nie wyrazi reguły; za dużo — rośnie koszt i ryzyko uczenia się szumu.
- Aproksymacja odcinkami liniowa (ReLU)Neuron ReLU to funkcja z jednym zagięciem: zero, a od pewnego miejsca prosta. Suma kilku przesuniętych zagięć daje łamaną — rampę, schodek, dowolny kształt.
- Problem XORXOR to najprostsze zadanie, którego nie rozwiąże żaden model liniowy. Pokazuje, po co sieciom warstwa ukryta i nieliniowa funkcja aktywacji.
- Przejście w przód (forward pass) InteraktywnePrzejście w przód to obliczenie wyniku sieci: dane płyną warstwa po warstwie przez mnożenie przez wagi i funkcje aktywacji, aż do predykcji i straty.
- Softmax InteraktywneSoftmax zamienia wektor logitów na rozkład prawdopodobieństwa: każdy wynik podnosi do e^z i dzieli przez sumę, więc wyjścia są dodatnie i sumują się do 1.
- Propagacja wsteczna (backpropagation) InteraktywnePropagacja wsteczna liczy, jak strata zależy od każdej wagi sieci, przesyłając sygnał błędu od wyjścia do wejścia zgodnie z regułą łańcuchową.
- Automatyczne różniczkowanie (autograd) InteraktywneAutomatyczne różniczkowanie liczy dokładne pochodne programu: rozkłada go na proste operacje i łączy ich pochodne regułą łańcuchową, bez wzorów i przybliżeń.
- Krajobraz funkcji stratyKrajobraz straty to wartość błędu jako funkcja wszystkich wag sieci. Jego kształt wyjaśnia, dlaczego trening działa mimo niewypukłości i od czego zależy wynik.
- Learning rate (współczynnik uczenia) InteraktywneLearning rate to współczynnik skalujący krok wzdłuż ujemnego gradientu przy aktualizacji wag. Za mały spowalnia trening, za duży daje oscylacje i rozbieżność.
- Harmonogramy współczynnika uczeniaHarmonogram zmienia współczynnik uczenia w trakcie treningu: duże kroki na początku przyspieszają postęp, małe na końcu pozwalają osiąść w minimum.
- Mini-batch i rozmiar batchaMini-batch to porcja przykładów, na której liczy się jeden gradient i robi jeden krok. Mały batch daje szumny, częsty krok; duży gładki, ale rzadszy i droższy.
- Jak dobrać rozmiar minipaczkiZacznij od minipaczki 32–256 albo od największej, jaka mieści się w pamięci. Większa paczka to mniej kroków: podnieś współczynnik uczenia lub liczbę epok.
- Epoka treningu InteraktywneEpoka to jedno pełne przejście algorytmu uczącego przez cały zbiór treningowy. Trening składa się z wielu epok, bo jeden krok zmienia wagi tylko trochę.
- Optymalizatory: SGD, momentum, Adam InteraktywneOptymalizator zamienia gradient na krok. SGD idzie wzdłuż gradientu, momentum dodaje rozpęd, a Adam skaluje krok każdej wagi jej typowym gradientem.
- SGD czy Adam — który optymalizatorAdam szybciej zbiega i wybacza zły współczynnik uczenia, więc to dobry wybór domyślny. SGD z momentem po dostrojeniu mu dorównuje, a bywa lepszy w uogólnianiu.
- Inicjalizacja wag InteraktywneInicjalizacja wag to wybór wartości startowych przed treningiem. Losowy start łamie symetrię neuronów, a skala Xavier lub He trzyma sygnał w rozsądnym zakresie.
- Losowy seed i szczęśliwa inicjalizacjaLosowe wagi startowe dają przypadkową granicę decyzji, która czasem trafia blisko prawdziwej. Wynik zależy od seeda: jeden przebieg to jedno losowanie.
- Zanikający i eksplodujący gradient InteraktywneGradient w głębokiej sieci to iloczyn czynników z kolejnych warstw: gdy są mniejsze od 1, zanika, gdy większe, rośnie wykładniczo i wagi uciekają do NaN.
- Martwe neurony ReLU i nasycenie InteraktywneNeuron nasycony (sigmoid lub tanh na skraju) albo martwy (ReLU zawsze poniżej zera) ma gradient bliski zeru, więc przestaje się uczyć, choć zajmuje miejsce.
- Normalizacja wsadowa i warstwowa InteraktywneNormalizacja wsadowa i warstwowa sprowadzają aktywacje neuronów do średniej 0 i wariancji 1, co stabilizuje i przyspiesza trening głębokich sieci.
- Regularyzacja (L2, dropout, early stopping) InteraktywneRegularyzacja ogranicza dopasowanie modelu do szumu: kara za duże wagi (L2), losowe wyłączanie neuronów (dropout) i wcześniejszy koniec treningu.
- Dropout InteraktywneDropout w czasie treningu losowo wyłącza część neuronów, więc sieć nie może polegać na pojedynczych połączeniach i lepiej uogólnia na nowe dane.
- Wczesne zatrzymanie (early stopping)Early stopping kończy trening, gdy strata walidacyjna przestaje spadać, i wraca do najlepszych wag. Działa jak regularyzacja, ale wymaga cierpliwości.
- Niemonotoniczność treninguTrafność treningowa nie musi rosnąć monotonicznie: krok gradientu obniża stratę średnio, ale może zepsuć pojedyncze przykłady, bo wszystkie dzielą te same wagi.
- Pojemność sieci neuronowej InteraktywnePojemność sieci to zakres funkcji, jakie może ona odwzorować. Za mała nie uchwyci wzorca, duża zapamięta nawet losowe etykiety, a mimo to potrafi uogólniać.
- Katastrofalne zapominanieKatastrofalne zapominanie to utrata starej wiedzy, gdy sieć trenuje się tylko na nowym zadaniu. Replay miesza stare przykłady z nowymi, by gradient dbał o oba.
- Embeddingi (osadzenia) InteraktywneEmbedding to wektor liczb reprezentujący obiekt, np. słowo, produkt czy obraz, tak że obiekty podobne dla zadania leżą blisko siebie w przestrzeni.
- Przykłady kontradyktoryjnePrzykład kontradyktoryjny to wejście zmienione niemal niezauważalnie, lecz celowo tak, by model się pomylił. Ujawnia, że sieci opierają się na kruchych cechach.