Dział 07 · 18 haseł
Głębokie architektury
Sieci splotowe, rekurencyjne, uwaga i transformer, osadzenia, transfer learning: konstrukcje, które zmieniły obrazy, dźwięk i tekst.
- Splot (konwolucja) InteraktywneSplot przesuwa mały filtr wag po obrazie i w każdym miejscu liczy sumę iloczynów. Ten sam wzorzec wykrywa wszędzie, przy ułamku parametrów warstwy gęstej.
- Sieć konwolucyjna (CNN) InteraktywneCNN to sieć zbudowana z warstw splotowych i poolingu, która składa obraz z hierarchii wzorców: od krawędzi, przez fragmenty, po całe obiekty.
- Pooling, krok i dopełnienie InteraktywneDopełnienie (padding) chroni brzegi obrazu, krok (stride) przeskakuje pozycje filtra, a pooling streszcza okienka. Razem ustalają rozmiar map cech w CNN.
- Połączenia rezydualne (ResNet)Połączenie rezydualne dodaje wejście bloku do jego wyjścia: y = x + F(x). Gradient ma wtedy skrót przez sieć, więc da się trenować setki warstw.
- Uczenie transferoweTransfer learning to start treningu z wag modelu wytrenowanego wcześniej, a nie z losowych. Wagi leżą blisko dobrego rozwiązania, więc trzeba mniej danych.
- Rekurencyjna sieć neuronowa (RNN)RNN czyta sekwencję krok po kroku i niesie stan ukryty, który streszcza dotychczasową historię. Prosta idea, ale pamięć szybko zanika z każdym krokiem.
- LSTM i GRULSTM i GRU to sieci rekurencyjne z bramkami, które decydują, co zapomnieć, co zapisać i co odczytać. Dzięki temu pamiętają informację przez setki kroków.
- Mechanizm uwagi (attention) InteraktywneUwaga pozwala modelowi w każdym kroku sięgnąć do dowolnego fragmentu wejścia i wziąć z niego tyle, ile pasuje do bieżącego pytania — średnią ważoną zgodnością.
- Samouwaga (self-attention) InteraktywneW samouwadze każdy token tej samej sekwencji tworzy zapytanie, klucz i wartość, a potem zbiera informację od pozostałych tokenów w proporcji do ich zgodności.
- Uwaga wielogłowa (multi-head) InteraktywneUwaga wielogłowa uruchamia kilka niezależnych uwag równolegle w mniejszych podprzestrzeniach, więc każdy token może naraz śledzić różne relacje w tekście.
- Kodowanie pozycyjneSamouwaga nie widzi kolejności słów, więc transformer dodaje do każdego tokenu sygnał jego pozycji: sinusoidy, uczone wektory albo obrót zapytań i kluczy.
- Transformer InteraktywneTransformer to architektura z bloków samouwagi i warstw MLP z połączeniami rezydualnymi. Liczy całą sekwencję naraz i napędza dzisiejsze modele językowe.
- RNN, LSTM czy transformerTransformer najlepiej łączy odległe elementy sekwencji i uczy się równolegle. LSTM sprawdza się przy strumieniach i małej pamięci, zwykła RNN przy krótkich.
- CNN czy transformer (ViT) dla obrazówSieć splotowa ma wbudowane założenia o obrazach i uczy się z mniej licznych danych. Transformer wizyjny jest elastyczniejszy, ale wymaga dużych zbiorów.
- Mieszanka ekspertów (MoE)Mieszanka ekspertów to warstwa z wieloma podsieciami, z których router dla każdego tokenu wybiera tylko kilka. Model ma ogrom parametrów, a liczy niewiele.
- Generatywne sieci przeciwstawne (GAN)GAN to dwie rywalizujące sieci: generator tworzy fałszywe próbki, dyskryminator odróżnia je od prawdziwych. Ten pojedynek uczy generator realizmu.
- Autoenkoder wariacyjny (VAE)VAE koduje dane jako rozkład w małej przestrzeni ukrytej i odtwarza z niego wejście. Kara KL porządkuje tę przestrzeń, więc można z niej losować próbki.
- Modele dyfuzyjneModel dyfuzyjny uczy się usuwać szum z obrazu. Zaczynając od czystego szumu i odszumiając go krok po kroku, tworzy całkiem nowe obrazy.