ML Atlas

Dział 07 · 18 haseł

Głębokie architektury

Sieci splotowe, rekurencyjne, uwaga i transformer, osadzenia, transfer learning: konstrukcje, które zmieniły obrazy, dźwięk i tekst.

  1. Splot (konwolucja) InteraktywneSplot przesuwa mały filtr wag po obrazie i w każdym miejscu liczy sumę iloczynów. Ten sam wzorzec wykrywa wszędzie, przy ułamku parametrów warstwy gęstej.
  2. Sieć konwolucyjna (CNN) InteraktywneCNN to sieć zbudowana z warstw splotowych i poolingu, która składa obraz z hierarchii wzorców: od krawędzi, przez fragmenty, po całe obiekty.
  3. Pooling, krok i dopełnienie InteraktywneDopełnienie (padding) chroni brzegi obrazu, krok (stride) przeskakuje pozycje filtra, a pooling streszcza okienka. Razem ustalają rozmiar map cech w CNN.
  4. Połączenia rezydualne (ResNet)Połączenie rezydualne dodaje wejście bloku do jego wyjścia: y = x + F(x). Gradient ma wtedy skrót przez sieć, więc da się trenować setki warstw.
  5. Uczenie transferoweTransfer learning to start treningu z wag modelu wytrenowanego wcześniej, a nie z losowych. Wagi leżą blisko dobrego rozwiązania, więc trzeba mniej danych.
  6. Rekurencyjna sieć neuronowa (RNN)RNN czyta sekwencję krok po kroku i niesie stan ukryty, który streszcza dotychczasową historię. Prosta idea, ale pamięć szybko zanika z każdym krokiem.
  7. LSTM i GRULSTM i GRU to sieci rekurencyjne z bramkami, które decydują, co zapomnieć, co zapisać i co odczytać. Dzięki temu pamiętają informację przez setki kroków.
  8. Mechanizm uwagi (attention) InteraktywneUwaga pozwala modelowi w każdym kroku sięgnąć do dowolnego fragmentu wejścia i wziąć z niego tyle, ile pasuje do bieżącego pytania — średnią ważoną zgodnością.
  9. Samouwaga (self-attention) InteraktywneW samouwadze każdy token tej samej sekwencji tworzy zapytanie, klucz i wartość, a potem zbiera informację od pozostałych tokenów w proporcji do ich zgodności.
  10. Uwaga wielogłowa (multi-head) InteraktywneUwaga wielogłowa uruchamia kilka niezależnych uwag równolegle w mniejszych podprzestrzeniach, więc każdy token może naraz śledzić różne relacje w tekście.
  11. Kodowanie pozycyjneSamouwaga nie widzi kolejności słów, więc transformer dodaje do każdego tokenu sygnał jego pozycji: sinusoidy, uczone wektory albo obrót zapytań i kluczy.
  12. Transformer InteraktywneTransformer to architektura z bloków samouwagi i warstw MLP z połączeniami rezydualnymi. Liczy całą sekwencję naraz i napędza dzisiejsze modele językowe.
  13. RNN, LSTM czy transformerTransformer najlepiej łączy odległe elementy sekwencji i uczy się równolegle. LSTM sprawdza się przy strumieniach i małej pamięci, zwykła RNN przy krótkich.
  14. CNN czy transformer (ViT) dla obrazówSieć splotowa ma wbudowane założenia o obrazach i uczy się z mniej licznych danych. Transformer wizyjny jest elastyczniejszy, ale wymaga dużych zbiorów.
  15. Mieszanka ekspertów (MoE)Mieszanka ekspertów to warstwa z wieloma podsieciami, z których router dla każdego tokenu wybiera tylko kilka. Model ma ogrom parametrów, a liczy niewiele.
  16. Generatywne sieci przeciwstawne (GAN)GAN to dwie rywalizujące sieci: generator tworzy fałszywe próbki, dyskryminator odróżnia je od prawdziwych. Ten pojedynek uczy generator realizmu.
  17. Autoenkoder wariacyjny (VAE)VAE koduje dane jako rozkład w małej przestrzeni ukrytej i odtwarza z niego wejście. Kara KL porządkuje tę przestrzeń, więc można z niej losować próbki.
  18. Modele dyfuzyjneModel dyfuzyjny uczy się usuwać szum z obrazu. Zaczynając od czystego szumu i odszumiając go krok po kroku, tworzy całkiem nowe obrazy.

Inne działy

01 Podstawy02 Dane03 Nadzorowane04 Ocena05 Bez nadzoru06 Sieci08 LLM09 Wzmocnienie10 Praktyka11 Prawa i prawdy