ML Atlas

09 · Wzmocnienie · 4 min czytania · Interaktywne · aktualizacja

Dlaczego uczenie z nagród potrzebuje więcej danych niż uczenie z etykiet?

W skrócie

Etykieta mówi, co należało zrobić, i daje gradient wprost w tę stronę. Nagroda mówi tylko, czy wybrana akcja była dobra — kierunek trzeba odgadnąć z prób.

Co to jest

Etykieta (uczenie nadzorowane) to poprawna odpowiedź dla przykładu: model dostaje pełną informację o tym, co powinien był zrobić. Nagroda (uczenie ze wzmocnieniem) to ocena jednej akcji, którą model sam wybrał: mówi, czy to konkretne działanie było dobre, ale nie mówi, które byłoby najlepsze.

Różnica w ilości informacji niesionej przez jeden sygnał tłumaczy, dlaczego uczenie ze wzmocnieniem jest mniej wydajne i dlaczego w dużych modelach językowych stosuje się je dopiero po treningu nadzorowanym.

Mechanizm — dlaczego tak działa

Przy etykiecie gradient entropii krzyżowej po logicie każdej klasy wynosi „przewidywane minus prawdziwe”: podnosi prawdopodobieństwo poprawnej odpowiedzi i obniża wszystkie pozostałe naraz, każdą proporcjonalnie do jej obecnej wartości. Jeden przykład niesie informację o całym rozkładzie odpowiedzi.

Przy nagrodzie (gradient polityki, REINFORCE) aktualizacja ma postać: (nagroda − linia bazowa) × gradient log-prawdopodobieństwa wybranej akcji. Pozytywna nagroda podnosi prawdopodobieństwo tej jednej akcji, negatywna je obniża, a pozostałe akcje zmieniają się tylko przez normalizację softmaksu — bez wskazania, która z nich jest właściwa. Model musi tę informację zebrać, próbując innych akcji w podobnych sytuacjach, a każda próba daje jedną liczbę zamiast wektora. Gradient z nagród jest przy tym nieobciążony, ale bardzo szumny; stąd linie bazowe i krytycy w metodach actor-critic.

W wielu zadaniach dochodzi problem przypisania zasługi: nagroda przychodzi po sekwencji decyzji i nie mówi, która z nich była kluczowa. Etykieta przypisuje zasługę natychmiast i dokładnie.

Dlatego pipeline dużego modelu językowego wygląda tak: pretrening i dostrajanie nadzorowane (etykiety to kolejne tokeny i wzorcowe odpowiedzi) budują zdolności, a RLHF — z nagrodą z modelu preferencji — tylko dostraja zachowanie, trzymane blisko modelu bazowego karą KL.

Zastrzeżenie: nagroda ma jedną przewagę — można ją dać tam, gdzie poprawnej odpowiedzi nie da się podać wprost: przy stylu, bezpieczeństwie, wyniku długiej sekwencji decyzji albo rozwiązaniu sprawdzanym automatycznie.

Na przykładzie

Na zbiorze Digits (podział 70/30, random_state=0) trenowaliśmy ten sam liniowy klasyfikator z softmaksem na 10 cyfr, przykład po przykładzie, z tym samym krokiem 0,1 (NumPy, seed 0). W wersji z etykietami model dostawał poprawną cyfrę i krok entropii krzyżowej. W wersji z nagrodami losował cyfrę ze swojego rozkładu i dostawał tylko 1, gdy trafił, albo 0, gdy nie (REINFORCE z ruchomą średnią nagrody jako linią bazową).

Po jednym przejściu przez 1257 przykładów treningowych model z etykietami miał na teście 94,1% trafności, model z nagrodami — 29,4%. Po 20 przejściach: 97,0% wobec 39,6%; po 50 przejściach, czyli ponad 60 tysiącach nagród: 96,9% wobec 59,3%. Te same obrazy, ten sam model — różni się tylko ilość informacji w sygnale.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: Q-learning na planszy 5×5 z dołem i celem: przy α = 0,3, γ = 0,9, ε = 0,1 zachłanna polityka znajduje najkrótszą drogę (8 ruchów) po 33 epizodach, a przy α = 0,05 potrzeba ok. 150–500 epizodów.

Dane: Digits (ręcznie pisane cyfry 8×8)

W praktyce

  • Gdy masz etykiety, użyj ich — RL od zera dla zadania klasyfikacji to marnowanie danych.
  • W RL stosuj linię bazową lub krytyka, by zmniejszyć wariancję gradientu; czysty REINFORCE bywa skrajnie wolny.
  • RLHF i DPO: zbiór preferencji z dziesiątek tysięcy porównań, stosowany po dostrajaniu nadzorowanym na starannych odpowiedziach — kolejność ma znaczenie.
  • Bandyty kontekstowe w rekomendacjach: sygnał to kliknięcie w pokazaną pozycję, nie „najlepsza pozycja”; logowanie prawdopodobieństw wyboru umożliwia uczenie off-policy.
  • Typowy błąd: pytanie „czy model może się tego nauczyć z nagród” bez policzenia, ile prób to będzie kosztować w porównaniu z etykietami.

Najczęstsze pytania

Czym różni się nagroda od etykiety w uczeniu maszynowym?
Etykieta to poprawna odpowiedź — model wie, w którą stronę poprawić wszystkie wyjścia. Nagroda to ocena jednej wybranej akcji — model wie tylko, czy ta akcja była dobra, i musi próbować innych, by znaleźć lepszą. Etykieta niesie o wiele więcej informacji na sygnał.
Dlaczego RLHF stosuje się po uczeniu nadzorowanym, a nie zamiast niego?
Bo uczenie z nagród jest zbyt mało wydajne, by zbudować zdolności od zera: każda nagroda dotyczy jednej odpowiedzi i nie wskazuje lepszej. Model nadzorowany już umie odpowiadać, a RLHF tylko przesuwa go w stronę odpowiedzi preferowanych.
Co to jest problem przypisania zasługi?
Gdy nagroda przychodzi po sekwencji decyzji, nie wiadomo, które z nich na nią zasłużyły. Etykieta nie ma tego problemu, bo ocenia jedną decyzję natychmiast. W RL łagodzą go funkcje wartości, dyskontowanie i metody actor-critic, kosztem dodatkowych prób.

Źródła

  • Sutton, R., Barto, A. (2018). Reinforcement Learning: An Introduction, 2nd ed., MIT Press, rozdz. 1.1 (różnica wobec uczenia nadzorowanego), rozdz. 13 "Policy gradient methods". http://incompleteideas.net/book/the-book-2nd.html
  • Williams, R. J. (1992). "Simple statistical gradient-following algorithms for connectionist reinforcement learning". Machine Learning 8, 229–256.
  • Christiano, P. i in. (2017). "Deep reinforcement learning from human preferences". NeurIPS. arXiv:1706.03741
  • Ouyang, L. i in. (2022). "Training language models to follow instructions with human feedback". NeurIPS. arXiv:2203.02155

Zobacz też