ML Atlas

09 · Wzmocnienie · 4 min czytania · Interaktywne · aktualizacja

Czym jest uczenie ze wzmocnieniem i po co agentowi eksploracja?

W skrócie

Uczenie ze wzmocnieniem to uczenie z nagród za własne działania, bez podanej poprawnej odpowiedzi. Agent zna tylko skutki swoich akcji, więc musi próbować.

Co to jest

Uczenie ze wzmocnieniem (reinforcement learning, RL) to paradygmat, w którym agent wybiera akcje w środowisku i dostaje za nie nagrody, a jego celem jest polityka maksymalizująca sumę nagród w czasie. Nikt nie mówi agentowi, co było poprawne — dowiaduje się tylko, ile dostał.

Eksploracja to celowe próbowanie akcji innych niż obecnie najlepsza, by sprawdzić, czy nie są lepsze; eksploatacja to wybieranie najlepszej znanej. Dobre zachowanie wymaga obu naraz.

RL stoi za systemem AlphaGo, za sterowaniem robotami, systemami rekomendacji i za końcowym etapem treningu dużych modeli językowych (RLHF).

Mechanizm — dlaczego tak działa

Kluczowa różnica wobec uczenia nadzorowanego: sygnał dotyczy tylko akcji, którą agent sam wybrał. Agent, który wybrał akcję A i dostał słabą nagrodę, wie, że A była w tej sytuacji słaba — nie wie, co byłoby dobre. Akcji, której nigdy nie spróbował, nie umie ocenić wcale.

Polityka zachłanna (zawsze najlepsza znana akcja) utrwala więc własne nawyki. Akcja raz oceniona nisko — choćby przez pech w pierwszej próbie — nie dostanie drugiej szansy, więc jej zaniżona ocena nigdy się nie poprawi. To błędne koło samo się nie przerywa.

Eksploracja je przerywa. Najprostsza strategia, ε-zachłanna: z prawdopodobieństwem ε (np. 0,1) wybierz akcję losową, w pozostałych przypadkach najlepszą. Każda akcja jest wtedy próbowana dowolnie wiele razy, więc jej ocena zbiega do prawdziwej wartości. Bardziej wyrafinowane metody to premia za niepewność (UCB — rzadko próbowane akcje dostają bonus), próbkowanie Thompsona, a w głębokim RL „ciekawość”: wewnętrzna nagroda za trafienie do stanów, których agent nie umie przewidzieć (Pathak i in. 2017).

Dylemat eksploracja–eksploatacja nie ma darmowego rozwiązania: każda próba nowej akcji kosztuje potencjalnie gorszą nagrodę teraz, w zamian za lepszą informację na przyszłość. W teorii wielorękich bandytów najlepsze możliwe strategie mają żal (stratę względem zawsze najlepszej akcji) rosnący jak logarytm liczby prób (Lai i Robbins 1985) — tyle eksploracji trzeba i tyle wystarcza.

Zastrzeżenie: RL jest o rzędy wielkości mniej wydajne od uczenia nadzorowanego pod względem liczby sygnałów, bo każda nagroda dotyczy jednej próby i nie wskazuje kierunku poprawy. Tam, gdzie etykiety istnieją, używa się etykiet; RL wchodzi tam, gdzie ich nie ma albo gdzie liczy się skutek całej sekwencji decyzji.

Na przykładzie

Klasyczny test z podręcznika Suttona i Barto: dziesięciu „jednorękich bandytów”, każdy o nieznanej średniej nagrodzie wylosowanej z rozkładu normalnego N(0, 1); pojedyncza wypłata to ta średnia plus szum N(0, 1). Zasymulowaliśmy w Pythonie (NumPy, seed 0) 2000 niezależnych zadań po 1000 kroków; oceny akcji startują od zera i są średnią z otrzymanych nagród.

Agent zachłanny (ε = 0) w krokach 901–1000 wybierał najlepszą rękę tylko w 37% przypadków, ze średnią nagrodą 1,04. Średnio 6,7 z 10 rąk nie spróbował ani razu: pierwsza ręka, która dała dodatnią wypłatę, wygrywała na zawsze. Agent ε-zachłanny z ε = 0,01 trafiał najlepszą rękę w 61% kroków (nagroda 1,30), a z ε = 0,1 — w 79% (nagroda 1,36), choć co dziesiąty ruch oddawał losowi. Odrobina eksploracji opłaca się bardziej, niż kosztuje.

Ta ilustracja działa w przeglądarce z włączonym JavaScriptem: Q-learning na planszy 5×5 z dołem i celem: przy α = 0,3, γ = 0,9, ε = 0,1 zachłanna polityka znajduje najkrótszą drogę (8 ruchów) po 33 epizodach, a przy α = 0,05 potrzeba ok. 150–500 epizodów.

W praktyce

  • Biblioteki: Gymnasium (środowiska), Stable-Baselines3 (PPO, DQN, SAC); w DQN standardem jest ε malejące od 1,0 do ok. 0,05.
  • RLHF w LLM: model nagrody uczony z porównań ludzi, potem PPO na polityce — eksploracja jest ograniczona karą KL od modelu bazowego; DPO omija jawny model nagrody.
  • Rekomendacje i reklamy: bandyty kontekstowe; brak eksploracji oznacza, że nowe pozycje nigdy nie dostaną szansy.
  • Mierz zwrot na wielu seedach — RL ma ogromną wariancję między uruchomieniami (Henderson i in. 2018).
  • Typowy błąd: ε = 0 „bo model już wie” — polityka zamiera w nawyku z pierwszych epizodów.

Najczęstsze pytania

Czym różni się uczenie ze wzmocnieniem od uczenia nadzorowanego?
Uczenie nadzorowane dostaje dla każdego przykładu poprawną odpowiedź i gradient wprost w jej stronę. RL dostaje tylko nagrodę za akcję, którą agent sam wybrał, bez informacji, co byłoby lepsze, i musi to odkryć próbami. Stąd potrzeba eksploracji i dużo większy apetyt na dane.
Co to jest dylemat eksploracji i eksploatacji?
Wybór między akcją najlepszą według obecnej wiedzy (eksploatacja) a akcją niepewną, która może okazać się lepsza (eksploracja). Za mało eksploracji utrwala złe nawyki, za dużo marnuje nagrody. Typowe strategie: ε-zachłanna, UCB, próbkowanie Thompsona.
Czy duże modele językowe uczą się przez uczenie ze wzmocnieniem?
Częściowo. Pretrening i dostrajanie na instrukcjach to uczenie nadzorowane (przewidywanie tokenów). Dopiero późny etap — RLHF lub pokrewne metody — używa preferencji ludzi albo automatycznych weryfikatorów jako nagrody. RL stosuje się po etapie nadzorowanym, bo od zera byłoby zbyt mało wydajne.

Źródła

  • Sutton, R., Barto, A. (2018). Reinforcement Learning: An Introduction, 2nd ed., MIT Press, rozdz. 1 "Introduction", rozdz. 2 "Multi-armed bandits" (ε-greedy, UCB, testbed z 10 rękami). http://incompleteideas.net/book/the-book-2nd.html
  • Lai, T. L., Robbins, H. (1985). "Asymptotically efficient adaptive allocation rules". Advances in Applied Mathematics 6(1), 4–22.
  • Pathak, D., Agrawal, P., Efros, A., Darrell, T. (2017). "Curiosity-driven exploration by self-supervised prediction". ICML. arXiv:1705.05363
  • Mnih, V. i in. (2015). "Human-level control through deep reinforcement learning". Nature 518, 529–533.
  • Henderson, P. i in. (2018). "Deep reinforcement learning that matters". AAAI. arXiv:1709.06560

Zobacz też