09 · Wzmocnienie · 4 min czytania · Interaktywne · aktualizacja
Czym jest uczenie ze wzmocnieniem i po co agentowi eksploracja?
W skrócie
Uczenie ze wzmocnieniem to uczenie z nagród za własne działania, bez podanej poprawnej odpowiedzi. Agent zna tylko skutki swoich akcji, więc musi próbować.
Co to jest
Uczenie ze wzmocnieniem (reinforcement learning, RL) to paradygmat, w którym agent wybiera akcje w środowisku i dostaje za nie nagrody, a jego celem jest polityka maksymalizująca sumę nagród w czasie. Nikt nie mówi agentowi, co było poprawne — dowiaduje się tylko, ile dostał.
Eksploracja to celowe próbowanie akcji innych niż obecnie najlepsza, by sprawdzić, czy nie są lepsze; eksploatacja to wybieranie najlepszej znanej. Dobre zachowanie wymaga obu naraz.
RL stoi za systemem AlphaGo, za sterowaniem robotami, systemami rekomendacji i za końcowym etapem treningu dużych modeli językowych (RLHF).
Mechanizm — dlaczego tak działa
Kluczowa różnica wobec uczenia nadzorowanego: sygnał dotyczy tylko akcji, którą agent sam wybrał. Agent, który wybrał akcję A i dostał słabą nagrodę, wie, że A była w tej sytuacji słaba — nie wie, co byłoby dobre. Akcji, której nigdy nie spróbował, nie umie ocenić wcale.
Polityka zachłanna (zawsze najlepsza znana akcja) utrwala więc własne nawyki. Akcja raz oceniona nisko — choćby przez pech w pierwszej próbie — nie dostanie drugiej szansy, więc jej zaniżona ocena nigdy się nie poprawi. To błędne koło samo się nie przerywa.
Eksploracja je przerywa. Najprostsza strategia, ε-zachłanna: z prawdopodobieństwem ε (np. 0,1) wybierz akcję losową, w pozostałych przypadkach najlepszą. Każda akcja jest wtedy próbowana dowolnie wiele razy, więc jej ocena zbiega do prawdziwej wartości. Bardziej wyrafinowane metody to premia za niepewność (UCB — rzadko próbowane akcje dostają bonus), próbkowanie Thompsona, a w głębokim RL „ciekawość”: wewnętrzna nagroda za trafienie do stanów, których agent nie umie przewidzieć (Pathak i in. 2017).
Dylemat eksploracja–eksploatacja nie ma darmowego rozwiązania: każda próba nowej akcji kosztuje potencjalnie gorszą nagrodę teraz, w zamian za lepszą informację na przyszłość. W teorii wielorękich bandytów najlepsze możliwe strategie mają żal (stratę względem zawsze najlepszej akcji) rosnący jak logarytm liczby prób (Lai i Robbins 1985) — tyle eksploracji trzeba i tyle wystarcza.
Zastrzeżenie: RL jest o rzędy wielkości mniej wydajne od uczenia nadzorowanego pod względem liczby sygnałów, bo każda nagroda dotyczy jednej próby i nie wskazuje kierunku poprawy. Tam, gdzie etykiety istnieją, używa się etykiet; RL wchodzi tam, gdzie ich nie ma albo gdzie liczy się skutek całej sekwencji decyzji.
Na przykładzie
Klasyczny test z podręcznika Suttona i Barto: dziesięciu „jednorękich bandytów”, każdy o nieznanej średniej nagrodzie wylosowanej z rozkładu normalnego N(0, 1); pojedyncza wypłata to ta średnia plus szum N(0, 1). Zasymulowaliśmy w Pythonie (NumPy, seed 0) 2000 niezależnych zadań po 1000 kroków; oceny akcji startują od zera i są średnią z otrzymanych nagród.
Agent zachłanny (ε = 0) w krokach 901–1000 wybierał najlepszą rękę tylko w 37% przypadków, ze średnią nagrodą 1,04. Średnio 6,7 z 10 rąk nie spróbował ani razu: pierwsza ręka, która dała dodatnią wypłatę, wygrywała na zawsze. Agent ε-zachłanny z ε = 0,01 trafiał najlepszą rękę w 61% kroków (nagroda 1,30), a z ε = 0,1 — w 79% (nagroda 1,36), choć co dziesiąty ruch oddawał losowi. Odrobina eksploracji opłaca się bardziej, niż kosztuje.
W praktyce
- Biblioteki: Gymnasium (środowiska), Stable-Baselines3 (
PPO,DQN,SAC); w DQN standardem jest ε malejące od 1,0 do ok. 0,05. - RLHF w LLM: model nagrody uczony z porównań ludzi, potem PPO na polityce — eksploracja jest ograniczona karą KL od modelu bazowego; DPO omija jawny model nagrody.
- Rekomendacje i reklamy: bandyty kontekstowe; brak eksploracji oznacza, że nowe pozycje nigdy nie dostaną szansy.
- Mierz zwrot na wielu seedach — RL ma ogromną wariancję między uruchomieniami (Henderson i in. 2018).
- Typowy błąd: ε = 0 „bo model już wie” — polityka zamiera w nawyku z pierwszych epizodów.
Najczęstsze pytania
- Czym różni się uczenie ze wzmocnieniem od uczenia nadzorowanego?
- Uczenie nadzorowane dostaje dla każdego przykładu poprawną odpowiedź i gradient wprost w jej stronę. RL dostaje tylko nagrodę za akcję, którą agent sam wybrał, bez informacji, co byłoby lepsze, i musi to odkryć próbami. Stąd potrzeba eksploracji i dużo większy apetyt na dane.
- Co to jest dylemat eksploracji i eksploatacji?
- Wybór między akcją najlepszą według obecnej wiedzy (eksploatacja) a akcją niepewną, która może okazać się lepsza (eksploracja). Za mało eksploracji utrwala złe nawyki, za dużo marnuje nagrody. Typowe strategie: ε-zachłanna, UCB, próbkowanie Thompsona.
- Czy duże modele językowe uczą się przez uczenie ze wzmocnieniem?
- Częściowo. Pretrening i dostrajanie na instrukcjach to uczenie nadzorowane (przewidywanie tokenów). Dopiero późny etap — RLHF lub pokrewne metody — używa preferencji ludzi albo automatycznych weryfikatorów jako nagrody. RL stosuje się po etapie nadzorowanym, bo od zera byłoby zbyt mało wydajne.
Źródła
- Sutton, R., Barto, A. (2018). Reinforcement Learning: An Introduction, 2nd ed., MIT Press, rozdz. 1 "Introduction", rozdz. 2 "Multi-armed bandits" (ε-greedy, UCB, testbed z 10 rękami). http://incompleteideas.net/book/the-book-2nd.html
- Lai, T. L., Robbins, H. (1985). "Asymptotically efficient adaptive allocation rules". Advances in Applied Mathematics 6(1), 4–22.
- Pathak, D., Agrawal, P., Efros, A., Darrell, T. (2017). "Curiosity-driven exploration by self-supervised prediction". ICML. arXiv:1705.05363
- Mnih, V. i in. (2015). "Human-level control through deep reinforcement learning". Nature 518, 529–533.
- Henderson, P. i in. (2018). "Deep reinforcement learning that matters". AAAI. arXiv:1709.06560